跳转到主要内容

标签: 故障复盘

  • 华为云国际站异常:与 IAM 升级有关?

    冯若航 发布于 云计算 2020 字 5 分钟

    冯若航云计算故障复盘

    华为云国际站异常:与 IAM 升级有关?

    2026 年 7 月 26 日 02:49(北京时间),华为云官方通知称,国际站部分账号出现异常,影响了相关服务的访问。华为云随后将通知标记为“已恢复”,并表示受影响账号已经恢复、国际站服务正常运行且数据安全;通知没有披露具体恢复时间与根因。 第三方监控平台 StatusGator 从 03:32 起出现密集的用户报障信号。按本文当时采集的页面数据,24 小时内累计提交量超过 450;08:15 的截图显示为 482 条。报告来自阿根廷、土耳其、巴西、埃及、泰国、墨西哥、智利等多个国际站市场。 …

    2026 年 7 月 26 日 02:49(北京时间),华为云官方通知称,国际站部分账号出现异常,影响了相关服务的访问。华为云随后将通知标记为“已恢复”,并表示受影响账号已经恢复、国际站服务正常运行且数据安全;通知没有披露具体恢复时间与根因。 第三方监控平台 StatusGator 从 03:32 起出现密集的用户报障信号。按本文当时采集的页面数据,24 小时内累计提交量超过 450;08:15 的截图显示为 482 条。报告来自阿根廷、土耳其、巴西、埃及、泰国、墨西哥、智利等多个国际站市场。 …

  • 当 AI 获得瘫痪一座城市交通的权力

    冯若航 发布于 云计算 3882 字 8 分钟

    冯若航AI故障复盘社会观察

    当 AI 获得瘫痪一座城市交通的权力

    3 月 31 日晚,武汉萝卜快跑车队出现大规模同时故障。真正值得警惕的,不只是自动驾驶翻车本身,而是云端集中管控架构可能把单车故障放大成城市级系统性风险。 昨晚武汉发生了什么 3 月 31 日晚,百度旗下萝卜快跑无人驾驶出租车在武汉发生大规模系统故障。据 快科技报道,多名司机和乘客在社交平台发布视频显示,当晚武汉多辆萝卜快跑在行驶过程中突然停下。 截至本文写作时,武汉交警通报称,事件初步判断为系统故障,乘客均已安全下车,无人员受伤,具体原因仍在进一步调查。下文的技术判断,基于公开信息与行业常识 …

    3 月 31 日晚,武汉萝卜快跑车队出现大规模同时故障。真正值得警惕的,不只是自动驾驶翻车本身,而是云端集中管控架构可能把单车故障放大成城市级系统性风险。 昨晚武汉发生了什么 3 月 31 日晚,百度旗下萝卜快跑无人驾驶出租车在武汉发生大规模系统故障。据 快科技报道,多名司机和乘客在社交平台发布视频显示,当晚武汉多辆萝卜快跑在行驶过程中突然停下。 截至本文写作时,武汉交警通报称,事件初步判断为系统故障,乘客均已安全下车,无人员受伤,具体原因仍在进一步调查。下文的技术判断,基于公开信息与行业常识 …

  • 无人机炸了三个AWS可用区:云计算进入战争时代

    冯若航 发布于 云计算 1906 字 4 分钟

    冯若航下云AWS故障复盘

    无人机炸了三个AWS可用区:云计算进入战争时代

    2026 年 3 月 1 日,伊朗无人机击中 AWS 阿联酋与巴林数据中心。这可能是公开报道中第一次有大型云厂商的数据中心遭到军事打击并瘫痪。以前可能有人觉得战争离软件工程很远,现在看,只隔着一层机柜门。 发生了什么? 2026年3月1日,中东冲突升级后,伊朗对阿联酋和巴林境内的多个目标实施了无人机/导弹打击,并对美国在中东资产展开报复。 在这波打击中,AWS位于阿联酋和巴林的数据中心被无人机直接命中。是的,不是断电,不是光缆被挖,不是空调故障,是 无人机物理命中了数据中心建筑,引发了火灾和结构 …

    2026 年 3 月 1 日,伊朗无人机击中 AWS 阿联酋与巴林数据中心。这可能是公开报道中第一次有大型云厂商的数据中心遭到军事打击并瘫痪。以前可能有人觉得战争离软件工程很远,现在看,只隔着一层机柜门。 发生了什么? 2026年3月1日,中东冲突升级后,伊朗对阿联酋和巴林境内的多个目标实施了无人机/导弹打击,并对美国在中东资产展开报复。 在这波打击中,AWS位于阿联酋和巴林的数据中心被无人机直接命中。是的,不是断电,不是光缆被挖,不是空调故障,是 无人机物理命中了数据中心建筑,引发了火灾和结构 …

  • Claude 全球大宕机复盘:导弹还是成功税?

    冯若航 发布于 云计算 3690 字 8 分钟

    冯若航AIClaude故障复盘

    Claude 全球大宕机复盘:导弹还是成功税?

    北京时间 3 月 2 日晚 19:49,Claude 崩了。 截止到本文发出时(次日 16:24),网页端仍然没有完全恢复。 网页版弹出“Claude is currently experiencing a temporary service disruption”,客户端登录失败,Console 报 500 错误。高峰时近 2000 名用户同时报障。消息迅速传开,社交媒体上一片哀嚎。 与此同时,另一条新闻正在刷屏:伊朗无人机炸了 AWS 在阿联酋的数据中心。 两件事撞到一起,一个极具戏剧性的叙 …

    北京时间 3 月 2 日晚 19:49,Claude 崩了。 截止到本文发出时(次日 16:24),网页端仍然没有完全恢复。 网页版弹出“Claude is currently experiencing a temporary service disruption”,客户端登录失败,Console 报 500 错误。高峰时近 2000 名用户同时报障。消息迅速传开,社交媒体上一片哀嚎。 与此同时,另一条新闻正在刷屏:伊朗无人机炸了 AWS 在阿联酋的数据中心。 两件事撞到一起,一个极具戏剧性的叙 …

  • 深入解析:元旦当天华为高斯数据库BUG,搞摊中国银行APP

    VAGE 发布于 数据库 2756 字 6 分钟

    VAGE国产数据库PostgreSQL故障复盘

    深入解析:元旦当天华为高斯数据库BUG,搞摊中国银行APP

    原作者:VAGE 2026,1 月 1 日元旦当天,中国银行 APP 故障: 故障原因,先有消息说因为连接池满、无法与数据库建立新的连接导致。 但进一步暴漏的信息,这里的“连接池”是数据库内的线程池 BUG,导致上层应用无法和数据库建立连接,问题直指 GaussDB。 现场曾重启数据库、华为的相关人员也介入解决问题,但故障依久,最终故障持续了超过 1 个小时,才恢复正常。 我对故障具体细节并不关心,去年(2025 年)金融行业 IT 基础设施问题频发,四大行有两家都未能幸免(工行与中行),支付 …

    原作者:VAGE 2026,1 月 1 日元旦当天,中国银行 APP 故障: 故障原因,先有消息说因为连接池满、无法与数据库建立新的连接导致。 但进一步暴漏的信息,这里的“连接池”是数据库内的线程池 BUG,导致上层应用无法和数据库建立连接,问题直指 GaussDB。 现场曾重启数据库、华为的相关人员也介入解决问题,但故障依久,最终故障持续了超过 1 个小时,才恢复正常。 我对故障具体细节并不关心,去年(2025 年)金融行业 IT 基础设施问题频发,四大行有两家都未能幸免(工行与中行),支付 …

  • 支付宝淘宝闲鱼崩了?又是消息队列的锅?

    冯若航 发布于 云计算 2115 字 5 分钟

    冯若航下云阿里云故障复盘

    支付宝淘宝闲鱼崩了?又是消息队列的锅?

    2025 年 12 月 4 日晚,淘宝、支付宝、闲鱼集体崩了,用户钱扣了订单却显示未支付,症状与 2024 年双十一支付宝故障类似,推测根因可能是消息队列或分布式事务协调问题。 截止至本文发出,阿里巴巴截至发稿仍未公布任何技术原因说明。本文基于公开信息和技术原理分析,推测部分仅供参考。 发生了什么 2025 年 12 月 4 日晚 21 点左右,淘宝、支付宝、闲鱼集体崩了。 用户付完钱,订单还显示"待付款";手一抖多点几下,同一笔订单扣了好几遍。 闲鱼客服排队 9000+人,微博热搜前十被"淘宝 …

    2025 年 12 月 4 日晚,淘宝、支付宝、闲鱼集体崩了,用户钱扣了订单却显示未支付,症状与 2024 年双十一支付宝故障类似,推测根因可能是消息队列或分布式事务协调问题。 截止至本文发出,阿里巴巴截至发稿仍未公布任何技术原因说明。本文基于公开信息和技术原理分析,推测部分仅供参考。 发生了什么 2025 年 12 月 4 日晚 21 点左右,淘宝、支付宝、闲鱼集体崩了。 用户付完钱,订单还显示"待付款";手一抖多点几下,同一笔订单扣了好几遍。 闲鱼客服排队 9000+人,微博热搜前十被"淘宝 …

  • 原地报废:不要在生产环境用Docker跑PostgreSQL!

    冯若航 发布于 数据库 5745 字 12 分钟

    冯若航PostgreSQL容器化故障复盘

    原地报废:不要在生产环境用Docker跑PostgreSQL!

    早在 2019 年,老冯就在《把数据库放入 Docker 中是一个好主意吗?》提到过 —— 不要在生产环境用容器运行 PostgreSQL 数据库,因为你有极大概率会遇上一堆在物理机/虚拟机上根本不存在的麻烦与问题。 这不,最近用 Docker “官方” 的 Postgres 镜像的用户在升级的时候就踩雷了。 昨天 PostgreSQL 社区的老法师 Gwen Shapira 在 X 发了个帖子吐槽了这个事。 ⚠️重要提醒:不要在生产环境用 Docker 官方的 Postgres 镜像。 如果非 …

    早在 2019 年,老冯就在《把数据库放入 Docker 中是一个好主意吗?》提到过 —— 不要在生产环境用容器运行 PostgreSQL 数据库,因为你有极大概率会遇上一堆在物理机/虚拟机上根本不存在的麻烦与问题。 这不,最近用 Docker “官方” 的 Postgres 镜像的用户在升级的时候就踩雷了。 昨天 PostgreSQL 社区的老法师 Gwen Shapira 在 X 发了个帖子吐槽了这个事。 ⚠️重要提醒:不要在生产环境用 Docker 官方的 Postgres 镜像。 如果非 …

  • Cloudflare 11-18 故障复盘报告

    冯若航 发布于 云计算 7679 字 16 分钟

    冯若航Cloudflare故障复盘

    Cloudflare 11-18 故障复盘报告

    就在昨天,有 “赛博佛祖” 之称的 Cloudflare 遭遇自 2019 年以来的最严重故障 —— 正常的核心网络流量无法传输,长达六个小时。 ChatGPT、X(前 Twitter)、Spotify、Uber 等知名服务悉数中招。 故障的根因是修改了 ClickHouse 的权限,导致生成的反爬特征太大(200条),撑爆了 Rust 写的 Bot管理软件的硬编码限制,导致大量流量被标记为爬虫而被阻断。 Cloudflare 团队今天早上在其博客发布了故障复盘文章,老冯将其翻译为中文,并附上点 …

    就在昨天,有 “赛博佛祖” 之称的 Cloudflare 遭遇自 2019 年以来的最严重故障 —— 正常的核心网络流量无法传输,长达六个小时。 ChatGPT、X(前 Twitter)、Spotify、Uber 等知名服务悉数中招。 故障的根因是修改了 ClickHouse 的权限,导致生成的反爬特征太大(200条),撑爆了 Rust 写的 Bot管理软件的硬编码限制,导致大量流量被标记为爬虫而被阻断。 Cloudflare 团队今天早上在其博客发布了故障复盘文章,老冯将其翻译为中文,并附上点 …

  • 云厂商需要有人管起来,CloudFlare又宕机了

    瑞典马工 发布于 云计算 1584 字 4 分钟

    瑞典马工云计算故障复盘软件工程

    云厂商需要有人管起来,CloudFlare又宕机了

    原作者:瑞典马工 最近这些天,云厂家一家接一家的宕机。今天轮到 CloudFlare 挂掉,导致全球 10% 以上的网站不可访问。 这个故障,不用等到厂家发布事后分析报告,无非就是又一个工程师在设计或者操作的时候考虑不周全,导致系统有个漏洞,突然爆发了。 脱离我们的行业惯例,用外部视角看,这是一种不可思议的现象:一两个普通的工程师的某一两个决策,导致全球上百万的工程师要应对,上亿的用户日常生活被影响到。 如果一个医生手抖一下,全国一半的病人要集体痛五个小时,或者一个控制塔管制员溜了一下神,半个 …

    原作者:瑞典马工 最近这些天,云厂家一家接一家的宕机。今天轮到 CloudFlare 挂掉,导致全球 10% 以上的网站不可访问。 这个故障,不用等到厂家发布事后分析报告,无非就是又一个工程师在设计或者操作的时候考虑不周全,导致系统有个漏洞,突然爆发了。 脱离我们的行业惯例,用外部视角看,这是一种不可思议的现象:一两个普通的工程师的某一两个决策,导致全球上百万的工程师要应对,上亿的用户日常生活被影响到。 如果一个医生手抖一下,全国一半的病人要集体痛五个小时,或者一个控制塔管制员溜了一下神,半个 …

  • 百度云:261KB流量,收费两千万

    冯若航 发布于 云计算 917 字 2 分钟

    冯若航云计算成本故障复盘

    百度云:261KB流量,收费两千万

    今天有群里有人分享一个有趣的 Case,有位开发者在百度云对象存储上存了几百兆数据,261.8KB 的下载流量,被收费了 20374385.48 ¥。 当然最滑稽的是,还有一个 “确认状态” —— “已确认”,讲真,但凡有一点儿人工 “确认” 的成分,都不至于让这么离谱的账单出现并发给用户。 而且,这个情况看起来并非个例,还有一位站长今天早上八点发了自己收到的百度云 —— 四千五百万账单,以及一条停机提醒。 “您的对象存储服务已停机,账务欠费后,数据将于 15 天后删除,删除后无法恢复”。 老冯 …

    今天有群里有人分享一个有趣的 Case,有位开发者在百度云对象存储上存了几百兆数据,261.8KB 的下载流量,被收费了 20374385.48 ¥。 当然最滑稽的是,还有一个 “确认状态” —— “已确认”,讲真,但凡有一点儿人工 “确认” 的成分,都不至于让这么离谱的账单出现并发给用户。 而且,这个情况看起来并非个例,还有一位站长今天早上八点发了自己收到的百度云 —— 四千五百万账单,以及一条停机提醒。 “您的对象存储服务已停机,账务欠费后,数据将于 15 天后删除,删除后无法恢复”。 老冯 …

  • AWS 故障官方复盘报告

    冯若航 发布于 云计算 9233 字 19 分钟

    冯若航下云AWS故障复盘

    AWS 故障官方复盘报告

    今天 AWS 官方发布了 10-20 日美东大故障 的事后复盘报告,细节比较丰富,算是少有的第一手现场资料。所以老冯把它翻译成了中文,并附上解读与评论,供大家参考。 故障公告:https://aws.amazon.com/cn/message/101925/ Amazon DynamoDB 服务中断总结 我们希望就2025年10月19日至20日发生在美国东部弗吉尼亚北部(us-east-1)区域的服务中断事件向您提供一些补充信息。 此次事件始于10月19日 PDT23:48,结束于10月20日 …

    今天 AWS 官方发布了 10-20 日美东大故障 的事后复盘报告,细节比较丰富,算是少有的第一手现场资料。所以老冯把它翻译成了中文,并附上解读与评论,供大家参考。 故障公告:https://aws.amazon.com/cn/message/101925/ Amazon DynamoDB 服务中断总结 我们希望就2025年10月19日至20日发生在美国东部弗吉尼亚北部(us-east-1)区域的服务中断事件向您提供一些补充信息。 此次事件始于10月19日 PDT23:48,结束于10月20日 …

  • 一次AWS DNS故障如何级联瘫痪半个互联网

    冯若航 发布于 云计算 8378 字 17 分钟

    冯若航下云AWS故障复盘

    一次AWS DNS故障如何级联瘫痪半个互联网

    2025 年 10 月 20 日,AWS 最关键的 us-east-1 区域发生了一场持续 15 小时的重大故障,导致全球超过 1000 家企业服务中断。 而这场故障背后的根因,竟然仅仅是一条 AWS 内部 DNS 解析失效。 从凌晨的 DNS 解析失效开始,AWS DynamoDB、EC2、Lambda 等 142 项服务相继受到影响,进而导致全球互联网的大部分功能停转。 Snapchat、Roblox、Coinbase、Signal、Reddit、Robinhood 等热门应用离线,数十亿美 …

    2025 年 10 月 20 日,AWS 最关键的 us-east-1 区域发生了一场持续 15 小时的重大故障,导致全球超过 1000 家企业服务中断。 而这场故障背后的根因,竟然仅仅是一条 AWS 内部 DNS 解析失效。 从凌晨的 DNS 解析失效开始,AWS DynamoDB、EC2、Lambda 等 142 项服务相继受到影响,进而导致全球互联网的大部分功能停转。 Snapchat、Roblox、Coinbase、Signal、Reddit、Robinhood 等热门应用离线,数十亿美 …

  • 知乎挂了:证书问题还是CDN翻车?

    冯若航 发布于 云计算 675 字 2 分钟

    冯若航云计算故障复盘

    知乎挂了:证书问题还是CDN翻车?

    就在刚刚,知乎崩了,大量网友反馈打不开网页端。疑似因为 HTTPS 证书问题导致 CDN 回源失败。 报错信息显示,来知乎用的是腾讯 EdgeOne CDN,错误码 525。 EdgeOne 自定义 525 错误码的解释是:EdgeOne 自定义的状态码。若回源协议为 HTTPS,则节点回源时需要与源站进行 SSL 握手,若握手失败,则节点响应客户端 525 状态码。 参考来源:《EdgeOne 4XX/5XX 状态码排障指南 …

    就在刚刚,知乎崩了,大量网友反馈打不开网页端。疑似因为 HTTPS 证书问题导致 CDN 回源失败。 报错信息显示,来知乎用的是腾讯 EdgeOne CDN,错误码 525。 EdgeOne 自定义 525 错误码的解释是:EdgeOne 自定义的状态码。若回源协议为 HTTPS,则节点回源时需要与源站进行 SSL 握手,若握手失败,则节点响应客户端 525 状态码。 参考来源:《EdgeOne 4XX/5XX 状态码排障指南 …

  • 尝鲜须谨慎:PG新存储引擎故障案例

    冯若航 发布于 PGSQL 2144 字 5 分钟

    冯若航PostgreSQL扩展故障复盘

    尝鲜须谨慎:PG新存储引擎故障案例

    昨天接到一个咨询的活儿,有位 Pigsty 的用户反馈数据库故障,出现 XID Wraparound 了。这个 PG 中最臭名昭著的故障在近些年已经比较少见了,不过这次的故障原因确实比较有趣,是因为使用了 TimescaleDB Hypercore 导致的 —— 这是一个实验性的新存储引擎,并且已经在最近的版本中弃用与移除。 如果你正在使用这个新的存储引擎,最好立刻检查并退回经典的 TimescaleDB 引擎与 PostgreSQL 原生表,以免数据库爆炸。 Hypercore 是什么 …

    昨天接到一个咨询的活儿,有位 Pigsty 的用户反馈数据库故障,出现 XID Wraparound 了。这个 PG 中最臭名昭著的故障在近些年已经比较少见了,不过这次的故障原因确实比较有趣,是因为使用了 TimescaleDB Hypercore 导致的 —— 这是一个实验性的新存储引擎,并且已经在最近的版本中弃用与移除。 如果你正在使用这个新的存储引擎,最好立刻检查并退回经典的 TimescaleDB 引擎与 PostgreSQL 原生表,以免数据库爆炸。 Hypercore 是什么 …

  • 接连两天,联通崩完移动崩

    冯若航 发布于 云计算 238 字 1 分钟

    冯若航云计算故障复盘

    接连两天,联通崩完移动崩

    2025 年 08 月 13 日 0:44,阿里云监测发现北京移动网络访问阿里云云服务出现异常,初步确认异常与运营商有关,已紧急向运营商报障处理。 10:03 分通告:经过紧急处理受影响服务已全部恢复。 无独有偶,就在昨天,多地联通用户(以北京为主),也反馈联通网络出现崩溃,部分网站和 APP 无法访问。(网传联通 DNS 把许多网站的域名解析到 127.0.0.2 本地地址去了)。 这世上没有不崩的神话,联通崩完移动崩,这下压力给到电信了。 PS:友情提醒,阿里云六月份两次大故障 SLA 赔付 …

    2025 年 08 月 13 日 0:44,阿里云监测发现北京移动网络访问阿里云云服务出现异常,初步确认异常与运营商有关,已紧急向运营商报障处理。 10:03 分通告:经过紧急处理受影响服务已全部恢复。 无独有偶,就在昨天,多地联通用户(以北京为主),也反馈联通网络出现崩溃,部分网站和 APP 无法访问。(网传联通 DNS 把许多网站的域名解析到 127.0.0.2 本地地址去了)。 这世上没有不崩的神话,联通崩完移动崩,这下压力给到电信了。 PS:友情提醒,阿里云六月份两次大故障 SLA 赔付 …

  • 阿里云故障,CDN挂了,记得申请SLA赔付

    冯若航 发布于 云计算 703 字 2 分钟

    冯若航云计算阿里云故障复盘

    阿里云故障,CDN挂了,记得申请SLA赔付

    根据阿里云 Status Page 显示:北京时间 2025 年 06 月 26 日 11:07,阿里云监控发现视频直播、视频点播、CDN、DCDN 等产品服务出现异常,于当日 11:44 异常节点已下线,受影响产品陆续恢复中。12:28 受影响云产品已全部恢复。 根据阿里云 CDN SLA https://help.aliyun.com/zh/cdn/support/alibaba-cloud-cdn-sla 页面的说明,本次故障持续时间 81 分钟,占月度总时长 43200 的 0.18%, …

    根据阿里云 Status Page 显示:北京时间 2025 年 06 月 26 日 11:07,阿里云监控发现视频直播、视频点播、CDN、DCDN 等产品服务出现异常,于当日 11:44 异常节点已下线,受影响产品陆续恢复中。12:28 受影响云产品已全部恢复。 根据阿里云 CDN SLA https://help.aliyun.com/zh/cdn/support/alibaba-cloud-cdn-sla 页面的说明,本次故障持续时间 81 分钟,占月度总时长 43200 的 0.18%, …

  • 带瘫全球互联网,Google云/Cloudflare全球故障

    冯若航 发布于 云计算 1901 字 4 分钟

    冯若航云计算Cloudflare故障复盘

    带瘫全球互联网,Google云/Cloudflare全球故障

    就是现在,根据 DownDetector 故障检测器的报告,几乎你能想到的主要互联网服务供应商都出现了显著故障与错误。背后的线索全部指向 Google 云平台 GCP 上的一场全局性大故障。 GCP 疑似因为核心的身份和访问管理(IAM)服务(内部名为 Chemist)出现全球地域,全局性的服务不可用。这场故障的原因几乎与前年 阿里云史诗故障 如出一辙。 GCP 的故障影响到 Cloudflare 的关键服务,进一步导致承载了全球互联网 20% 的流量的云平台 Cloudflare 出现故障 …

    就是现在,根据 DownDetector 故障检测器的报告,几乎你能想到的主要互联网服务供应商都出现了显著故障与错误。背后的线索全部指向 Google 云平台 GCP 上的一场全局性大故障。 GCP 疑似因为核心的身份和访问管理(IAM)服务(内部名为 Chemist)出现全球地域,全局性的服务不可用。这场故障的原因几乎与前年 阿里云史诗故障 如出一辙。 GCP 的故障影响到 Cloudflare 的关键服务,进一步导致承载了全球互联网 20% 的流量的云平台 Cloudflare 出现故障 …

  • 大故障:阿里云核心域名被拖走了

    冯若航 发布于 云计算 1669 字 4 分钟

    冯若航云计算阿里云故障复盘

    大故障:阿里云核心域名被拖走了

    今天早上许多群里出现网站故障的讨论,比如 cnblogs 全国访问一片红,一看原来是阿里云又出故障了。 根据阿里云健康看板状态页,北京时间凌晨 02:57 阿里云发现故障,早上 8:11 分确认解析异常修复。 https://status.aliyun.com/#/eventDetail?eventId=27 这次爆炸的是 aliyuncs.com 域名,用过阿里云服务的朋友们都知道,像对象存储这种核心服务使用的域名都是 aliyuncs.com 的子域名。那么域名解析故障的影响范围可想而知。 …

    今天早上许多群里出现网站故障的讨论,比如 cnblogs 全国访问一片红,一看原来是阿里云又出故障了。 根据阿里云健康看板状态页,北京时间凌晨 02:57 阿里云发现故障,早上 8:11 分确认解析异常修复。 https://status.aliyun.com/#/eventDetail?eventId=27 这次爆炸的是 aliyuncs.com 域名,用过阿里云服务的朋友们都知道,像对象存储这种核心服务使用的域名都是 aliyuncs.com 的子域名。那么域名解析故障的影响范围可想而知。 …

  • 这次数据库真爆炸了,但摇人也没用了

    冯若航 发布于 数据库 812 字 2 分钟

    冯若航数据库备份故障复盘

    这次数据库真爆炸了,但摇人也没用了

    老冯前几天发了篇《数据库爆炸了怎么摇人?》,结果没过几天就一语成谶,遇上了一起真·数据库爆炸事故,但这次比较惨烈,摇人也没用了。 老冯今天出发去温哥华参加 PGCon.Dev 2025,今天下午北京飞蒙特利尔。昨天晚上提前从上海出发去北京,都过安检准备登机了,一位用户朋友夺命连环 Call 又把我摇了回来。一场删库故障折腾到凌晨,现在改成早上 7 点的飞机再次出发了,只好在飞机上赶 PPT 了。 这个案例用的是 XFS + NVMe SSD,单机,文件系统层面的删库,连着本地备份一起无了,用各种 …

    老冯前几天发了篇《数据库爆炸了怎么摇人?》,结果没过几天就一语成谶,遇上了一起真·数据库爆炸事故,但这次比较惨烈,摇人也没用了。 老冯今天出发去温哥华参加 PGCon.Dev 2025,今天下午北京飞蒙特利尔。昨天晚上提前从上海出发去北京,都过安检准备登机了,一位用户朋友夺命连环 Call 又把我摇了回来。一场删库故障折腾到凌晨,现在改成早上 7 点的飞机再次出发了,只好在飞机上赶 PPT 了。 这个案例用的是 XFS + NVMe SSD,单机,文件系统层面的删库,连着本地备份一起无了,用各种 …

  • Etcd坑了多少公司?

    冯若航 发布于 数据库 1089 字 3 分钟

    冯若航数据库分布式系统容器化故障复盘

    Etcd坑了多少公司?

    前几天 影视飓风分享的 Pigsty / PostgreSQL 高可用案例 里面踩的一个雷在 X 上引起网友热议。 “因为 etcd 未开启自动压实功能,且默认仅为 2GB 容量”,ayanamist 评论到:“ 我倒要看看 etcd 这个傻逼 2G 的设计可以坑多少公司 ”。 etcd 的 slogan 是:“一个分布式的、可靠的键-值存储,用于存放系统中最为关键的配置数据”。 目前最常见的场景是用于存储 K8S 的元数据。当然类似 Patroni 这样的 PostgreSQL 高可用方案也可 …

    前几天 影视飓风分享的 Pigsty / PostgreSQL 高可用案例 里面踩的一个雷在 X 上引起网友热议。 “因为 etcd 未开启自动压实功能,且默认仅为 2GB 容量”,ayanamist 评论到:“ 我倒要看看 etcd 这个傻逼 2G 的设计可以坑多少公司 ”。 etcd 的 slogan 是:“一个分布式的、可靠的键-值存储,用于存放系统中最为关键的配置数据”。 目前最常见的场景是用于存储 K8S 的元数据。当然类似 Patroni 这样的 PostgreSQL 高可用方案也可 …

  • 10万用户的软件,因腾讯云欠费2元灰飞烟灭?

    冯若航 发布于 云计算 2722 字 6 分钟

    冯若航云计算故障复盘成本

    10万用户的软件,因腾讯云欠费2元灰飞烟灭?

    昨天,(卖正版软件的)数码荔枝老板在 X 上发了一个 Thread,说他们平台上有个软件开发者找他们下架软件,原因大致为: 他们把所有的代码 + 数据库都托管在腾讯云上。腾讯云欠费 2 元 后发通知,但开发者手机开了免干扰没注意。约 7 天后,腾讯云将他们的数据都删除,且无法恢复开发者没做数据备份,现在连用户是谁都不知道了。 一个 10 万+用户的产品就此无了。 这条推引起了很大的反响,已经七十多万阅读了,同时下面还有许多的评论。各种群里有不少朋友 @我,问老冯怎么看。那么今天我们就来聊聊这件事 …

    昨天,(卖正版软件的)数码荔枝老板在 X 上发了一个 Thread,说他们平台上有个软件开发者找他们下架软件,原因大致为: 他们把所有的代码 + 数据库都托管在腾讯云上。腾讯云欠费 2 元 后发通知,但开发者手机开了免干扰没注意。约 7 天后,腾讯云将他们的数据都删除,且无法恢复开发者没做数据备份,现在连用户是谁都不知道了。 一个 10 万+用户的产品就此无了。 这条推引起了很大的反响,已经七十多万阅读了,同时下面还有许多的评论。各种群里有不少朋友 @我,问老冯怎么看。那么今天我们就来聊聊这件事 …

  • 数据库爆炸了怎么摇人?

    冯若航 发布于 数据库 1393 字 3 分钟

    冯若航数据库故障复盘职业

    数据库爆炸了怎么摇人?

    今天群里有条消息,有朋友问我认识做 MinIO 数据恢复的人不,他们的 MinIO 集群误操作,核心数据数据丢没了。他们联系了 MinIO 原厂,不过 MinIO 原厂也不接这个活儿,甚至都拒绝报价。于是进入了叫天不灵,叫地不应的状态。 虽然 Pigsty 也提供 MinIO 的部署作为添头:用作 PG 备份仓库,以及供 Supabase 之类的自建服务使用。但这种问题,我也只能在客户部署前进行事前预防:例如开启垃圾回收站保留时长,以及多版本特性,或者配置跨 AZ 复制。如果真的是裸奔误操作删光 …

    今天群里有条消息,有朋友问我认识做 MinIO 数据恢复的人不,他们的 MinIO 集群误操作,核心数据数据丢没了。他们联系了 MinIO 原厂,不过 MinIO 原厂也不接这个活儿,甚至都拒绝报价。于是进入了叫天不灵,叫地不应的状态。 虽然 Pigsty 也提供 MinIO 的部署作为添头:用作 PG 备份仓库,以及供 Supabase 之类的自建服务使用。但这种问题,我也只能在客户部署前进行事前预防:例如开启垃圾回收站保留时长,以及多版本特性,或者配置跨 AZ 复制。如果真的是裸奔误操作删光 …

  • 云计算不能做成云算计之一:云行贿必须清理

    瑞典马工 发布于 云计算 2131 字 5 分钟

    瑞典马工云计算下云故障复盘

    云计算不能做成云算计之一:云行贿必须清理

    原作者:瑞典马工 作为桌子两边都坐过的云计算从业者,本人一直关注中国云计算的发展。相对于电信设备,智能手机,人工智能,生物医药,新能源汽车,电池等兄弟行业的突飞猛进,中国云计算的产品质量一直和国际同行保持稳定的较大差距,国际竞争力保持为零。这一点可以从美国政府这几年的制裁名单看出:美国政府连小米手机都制裁过,但是从来都懒得制裁中国云厂商(不要抬杠,华为云被制裁是因为集团的缘故)。 都是工程行业,为什么中国云计算行业发展就这么落后呢?我相信各位读者都有很多观点,但是目前为止没有看到严肃的讨论。在 …

    原作者:瑞典马工 作为桌子两边都坐过的云计算从业者,本人一直关注中国云计算的发展。相对于电信设备,智能手机,人工智能,生物医药,新能源汽车,电池等兄弟行业的突飞猛进,中国云计算的产品质量一直和国际同行保持稳定的较大差距,国际竞争力保持为零。这一点可以从美国政府这几年的制裁名单看出:美国政府连小米手机都制裁过,但是从来都懒得制裁中国云厂商(不要抬杠,华为云被制裁是因为集团的缘故)。 都是工程行业,为什么中国云计算行业发展就这么落后呢?我相信各位读者都有很多观点,但是目前为止没有看到严肃的讨论。在 …

  • AWS 东京可用区故障:影响13项服务

    冯若航 发布于 云计算 1084 字 3 分钟

    冯若航云计算AWS故障复盘

    AWS 东京可用区故障:影响13项服务

    AWS 东京可用区故障:影响 13 项服务 就在刚刚,AWS 东京可用区出现故障,开始于 4 月 15 日 16:15 分(北京时间),宣告结束于 16:51 分,EC2 实例断电,主备电源同时断电。影响 13 项服务。目前已经通告解决:剩余的少数实例托管在受断电不利影响的硬件上。 故障通知 4 月 15 日凌晨 1:51(太平洋 夏令时间)凌晨 12:40 至凌晨 1:43 之间,我们在 AP-NORTHEAST-1 区域的单个可用区 (apne1-az4) 中遇到了与部分 EC2 实例的连接 …

    AWS 东京可用区故障:影响 13 项服务 就在刚刚,AWS 东京可用区出现故障,开始于 4 月 15 日 16:15 分(北京时间),宣告结束于 16:51 分,EC2 实例断电,主备电源同时断电。影响 13 项服务。目前已经通告解决:剩余的少数实例托管在受断电不利影响的硬件上。 故障通知 4 月 15 日凌晨 1:51(太平洋 夏令时间)凌晨 12:40 至凌晨 1:43 之间,我们在 AP-NORTHEAST-1 区域的单个可用区 (apne1-az4) 中遇到了与部分 EC2 实例的连接 …

  • DeepSeek.com网站证书错误

    冯若航 发布于 云计算 277 字 1 分钟

    冯若航云计算安全故障复盘

    DeepSeek.com网站证书错误

    DeepSeek 主域名(deepseek.com)的证书无效,浏览器访问 https://deepseek.com/ 会有错误提示: 看上去是 OpenSSL 默认自签名的 Internet Widgits Pty Ltd。像这样的测试证书发到官网主域名上,确实是非常低级的错误了。 不过,访问 www.deepseek.com 与其他域名是正常的,使用的是 DigitalOcean 签发的有效证书。截至本文发布前,DeepSeek 已经将 deepseek.com 主域名 301 重定向到 …

    DeepSeek 主域名(deepseek.com)的证书无效,浏览器访问 https://deepseek.com/ 会有错误提示: 看上去是 OpenSSL 默认自签名的 Internet Widgits Pty Ltd。像这样的测试证书发到官网主域名上,确实是非常低级的错误了。 不过,访问 www.deepseek.com 与其他域名是正常的,使用的是 DigitalOcean 签发的有效证书。截至本文发布前,DeepSeek 已经将 deepseek.com 主域名 301 重定向到 …

  • 网传江西教育厅高考查分网站删库跑路

    冯若航 发布于 云计算 723 字 2 分钟

    冯若航数据库备份故障复盘

    网传江西教育厅高考查分网站删库跑路

    昨天,各八卦群中流传出一则《江教在线数据库删库》的消息。据称被删库的网站是江西教育系统的江教在线(www.know.edu.cn),也是江西高考成绩查询的网站 —— 出的问题是数据库被格式化,而且没有备份,甚至都没有数据库表结构,导致连拉起一套新的应用都不能。 中间的图片字是:“虽然说是他们格式化的服务器,但是我们没做异地备份”。 作为验证,访问江教在线网站提示《网站维护中》。刷新后可见一则 “迁移公告”,是否为删库请自行判断真伪。截至发稿,公示的新域名 www.forsee.com.cn[2] …

    昨天,各八卦群中流传出一则《江教在线数据库删库》的消息。据称被删库的网站是江西教育系统的江教在线(www.know.edu.cn),也是江西高考成绩查询的网站 —— 出的问题是数据库被格式化,而且没有备份,甚至都没有数据库表结构,导致连拉起一套新的应用都不能。 中间的图片字是:“虽然说是他们格式化的服务器,但是我们没做异地备份”。 作为验证,访问江教在线网站提示《网站维护中》。刷新后可见一则 “迁移公告”,是否为删库请自行判断真伪。截至发稿,公示的新域名 www.forsee.com.cn[2] …

  • 福利还是无双级BUG?网传支付宝14:40-14:45支付订单按国补减免了20%

    冯若航 发布于 云计算 455 字 1 分钟

    冯若航阿里云故障复盘

    福利还是无双级BUG?网传支付宝14:40-14:45支付订单按国补减免了20%

    就在刚刚,小红书,微博,V 站上都有多位用户发帖反馈在今天(2025-01-16)下午 14:40 - 14:45 的支付宝订单(甚至包括转账)被 “政府减免” 20%。 V 站原贴链接:https://www.v2ex.com/t/1105618 (顺带一提,截止至发稿时,这帖子已经被和谐了,但以下是截图) 看很多人都在发,只可惜自己没有这么好的运气赶上这波福利呀。以上均为网友发帖,本号不负责判断与验证真假。那么这到底是福利?还是史诗级 BUG 呢? 从现象上来看,乱七八糟的交易都有扣减:包括 …

    就在刚刚,小红书,微博,V 站上都有多位用户发帖反馈在今天(2025-01-16)下午 14:40 - 14:45 的支付宝订单(甚至包括转账)被 “政府减免” 20%。 V 站原贴链接:https://www.v2ex.com/t/1105618 (顺带一提,截止至发稿时,这帖子已经被和谐了,但以下是截图) 看很多人都在发,只可惜自己没有这么好的运气赶上这波福利呀。以上均为网友发帖,本号不负责判断与验证真假。那么这到底是福利?还是史诗级 BUG 呢? 从现象上来看,乱七八糟的交易都有扣减:包括 …

  • OpenAI全球宕机复盘:K8S循环依赖

    冯若航 发布于 云计算 4357 字 9 分钟

    冯若航Codex故障复盘

    OpenAI全球宕机复盘:K8S循环依赖

    12 月 11 日,OpenAI 出现了全球范围内的不可用故障,影响了 ChatGPT,API,Sora,Playground 和 Labs 等服务。影响范围从 12 月 11 日下午 3:16 至晚上 7:38 期间,持续时间超过四个小时,产生显著影响。 根据 OpenIA 在事后发布的故障报告,此次故障的直接原因是新部署了一套监控,压垮了 Kubernetes 控制面。然后因为控制面故障导致无法直接回滚,进一步放大的故障影响,导致了长时间的不可用。 其实这个故障和去年双十一 阿里云全球史诗故 …

    12 月 11 日,OpenAI 出现了全球范围内的不可用故障,影响了 ChatGPT,API,Sora,Playground 和 Labs 等服务。影响范围从 12 月 11 日下午 3:16 至晚上 7:38 期间,持续时间超过四个小时,产生显著影响。 根据 OpenIA 在事后发布的故障报告,此次故障的直接原因是新部署了一套监控,压垮了 Kubernetes 控制面。然后因为控制面故障导致无法直接回滚,进一步放大的故障影响,导致了长时间的不可用。 其实这个故障和去年双十一 阿里云全球史诗故 …

  • 草台回旋镖:Apple Music证书过期服务中断

    冯若航 发布于 云计算 853 字 2 分钟

    冯若航云计算故障复盘安全

    草台回旋镖:Apple Music证书过期服务中断

    今天早上,网传 Apple Music 出现证书过期,导致服务中断。据称影响范围为国区 Apple Music。有趣的是,就在一个月前,苹果公司刚刚宣布了一项计划,拟将 SSL/TLS 安全证书的有效期逐步从当前的 398 天大幅缩短至 2027 年的 45 天。 结果刚提出没多久,苹果立马就忘了更新自己的证书。属实是回旋镖正中自己的脑门,蛮丢脸的。 从过期的证书来看,苹果使用的证书有效期是 180 天 / 六个月的版本。看起来似乎他们也没有设置自动更新证书的轮换程序,或者说设置了也没有生效 …

    今天早上,网传 Apple Music 出现证书过期,导致服务中断。据称影响范围为国区 Apple Music。有趣的是,就在一个月前,苹果公司刚刚宣布了一项计划,拟将 SSL/TLS 安全证书的有效期逐步从当前的 398 天大幅缩短至 2027 年的 45 天。 结果刚提出没多久,苹果立马就忘了更新自己的证书。属实是回旋镖正中自己的脑门,蛮丢脸的。 从过期的证书来看,苹果使用的证书有效期是 180 天 / 六个月的版本。看起来似乎他们也没有设置自动更新证书的轮换程序,或者说设置了也没有生效 …

  • 阿里云:高可用容灾神话破灭

    冯若航 发布于 云计算 4511 字 10 分钟

    冯若航下云阿里云故障复盘

    阿里云:高可用容灾神话破灭

    2024 年 9 月 10 日,阿里云新加坡可用区 C 数据中心因锂电池爆炸导致火灾,到现在已经过去一周了,仍未完全恢复。 按照月度 SLA 定义的可用性计算规则(7 天+/30 天≈75%),服务可用性别说几个 9 了,连一个 8 都不剩了,而且还在进一步下降中。 当然,可用性八八九九已经是小问题了 —— 真正的问题是,放在单可用区里的数据还能不能找回来? 截止至 09-17,关键服务如 ECS,OSS,EBS,NAS,RDS 等仍然处于异常状态 通常来说,如果只是机房小范围失火的话,问题并不 …

    2024 年 9 月 10 日,阿里云新加坡可用区 C 数据中心因锂电池爆炸导致火灾,到现在已经过去一周了,仍未完全恢复。 按照月度 SLA 定义的可用性计算规则(7 天+/30 天≈75%),服务可用性别说几个 9 了,连一个 8 都不剩了,而且还在进一步下降中。 当然,可用性八八九九已经是小问题了 —— 真正的问题是,放在单可用区里的数据还能不能找回来? 截止至 09-17,关键服务如 ECS,OSS,EBS,NAS,RDS 等仍然处于异常状态 通常来说,如果只是机房小范围失火的话,问题并不 …

  • 我们能从网易云音乐故障中学到什么?

    冯若航 发布于 云计算 1515 字 4 分钟

    冯若航故障复盘

    我们能从网易云音乐故障中学到什么?

    今天下午 14:44 左右,网易云音乐出现 不可用故障,至 17:11 分恢复。网传原因为 基础设施/云盘存储 相关问题。 故障经过 故障期间,网易云音乐客户端可以正常播放离线下载的音乐,但访问在线资源会直接提示报错,网页版则直接出现 502 服务器报错无法访问。 在此期间,网易 163 门户也出现 502 服务器报错,并在一段时间后 302 重定向到移动版主站。期间也有用户反馈 网易新闻 与其他服务也受到影响。 许多用户都反馈连不上网易云音乐后,以为是自己网断了,卸了 APP 重装,还有以为公 …

    今天下午 14:44 左右,网易云音乐出现 不可用故障,至 17:11 分恢复。网传原因为 基础设施/云盘存储 相关问题。 故障经过 故障期间,网易云音乐客户端可以正常播放离线下载的音乐,但访问在线资源会直接提示报错,网页版则直接出现 502 服务器报错无法访问。 在此期间,网易 163 门户也出现 502 服务器报错,并在一段时间后 302 重定向到移动版主站。期间也有用户反馈 网易新闻 与其他服务也受到影响。 许多用户都反馈连不上网易云音乐后,以为是自己网断了,卸了 APP 重装,还有以为公 …

  • GitHub全站故障,又是数据库上翻的车?

    冯若航 发布于 云计算 206 字 1 分钟

    冯若航云计算故障复盘

    GitHub全站故障,又是数据库上翻的车?

    早上正在刷 GitHub,突然就遇见独角兽 —— GitHub 全站挂了,甚至连主页都无法加载。截止到本文发出时,已经过去半个小时,服务还没有恢复。 根据 https://www.githubstatus.com/ 的状态页消息,本次影响范围为 GitHub 全站所有服务。 根据 GitHub Status 的消息,这次故障与数据库基础设施上的变更有关。 无状态的服务有许多恢复手段,即时挂了也比较容易恢复。而有状态的数据库一旦出问题,就是大问题。我们尚不知道是哪种数据库故障,与哪种数据库基础设施 …

    早上正在刷 GitHub,突然就遇见独角兽 —— GitHub 全站挂了,甚至连主页都无法加载。截止到本文发出时,已经过去半个小时,服务还没有恢复。 根据 https://www.githubstatus.com/ 的状态页消息,本次影响范围为 GitHub 全站所有服务。 根据 GitHub Status 的消息,这次故障与数据库基础设施上的变更有关。 无状态的服务有许多恢复手段,即时挂了也比较容易恢复。而有状态的数据库一旦出问题,就是大问题。我们尚不知道是哪种数据库故障,与哪种数据库基础设施 …

  • 蓝屏星期五:甲乙双方都是草台班子

    冯若航 发布于 云计算 2439 字 5 分钟

    冯若航下云故障复盘Cloudflare

    蓝屏星期五:甲乙双方都是草台班子

    最近,因为网络安全公司 CrowdStrike 发布的一个配置更新,全球范围内无数 Windows 电脑都陷入蓝屏死机状态,无数的混乱 —— 航司停飞,医院取消手术,超市、游乐园、各行各业歇业。 表:受到影响的行业领域、国家地区与相关机构(CrowdStrike导致大规模系统崩溃事件的技术分析) 涉及领域 相关机构 航空运输 美国、澳大利亚、英国、荷兰、印度、捷克、匈牙利、西班牙、中国香港、瑞士等部分航空公司出现航班延误或机场服务中断。美国达美航空、美国航空和忠实航空宣布停飞所有航班。 媒体通信 …

    最近,因为网络安全公司 CrowdStrike 发布的一个配置更新,全球范围内无数 Windows 电脑都陷入蓝屏死机状态,无数的混乱 —— 航司停飞,医院取消手术,超市、游乐园、各行各业歇业。 表:受到影响的行业领域、国家地区与相关机构(CrowdStrike导致大规模系统崩溃事件的技术分析) 涉及领域 相关机构 航空运输 美国、澳大利亚、英国、荷兰、印度、捷克、匈牙利、西班牙、中国香港、瑞士等部分航空公司出现航班延误或机场服务中断。美国达美航空、美国航空和忠实航空宣布停飞所有航班。 媒体通信 …

  • CVE-2024-6387 SSH漏洞修复

    冯若航 发布于 数据库 337 字 1 分钟

    冯若航安全Linux故障复盘

    CVE-2024-6387 SSH漏洞修复

    漏洞描述,CVE-2024-6387: https://nvd.nist.gov/vuln/detail/CVE-2024-6387 基本上影响的都是比较新版本的操作系统,老的系统,比如 CentOS 7.9,RockyLinux 8.9 ,Ubuntu 20.04,Debian 11 因为 OpenSSH 版本老逃过一劫。 在 Pigsty 支持的操作系统发行版中,RockyLinux 9.3,Ubuntu 22.04,Debian 12 受到影响: ssh -V OpenSSH_8.7p1, …

    漏洞描述,CVE-2024-6387: https://nvd.nist.gov/vuln/detail/CVE-2024-6387 基本上影响的都是比较新版本的操作系统,老的系统,比如 CentOS 7.9,RockyLinux 8.9 ,Ubuntu 20.04,Debian 11 因为 OpenSSH 版本老逃过一劫。 在 Pigsty 支持的操作系统发行版中,RockyLinux 9.3,Ubuntu 22.04,Debian 12 受到影响: ssh -V OpenSSH_8.7p1, …

  • 阿里云又挂了,这次是光缆被挖断了?

    冯若航 发布于 云计算 992 字 2 分钟

    冯若航云计算阿里云故障复盘

    阿里云又挂了,这次是光缆被挖断了?

    根据阿里云健康看板与公告,就在刚刚,上海可用区 N 出现网络访问异常。受到影响的服务包括:OSS,ECS,RDS,K8S,OTS,DTS,KMS,PolarDB,Redis,Mongo,ElasticSearch;从发现故障到解决用时 31 分钟,从发现故障到影响恢复用时 38 分钟。 据知情人士透露,本次故障根因是:专线被挖掘机挖断了。(小道消息,请以官网通告为准) 阿里云故障公告地址:https://status.aliyun.com/#/eventDetail?eventId=20 影响的 …

    根据阿里云健康看板与公告,就在刚刚,上海可用区 N 出现网络访问异常。受到影响的服务包括:OSS,ECS,RDS,K8S,OTS,DTS,KMS,PolarDB,Redis,Mongo,ElasticSearch;从发现故障到解决用时 31 分钟,从发现故障到影响恢复用时 38 分钟。 据知情人士透露,本次故障根因是:专线被挖掘机挖断了。(小道消息,请以官网通告为准) 阿里云故障公告地址:https://status.aliyun.com/#/eventDetail?eventId=20 影响的 …

  • 删库:Google云爆破了大基金的整个云账户

    冯若航 发布于 云计算 1046 字 3 分钟

    冯若航下云云计算故障复盘

    删库:Google云爆破了大基金的整个云账户

    由于“前所未有的配置错误”,Google Cloud 误删了 UniSuper 的云账户。 澳洲养老金基金负责人与 Google Cloud 全球首席执行官联合发布声明,为这一“极其令人沮丧和失望”的故障表示道歉。 https://x.com/0xdabbad00/status/1789011008549450025 因为一次 Google Cloud “举世无双” 的配置失误,澳洲养老金基金 Unisuper 的整个云账户被误删了,超过五十万名 UniSuper 基金会员一周都无法访问他们的养 …

    由于“前所未有的配置错误”,Google Cloud 误删了 UniSuper 的云账户。 澳洲养老金基金负责人与 Google Cloud 全球首席执行官联合发布声明,为这一“极其令人沮丧和失望”的故障表示道歉。 https://x.com/0xdabbad00/status/1789011008549450025 因为一次 Google Cloud “举世无双” 的配置失误,澳洲养老金基金 Unisuper 的整个云账户被误删了,超过五十万名 UniSuper 基金会员一周都无法访问他们的养 …

  • 为什么这两年的舆论战,云厂商总是节节败退

    titi 发布于 云计算 3261 字 7 分钟

    titi云计算故障复盘社会观察

    为什么这两年的舆论战,云厂商总是节节败退

    原作者:titi 4 月 8 日,腾讯云又出现了一次多 region 的大范围故障,据说是管控面挂了,原因和去年 1112 阿里云的那次类似。不少人问我对此事的看法,和去年那次故障一样,我的观点依然是:无论是哪家云厂出了此类问题,对于云计算行业来说打击都是灾难性的。用户对于行业能力的认知依靠的是过去耗费了大量时间、人力堆砌,逐渐建立心智并达成共识,但信心的崩塌往往都只要一瞬间。关于事件经过和腾讯云做的不足之处,技术层面业内已有大量文章做了深度分析,作为同行,不愿在此敏感时刻过多评价,难免给人以 …

    原作者:titi 4 月 8 日,腾讯云又出现了一次多 region 的大范围故障,据说是管控面挂了,原因和去年 1112 阿里云的那次类似。不少人问我对此事的看法,和去年那次故障一样,我的观点依然是:无论是哪家云厂出了此类问题,对于云计算行业来说打击都是灾难性的。用户对于行业能力的认知依靠的是过去耗费了大量时间、人力堆砌,逐渐建立心智并达成共识,但信心的崩塌往往都只要一瞬间。关于事件经过和腾讯云做的不足之处,技术层面业内已有大量文章做了深度分析,作为同行,不愿在此敏感时刻过多评价,难免给人以 …

  • 我们能从腾讯云大故障中学到什么?

    冯若航 发布于 云计算 4331 字 9 分钟

    冯若航下云云计算故障复盘

    我们能从腾讯云大故障中学到什么?

    故障过去八天后,腾讯云发布了 4.8 号大故障的复盘报告。我认为是一件好事,因为阿里云双十一大故障的官方故障复盘至今仍然是拖欠着的。公有云厂商想要真正成为 —— 提供水与电的公共基础设施,那就需要承担起责任,接受公众监督 —— 云厂商有义务披露自己故障原因,并提出切实的可靠性改进方案与措施。 那么我们就来看一看这份复盘报告,看看里面有哪些信息,以及可以从中学到什么教训。 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 按照腾讯云官方给出的复盘报告(官方发布的“ …

    故障过去八天后,腾讯云发布了 4.8 号大故障的复盘报告。我认为是一件好事,因为阿里云双十一大故障的官方故障复盘至今仍然是拖欠着的。公有云厂商想要真正成为 —— 提供水与电的公共基础设施,那就需要承担起责任,接受公众监督 —— 云厂商有义务披露自己故障原因,并提出切实的可靠性改进方案与措施。 那么我们就来看一看这份复盘报告,看看里面有哪些信息,以及可以从中学到什么教训。 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 按照腾讯云官方给出的复盘报告(官方发布的“ …

  • 为什么我们的云老是故障

    VAGE 发布于 云计算 1820 字 4 分钟

    VAGE云计算AI故障复盘

    为什么我们的云老是故障

    原作者:VAGE 去年双 11 后第二天(11 月 12 号),阿里云大面积事故。我写了一篇文章,探讨其背后的原因。今年腾讯云事故,如出一辙,不写一篇文章讨论下,有厚此溥彼之闲。 这是我去年写的一句话:“我懒的去猜事故真正原因,而且,root cause 的追索,并不是一件容易的事。真正的“起因”,有时也调查不出来,只是有一个看起来还行的“说法”而已。“ 这句话,放之如今不需改一个字。 很多人只把眼晴订在眼前的事故上,讨论当下事故的原因。且不论是否能讨论的清。其实,公有云,不只有眼前的事故,还 …

    原作者:VAGE 去年双 11 后第二天(11 月 12 号),阿里云大面积事故。我写了一篇文章,探讨其背后的原因。今年腾讯云事故,如出一辙,不写一篇文章讨论下,有厚此溥彼之闲。 这是我去年写的一句话:“我懒的去猜事故真正原因,而且,root cause 的追索,并不是一件容易的事。真正的“起因”,有时也调查不出来,只是有一个看起来还行的“说法”而已。“ 这句话,放之如今不需改一个字。 很多人只把眼晴订在眼前的事故上,讨论当下事故的原因。且不论是否能讨论的清。其实,公有云,不只有眼前的事故,还 …

  • 腾讯云/阿里云故障背后:投入不足

    周新宇 发布于 云计算 3790 字 8 分钟

    周新宇云计算故障复盘工具

    腾讯云/阿里云故障背后:投入不足

    原作者:周新宇 作者 | 周新宇 恰逢今天读到了行业大佬对近期频发的公有云故障的思考《你用的公有云都没做过测试》,该文章的核心观点是「公有云是没法测试的」。我其实对这个事情有相反的观点,云服务本身也是软件,软件工程发展至今测试手段是多样和丰富的,而且公有云因为有大规模的生产流量优势,用好金丝雀 / 灰度发布能在新版本全网发布前尽可能揪出从其他测试环节中逃逸的 Bug。 那既然测试是好做的,为什么从结果来看,公有云故障还是那么多呢,结合我在云厂商的工作经历来看,两朵云近两次 IAM 相关的故障背 …

    原作者:周新宇 作者 | 周新宇 恰逢今天读到了行业大佬对近期频发的公有云故障的思考《你用的公有云都没做过测试》,该文章的核心观点是「公有云是没法测试的」。我其实对这个事情有相反的观点,云服务本身也是软件,软件工程发展至今测试手段是多样和丰富的,而且公有云因为有大规模的生产流量优势,用好金丝雀 / 灰度发布能在新版本全网发布前尽可能揪出从其他测试环节中逃逸的 Bug。 那既然测试是好做的,为什么从结果来看,公有云故障还是那么多呢,结合我在云厂商的工作经历来看,两朵云近两次 IAM 相关的故障背 …

  • 你用的公有云都没做过测试

    冷技术热思考 发布于 云计算 1170 字 3 分钟

    冷技术热思考云计算工具故障复盘

    你用的公有云都没做过测试

    原作者:冷技术热思考 前两天腾讯云遭遇重大故障,影响范围很大,几乎所有 API 服务不可用,和之前阿里云的严重故障类似。这个事情当然马上引起了业界广泛的分析和讨论,比如冯若航就迅速分享了他的看法(腾讯云:颜面尽失的草台班子),我也说下我的理解。 我的理解主要来自于我做云和做软件的经验。 我是从 2012 年开始带领团队开发网易云。我们主要服务的是集团的非游戏业务,如云音乐、新闻、等,云课堂、Lofter、云信/易盾/七鱼等,也少量服务过外部客户。尽管我们的平台较为专注且应用规模较小,因此故障率 …

    原作者:冷技术热思考 前两天腾讯云遭遇重大故障,影响范围很大,几乎所有 API 服务不可用,和之前阿里云的严重故障类似。这个事情当然马上引起了业界广泛的分析和讨论,比如冯若航就迅速分享了他的看法(腾讯云:颜面尽失的草台班子),我也说下我的理解。 我的理解主要来自于我做云和做软件的经验。 我是从 2012 年开始带领团队开发网易云。我们主要服务的是集团的非游戏业务,如云音乐、新闻、等,云课堂、Lofter、云信/易盾/七鱼等,也少量服务过外部客户。尽管我们的平台较为专注且应用规模较小,因此故障率 …

  • 腾讯云:颜面尽失的草台班子

    冯若航 发布于 云计算 1874 字 4 分钟

    冯若航云计算故障复盘技术评论

    腾讯云:颜面尽失的草台班子

    昨天下午,2024 年 04 月 08 日,腾讯云出现了一场全球性的大故障,用腾讯云官方的说法,崩了 74 分钟(15:31 - 16:45),波及全球 17 个区域与数十款服务。 事实影响是什么 但这与我观察到的事实不符 —— 从故障范围上来说,这次的故障几乎是去年阿里云双十一史诗级大故障的翻版 —— 小道消息是整个管控面 GG,云 API 挂了,所以现象与去年阿里云如出一辙:依赖云 API 的云产品控制台不能用了。 被管控的纯资源,如云服务器 CVM,云数据库 RDS,设置了公开读写访问对象 …

    昨天下午,2024 年 04 月 08 日,腾讯云出现了一场全球性的大故障,用腾讯云官方的说法,崩了 74 分钟(15:31 - 16:45),波及全球 17 个区域与数十款服务。 事实影响是什么 但这与我观察到的事实不符 —— 从故障范围上来说,这次的故障几乎是去年阿里云双十一史诗级大故障的翻版 —— 小道消息是整个管控面 GG,云 API 挂了,所以现象与去年阿里云如出一辙:依赖云 API 的云产品控制台不能用了。 被管控的纯资源,如云服务器 CVM,云数据库 RDS,设置了公开读写访问对象 …

  • 【腾讯】云计算史诗级二翻车来了

    冯若航 发布于 云计算 688 字 2 分钟

    冯若航云计算故障复盘

    【腾讯】云计算史诗级二翻车来了

    就在现在,腾讯云管控面挂了。症状几乎和 去年双十一阿里云史诗级大故障 一毛一样:CVM 虚拟机,RDS 数据库还可以正常运行,但是管控面,特别是和 Auth 有关的无一幸免。堪称阿里云故障翻版。 这篇给阿里云做的的非官方复盘文章《我们能从阿里云史诗级故障中学到什么》,把阿里云三个字改成腾讯云,读起来丝毫没有一点儿违和感。也许是**降本增笑**太狠了,SRE 今年的年终奖又要泡汤了。 我自己还有几台 CVM 虚拟机跑 Demo,也用了腾讯云的 CDN 服务,登陆到控制台上,也访问不了了。看来确实要 …

    就在现在,腾讯云管控面挂了。症状几乎和 去年双十一阿里云史诗级大故障 一毛一样:CVM 虚拟机,RDS 数据库还可以正常运行,但是管控面,特别是和 Auth 有关的无一幸免。堪称阿里云故障翻版。 这篇给阿里云做的的非官方复盘文章《我们能从阿里云史诗级故障中学到什么》,把阿里云三个字改成腾讯云,读起来丝毫没有一点儿违和感。也许是**降本增笑**太狠了,SRE 今年的年终奖又要泡汤了。 我自己还有几台 CVM 虚拟机跑 Demo,也用了腾讯云的 CDN 服务,登陆到控制台上,也访问不了了。看来确实要 …

  • 互联网故障背后的草台班子们

    瑞典马工 发布于 云计算 5322 字 11 分钟

    瑞典马工云计算故障复盘PG管理

    互联网故障背后的草台班子们

    原作者:瑞典马工 摘要 软件从业者在基本工程能力上的欠缺,过去被高速增长的业务数据所掩盖,不被当成一个问题。但是潮水一旦落下,我们就看到一个又一个裸泳的屁股。对此,我们没有其他建议,只有一个:老老实实地补课,不要再吹牛逼了。 滴滴不专业的故障沟通 11 月 27 日滴滴出行出了故障,至今没有发布一个官方的时间线,没人知道故障是什么时候开始的和什么时候彻底恢复的。目前最为详细的故障时间线,是一家财经媒体雷达财经发布的《[1]滴滴崩溃原因找到了!并非网络攻击 而是底层系统软件故障[2]》[3]。尽 …

    原作者:瑞典马工 摘要 软件从业者在基本工程能力上的欠缺,过去被高速增长的业务数据所掩盖,不被当成一个问题。但是潮水一旦落下,我们就看到一个又一个裸泳的屁股。对此,我们没有其他建议,只有一个:老老实实地补课,不要再吹牛逼了。 滴滴不专业的故障沟通 11 月 27 日滴滴出行出了故障,至今没有发布一个官方的时间线,没人知道故障是什么时候开始的和什么时候彻底恢复的。目前最为详细的故障时间线,是一家财经媒体雷达财经发布的《[1]滴滴崩溃原因找到了!并非网络攻击 而是底层系统软件故障[2]》[3]。尽 …

  • 从降本增笑到真的降本增效

    冯若航 发布于 云计算 3921 字 8 分钟

    冯若航下云阿里云故障复盘

    从降本增笑到真的降本增效

    年底正是冲绩效的时间,互联网大厂大事故却是一波接一波。硬生生把降本增效搞成了“降本增笑” —— 这已经不仅仅是梗了,而是来自官方的自嘲。 双十一刚过,阿里云就出了打破行业纪录的 全球史诗级大翻车,然后开始了11月连环炸模式,在几次小故障后,又来了一场云数据库管控面跨国俩小时大故障—— 从月爆到周爆再到日爆。 但话音未落,滴滴 又出现了一场超过12小时的大失效,资损 几个亿 —— 替代品阿里旗下的高德打车直接爆单赚翻,堪称失之桑榆,收之东隅。 我已经替装死的阿里云做过复盘了《我们能从阿里云史诗级故 …

    年底正是冲绩效的时间,互联网大厂大事故却是一波接一波。硬生生把降本增效搞成了“降本增笑” —— 这已经不仅仅是梗了,而是来自官方的自嘲。 双十一刚过,阿里云就出了打破行业纪录的 全球史诗级大翻车,然后开始了11月连环炸模式,在几次小故障后,又来了一场云数据库管控面跨国俩小时大故障—— 从月爆到周爆再到日爆。 但话音未落,滴滴 又出现了一场超过12小时的大失效,资损 几个亿 —— 替代品阿里旗下的高德打车直接爆单赚翻,堪称失之桑榆,收之东隅。 我已经替装死的阿里云做过复盘了《我们能从阿里云史诗级故 …

  • 阿里云周爆:云数据库管控又挂了

    冯若航 发布于 云计算 765 字 2 分钟

    冯若航云计算阿里云故障复盘

    阿里云周爆:云数据库管控又挂了

    阿里云 11. 12 大故障两周 过去,还没有看到官方的详细**复盘报告,结果又来了一场大故障:中美 7 个区域的数据库管控挂了近两个小时**。 当然与上次 Auth 故障类似,因为数据库这种 IaaS 资源类服务不会因为管控挂了就不能用了 —— 你确实无法通过 API 与控制台对数据库进行管理与变更,但是数据库本身是活着的,也可以正常使用访问。 这一次和 11.12 故障属于让官方发全站公告的显著故障,没记错的话,11 月份还有两次较小规模的局部故障。这种故障频率即使是对于草台班子来说也有些过 …

    阿里云 11. 12 大故障两周 过去,还没有看到官方的详细**复盘报告,结果又来了一场大故障:中美 7 个区域的数据库管控挂了近两个小时**。 当然与上次 Auth 故障类似,因为数据库这种 IaaS 资源类服务不会因为管控挂了就不能用了 —— 你确实无法通过 API 与控制台对数据库进行管理与变更,但是数据库本身是活着的,也可以正常使用访问。 这一次和 11.12 故障属于让官方发全站公告的显著故障,没记错的话,11 月份还有两次较小规模的局部故障。这种故障频率即使是对于草台班子来说也有些过 …

  • 我们能从阿里云全球故障中学到什么?

    冯若航 发布于 云计算 5819 字 12 分钟

    冯若航下云阿里云故障复盘

    我们能从阿里云全球故障中学到什么?

    时隔一年阿里云又出大故障,并创造了云计算行业闻所未闻的新记录 —— 全球所有区域/所有服务同时异常。阿里云不愿意发布故障复盘报告,那我就来替他复盘 —— 我们应当如何看待这一史诗级故障案例,以及,能从中学习到什么经验与教训? 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 2023 年 11 月 12 日,双十一后第一天,阿里云出了一场史诗级大翻车。全球所有区域同时出现故障,创造了闻所未闻的行业新记录。 根据阿里云官方的服务状态页,全球所有区域/可用区 ✖️ …

    时隔一年阿里云又出大故障,并创造了云计算行业闻所未闻的新记录 —— 全球所有区域/所有服务同时异常。阿里云不愿意发布故障复盘报告,那我就来替他复盘 —— 我们应当如何看待这一史诗级故障案例,以及,能从中学习到什么经验与教训? 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 2023 年 11 月 12 日,双十一后第一天,阿里云出了一场史诗级大翻车。全球所有区域同时出现故障,创造了闻所未闻的行业新记录。 根据阿里云官方的服务状态页,全球所有区域/可用区 ✖️ …

  • 如何用 pg_filedump 抢救数据?

    冯若航 发布于 PGSQL 5124 字 11 分钟

    冯若航PostgreSQLPG管理故障复盘

    如何用 pg_filedump 抢救数据?

    备份是DBA的生命线 —— 但如果你的 PostgreSQL 数据库已经爆炸了又没有备份,那么该怎么办呢?也许 pg_filedump 可以帮到你! 最近遇到了一个比较离谱的活儿,情况是这样的:有个用户的 PostgreSQL 数据库损坏了,是 Gitlab 自己拉起的 PostgreSQL。没有从库,没有备份,也没有 dump。跑在拿 SSD 当透明缓存的BCACHE上,断电后起不来了。 但这还没完,接连经受了几轮摧残之后,它彻底歇菜了:首先是因为忘了挂BCACHE盘,导致 Gitlab重新 …

    备份是DBA的生命线 —— 但如果你的 PostgreSQL 数据库已经爆炸了又没有备份,那么该怎么办呢?也许 pg_filedump 可以帮到你! 最近遇到了一个比较离谱的活儿,情况是这样的:有个用户的 PostgreSQL 数据库损坏了,是 Gitlab 自己拉起的 PostgreSQL。没有从库,没有备份,也没有 dump。跑在拿 SSD 当透明缓存的BCACHE上,断电后起不来了。 但这还没完,接连经受了几轮摧残之后,它彻底歇菜了:首先是因为忘了挂BCACHE盘,导致 Gitlab重新 …

  • 故障档案:时间回溯导致的Patroni故障

    冯若航 发布于 PGSQL 288 字 1 分钟

    冯若航PostgreSQLPG管理故障复盘

    故障档案:时间回溯导致的Patroni故障

    摘要:机器因为故障重启,NTP服务在PG启动后修复了PG的时间,导致 Patroni 无法启动。 Patroni中的故障信息如下所示: Process %s is not postmaster, too much difference between PID file start time %s and process start time %s patroni 进程启动时间和pid时间不一致。就会认为:postgres is not running。 两个时间相差超过30秒。patroni 就 …

    摘要:机器因为故障重启,NTP服务在PG启动后修复了PG的时间,导致 Patroni 无法启动。 Patroni中的故障信息如下所示: Process %s is not postmaster, too much difference between PID file start time %s and process start time %s patroni 进程启动时间和pid时间不一致。就会认为:postgres is not running。 两个时间相差超过30秒。patroni 就 …

  • 故障档案:PG安装Extension导致无法连接

    冯若航 发布于 PGSQL 858 字 2 分钟

    冯若航PostgreSQLPG管理扩展故障复盘

    故障档案:PG安装Extension导致无法连接

    今天遇到一个比较有趣的Case,客户报告说数据库连不上了。报这个错: psql: FATAL: could not load library "/export/servers/pgsql/lib/pg_hint_plan.so": /export/servers/pgsql/lib/pg_hint_plan.so: undefined symbol: RINFO_IS_PUSHED_DOWN 当然,这种错误一眼就知道是插件没编译好,报符号找不到。因此数据库后端进程在启动时尝试加载 …

    今天遇到一个比较有趣的Case,客户报告说数据库连不上了。报这个错: psql: FATAL: could not load library "/export/servers/pgsql/lib/pg_hint_plan.so": /export/servers/pgsql/lib/pg_hint_plan.so: undefined symbol: RINFO_IS_PUSHED_DOWN 当然,这种错误一眼就知道是插件没编译好,报符号找不到。因此数据库后端进程在启动时尝试加载 …

  • 故障档案:pg_dump导致的连接池污染

    冯若航 发布于 PGSQL 2403 字 5 分钟

    冯若航PostgreSQLPG管理故障复盘

    故障档案:pg_dump导致的连接池污染

    PostgreSQL很棒,但这并不意味着它是Bug-Free的。这一次在线上环境中,我又遇到了一个很有趣的Case:由 pg_dump 导致的线上故障。这是一个非常微妙的Bug,由Pgbouncer,search_path,以及特殊的 pg_dump 操作所触发。 背景知识 连接污染 在PostgreSQL中,每条数据库连接对应一个后端进程,会持有一些临时资源(状态),在连接结束时会被销毁,包括: 本会话中修改过的参数。RESET ALL; 准备好的语句。 DEALLOCATE ALL 打开的游 …

    PostgreSQL很棒,但这并不意味着它是Bug-Free的。这一次在线上环境中,我又遇到了一个很有趣的Case:由 pg_dump 导致的线上故障。这是一个非常微妙的Bug,由Pgbouncer,search_path,以及特殊的 pg_dump 操作所触发。 背景知识 连接污染 在PostgreSQL中,每条数据库连接对应一个后端进程,会持有一些临时资源(状态),在连接结束时会被销毁,包括: 本会话中修改过的参数。RESET ALL; 准备好的语句。 DEALLOCATE ALL 打开的游 …

  • PostgreSQL数据页面损坏修复

    冯若航 发布于 PGSQL 4434 字 9 分钟

    冯若航PostgreSQLPG管理故障复盘

    PostgreSQL数据页面损坏修复

    PostgreSQL是一个很可靠的数据库,但是再可靠的数据库,如果碰上了不可靠的硬件,恐怕也得抓瞎。本文介绍了在PostgreSQL中,应对数据页面损坏的方法。 最初的问题 线上有一套统计库跑离线任务,业务方反馈跑SQL的时候碰上一个错误: ERROR: invalid page in block 18858877 of relation base/16400/275852 看到这样的错误信息,第一直觉就是硬件错误导致的关系数据文件损坏,第一步要检查定位具体问题。 这里,16400是数据库的 …

    PostgreSQL是一个很可靠的数据库,但是再可靠的数据库,如果碰上了不可靠的硬件,恐怕也得抓瞎。本文介绍了在PostgreSQL中,应对数据页面损坏的方法。 最初的问题 线上有一套统计库跑离线任务,业务方反馈跑SQL的时候碰上一个错误: ERROR: invalid page in block 18858877 of relation base/16400/275852 看到这样的错误信息,第一直觉就是硬件错误导致的关系数据文件损坏,第一步要检查定位具体问题。 这里,16400是数据库的 …

  • 故障档案:序列号消耗过快导致整型溢出

    冯若航 发布于 PGSQL 1189 字 3 分钟

    冯若航PostgreSQLPG管理故障复盘

    故障档案:序列号消耗过快导致整型溢出

    0x01 概览 故障表现: 某张使用自增列的表序列号涨至整型上限,无法写入。 发现表中的自增列存在大量空洞,很多序列号没有对应记录就被消耗掉了。 故障影响:非核心业务某表,10分钟左右无法写入。 故障原因: 内因:使用了INTEGER而不是BIGINT作为主键类型。 外因:业务方不了解 SEQUENCE 的特性,执行大量违背约束的无效插入,浪费了大量序列号。 修复方案: 紧急操作:降级线上插入函数为直接返回,避免错误扩大。 应急方案:创建临时表,生成5000万个浪费空洞中的临时ID,修改插入函 …

    0x01 概览 故障表现: 某张使用自增列的表序列号涨至整型上限,无法写入。 发现表中的自增列存在大量空洞,很多序列号没有对应记录就被消耗掉了。 故障影响:非核心业务某表,10分钟左右无法写入。 故障原因: 内因:使用了INTEGER而不是BIGINT作为主键类型。 外因:业务方不了解 SEQUENCE 的特性,执行大量违背约束的无效插入,浪费了大量序列号。 修复方案: 紧急操作:降级线上插入函数为直接返回,避免错误扩大。 应急方案:创建临时表,生成5000万个浪费空洞中的临时ID,修改插入函 …

  • 故障档案:PostgreSQL事务号回卷

    冯若航 发布于 PGSQL 1972 字 4 分钟

    冯若航PostgreSQLPG管理故障复盘

    故障档案:PostgreSQL事务号回卷

    遇到一次磁盘坏块导致的事务回卷故障: 主库(PostgreSQL 9.3)磁盘坏块导致几张表上的VACUUM FREEZE执行失败。 无法回收老旧事务ID,导致整库事务ID濒临用尽,数据库进入自我保护状态不可用。 磁盘坏块导致手工VACUUM抢救不可行。 提升从库后,需要紧急VACUUM FREEZE才能继续服务,进一步延长了故障时间。 主库进入保护状态后提交日志(clog)没有及时复制到从库,从库产生存疑事务拒绝服务。 摘要 这是一个即将下线老旧库,疏于管理。坏块征兆在一周前就已经出现,没有及 …

    遇到一次磁盘坏块导致的事务回卷故障: 主库(PostgreSQL 9.3)磁盘坏块导致几张表上的VACUUM FREEZE执行失败。 无法回收老旧事务ID,导致整库事务ID濒临用尽,数据库进入自我保护状态不可用。 磁盘坏块导致手工VACUUM抢救不可行。 提升从库后,需要紧急VACUUM FREEZE才能继续服务,进一步延长了故障时间。 主库进入保护状态后提交日志(clog)没有及时复制到从库,从库产生存疑事务拒绝服务。 摘要 这是一个即将下线老旧库,疏于管理。坏块征兆在一周前就已经出现,没有及 …

  • 故障档案:快慢不匀雪崩

    冯若航 发布于 PGSQL 2855 字 6 分钟

    冯若航PostgreSQLPG管理故障复盘

    故障档案:快慢不匀雪崩

    最近发生了一起匪夷所思的故障,某数据库切走了一半的数据量和负载。 其他什么都没变,本来还好;压力减小,却在高峰期陷入濒死状态,完全不符合直觉。 但正如福尔摩斯所说,当你排除掉一切不可能之后,剩下的即使再离奇,也是事实。 一、摘要 某日凌晨4点,进行了核心库进行分库迁移,拆走一半的表和一半的查询负载,原库节点规模不变。 当日晚高峰核心库所有热备库(15台)出现连接堆积,压力暴涨,针对性地清理慢查询不再起效。 无差别持续杀查询,有立竿见影的救火效果(22:30后),且暂停后故障立刻重现 …

    最近发生了一起匪夷所思的故障,某数据库切走了一半的数据量和负载。 其他什么都没变,本来还好;压力减小,却在高峰期陷入濒死状态,完全不符合直觉。 但正如福尔摩斯所说,当你排除掉一切不可能之后,剩下的即使再离奇,也是事实。 一、摘要 某日凌晨4点,进行了核心库进行分库迁移,拆走一半的表和一半的查询负载,原库节点规模不变。 当日晚高峰核心库所有热备库(15台)出现连接堆积,压力暴涨,针对性地清理慢查询不再起效。 无差别持续杀查询,有立竿见影的救火效果(22:30后),且暂停后故障立刻重现 …