标签: 故障复盘
华为云国际站异常:与 IAM 升级有关?

2026 年 7 月 26 日 02:49(北京时间),华为云官方通知称,国际站部分账号出现异常,影响了相关服务的访问。华为云随后将通知标记为“已恢复”,并表示受影响账号已经恢复、国际站服务正常运行且数据安全;通知没有披露具体恢复时间与根因。 第三方监控平台 StatusGator 从 03:32 起出现密集的用户报障信号。按本文当时采集的页面数据,24 小时内累计提交量超过 450;08:15 的截图显示为 482 条。报告来自阿根廷、土耳其、巴西、埃及、泰国、墨西哥、智利等多个国际站市场。 …
2026 年 7 月 26 日 02:49(北京时间),华为云官方通知称,国际站部分账号出现异常,影响了相关服务的访问。华为云随后将通知标记为“已恢复”,并表示受影响账号已经恢复、国际站服务正常运行且数据安全;通知没有披露具体恢复时间与根因。 第三方监控平台 StatusGator 从 03:32 起出现密集的用户报障信号。按本文当时采集的页面数据,24 小时内累计提交量超过 450;08:15 的截图显示为 482 条。报告来自阿根廷、土耳其、巴西、埃及、泰国、墨西哥、智利等多个国际站市场。 …
当 AI 获得瘫痪一座城市交通的权力

3 月 31 日晚,武汉萝卜快跑车队出现大规模同时故障。真正值得警惕的,不只是自动驾驶翻车本身,而是云端集中管控架构可能把单车故障放大成城市级系统性风险。 昨晚武汉发生了什么 3 月 31 日晚,百度旗下萝卜快跑无人驾驶出租车在武汉发生大规模系统故障。据 快科技报道,多名司机和乘客在社交平台发布视频显示,当晚武汉多辆萝卜快跑在行驶过程中突然停下。 截至本文写作时,武汉交警通报称,事件初步判断为系统故障,乘客均已安全下车,无人员受伤,具体原因仍在进一步调查。下文的技术判断,基于公开信息与行业常识 …
3 月 31 日晚,武汉萝卜快跑车队出现大规模同时故障。真正值得警惕的,不只是自动驾驶翻车本身,而是云端集中管控架构可能把单车故障放大成城市级系统性风险。 昨晚武汉发生了什么 3 月 31 日晚,百度旗下萝卜快跑无人驾驶出租车在武汉发生大规模系统故障。据 快科技报道,多名司机和乘客在社交平台发布视频显示,当晚武汉多辆萝卜快跑在行驶过程中突然停下。 截至本文写作时,武汉交警通报称,事件初步判断为系统故障,乘客均已安全下车,无人员受伤,具体原因仍在进一步调查。下文的技术判断,基于公开信息与行业常识 …
无人机炸了三个AWS可用区:云计算进入战争时代

2026 年 3 月 1 日,伊朗无人机击中 AWS 阿联酋与巴林数据中心。这可能是公开报道中第一次有大型云厂商的数据中心遭到军事打击并瘫痪。以前可能有人觉得战争离软件工程很远,现在看,只隔着一层机柜门。 发生了什么? 2026年3月1日,中东冲突升级后,伊朗对阿联酋和巴林境内的多个目标实施了无人机/导弹打击,并对美国在中东资产展开报复。 在这波打击中,AWS位于阿联酋和巴林的数据中心被无人机直接命中。是的,不是断电,不是光缆被挖,不是空调故障,是 无人机物理命中了数据中心建筑,引发了火灾和结构 …
2026 年 3 月 1 日,伊朗无人机击中 AWS 阿联酋与巴林数据中心。这可能是公开报道中第一次有大型云厂商的数据中心遭到军事打击并瘫痪。以前可能有人觉得战争离软件工程很远,现在看,只隔着一层机柜门。 发生了什么? 2026年3月1日,中东冲突升级后,伊朗对阿联酋和巴林境内的多个目标实施了无人机/导弹打击,并对美国在中东资产展开报复。 在这波打击中,AWS位于阿联酋和巴林的数据中心被无人机直接命中。是的,不是断电,不是光缆被挖,不是空调故障,是 无人机物理命中了数据中心建筑,引发了火灾和结构 …
Claude 全球大宕机复盘:导弹还是成功税?

北京时间 3 月 2 日晚 19:49,Claude 崩了。 截止到本文发出时(次日 16:24),网页端仍然没有完全恢复。 网页版弹出“Claude is currently experiencing a temporary service disruption”,客户端登录失败,Console 报 500 错误。高峰时近 2000 名用户同时报障。消息迅速传开,社交媒体上一片哀嚎。 与此同时,另一条新闻正在刷屏:伊朗无人机炸了 AWS 在阿联酋的数据中心。 两件事撞到一起,一个极具戏剧性的叙 …
北京时间 3 月 2 日晚 19:49,Claude 崩了。 截止到本文发出时(次日 16:24),网页端仍然没有完全恢复。 网页版弹出“Claude is currently experiencing a temporary service disruption”,客户端登录失败,Console 报 500 错误。高峰时近 2000 名用户同时报障。消息迅速传开,社交媒体上一片哀嚎。 与此同时,另一条新闻正在刷屏:伊朗无人机炸了 AWS 在阿联酋的数据中心。 两件事撞到一起,一个极具戏剧性的叙 …
支付宝淘宝闲鱼崩了?又是消息队列的锅?

2025年12月4日晚,淘宝、支付宝、闲鱼集体崩了,用户钱扣了订单却显示未支付,症状与2024年双十一支付宝故障类似,推测根因可能是消息队列或分布式事务协调问题。 截止至本文发出,阿里巴巴截至发稿仍未公布任何技术原因说明。本文基于公开信息和技术原理分析,推测部分仅供参考。 发生了什么 2025年12月4日晚21点左右,淘宝、支付宝、闲鱼集体崩了。 用户付完钱,订单还显示"待付款";手一抖多点几下,同一笔订单扣了好几遍。 闲鱼客服排队9000+人,微博热搜前十被"淘宝崩了"“支付宝崩了"“闲鱼崩了 …
2025年12月4日晚,淘宝、支付宝、闲鱼集体崩了,用户钱扣了订单却显示未支付,症状与2024年双十一支付宝故障类似,推测根因可能是消息队列或分布式事务协调问题。 截止至本文发出,阿里巴巴截至发稿仍未公布任何技术原因说明。本文基于公开信息和技术原理分析,推测部分仅供参考。 发生了什么 2025年12月4日晚21点左右,淘宝、支付宝、闲鱼集体崩了。 用户付完钱,订单还显示"待付款";手一抖多点几下,同一笔订单扣了好几遍。 闲鱼客服排队9000+人,微博热搜前十被"淘宝崩了"“支付宝崩了"“闲鱼崩了 …
原地报废:不要在生产环境用Docker跑PostgreSQL!

早在 2019 年,老冯就在《把数据库放入 Docker 中是一个好主意吗?》提到过 —— 不要在生产环境用容器运行 PostgreSQL 数据库,因为你有极大概率会遇上一堆在物理机/虚拟机上根本不存在的麻烦与问题。 这不,最近用 Docker “官方” 的 Postgres 镜像的用户在升级的时候就踩雷了。 昨天 PostgreSQL 社区的老法师 Gwen Shapira 在 X 发了个帖子吐槽了这个事。 ⚠️重要提醒:不要在生产环境用 Docker 官方的 Postgres 镜像。 如果非 …
早在 2019 年,老冯就在《把数据库放入 Docker 中是一个好主意吗?》提到过 —— 不要在生产环境用容器运行 PostgreSQL 数据库,因为你有极大概率会遇上一堆在物理机/虚拟机上根本不存在的麻烦与问题。 这不,最近用 Docker “官方” 的 Postgres 镜像的用户在升级的时候就踩雷了。 昨天 PostgreSQL 社区的老法师 Gwen Shapira 在 X 发了个帖子吐槽了这个事。 ⚠️重要提醒:不要在生产环境用 Docker 官方的 Postgres 镜像。 如果非 …
Cloudflare 11-18 故障复盘报告

就在昨天,有 “赛博佛祖” 之称的 Cloudflare 遭遇自 2019 年以来的最严重故障 —— 正常的核心网络流量无法传输,长达六个小时。 ChatGPT、X(前 Twitter)、Spotify、Uber 等知名服务悉数中招。 故障的根因是修改了 ClickHouse 的权限,导致生成的反爬特征太大(200条),撑爆了 Rust 写的 Bot管理软件的硬编码限制,导致大量流量被标记为爬虫而被阻断。 Cloudflare 团队今天早上在其博客发布了故障复盘文章,老冯将其翻译为中文,并附上点 …
就在昨天,有 “赛博佛祖” 之称的 Cloudflare 遭遇自 2019 年以来的最严重故障 —— 正常的核心网络流量无法传输,长达六个小时。 ChatGPT、X(前 Twitter)、Spotify、Uber 等知名服务悉数中招。 故障的根因是修改了 ClickHouse 的权限,导致生成的反爬特征太大(200条),撑爆了 Rust 写的 Bot管理软件的硬编码限制,导致大量流量被标记为爬虫而被阻断。 Cloudflare 团队今天早上在其博客发布了故障复盘文章,老冯将其翻译为中文,并附上点 …
AWS 故障官方复盘报告

今天 AWS 官方发布了 10-20 日美东大故障 的事后复盘报告,细节比较丰富,算是少有的第一手现场资料。所以老冯把它翻译成了中文,并附上解读与评论,供大家参考。 故障公告:https://aws.amazon.com/cn/message/101925/ Amazon DynamoDB 服务中断总结 我们希望就2025年10月19日至20日发生在美国东部弗吉尼亚北部(us-east-1)区域的服务中断事件向您提供一些补充信息。 此次事件始于10月19日 PDT23:48,结束于10月20日 …
今天 AWS 官方发布了 10-20 日美东大故障 的事后复盘报告,细节比较丰富,算是少有的第一手现场资料。所以老冯把它翻译成了中文,并附上解读与评论,供大家参考。 故障公告:https://aws.amazon.com/cn/message/101925/ Amazon DynamoDB 服务中断总结 我们希望就2025年10月19日至20日发生在美国东部弗吉尼亚北部(us-east-1)区域的服务中断事件向您提供一些补充信息。 此次事件始于10月19日 PDT23:48,结束于10月20日 …
一次AWS DNS故障如何级联瘫痪半个互联网

2025年10月20日,AWS最关键的 us-east-1 区域发生了一场持续 15 小时的重大故障,导致全球超过 1000 家企业服务中断。 而这场故障背后的根因,竟然仅仅是一条 AWS 内部 DNS 解析失效。 从凌晨的 DNS 解析失效开始,AWS DynamoDB、EC2、Lambda 等 142 项服务相继受到影响,进而导致全球互联网的大部分功能停转。 Snapchat、Roblox、Coinbase、Signal、Reddit、Robinhood 等热门应用离线,数十亿美元在半天内蒸 …
2025年10月20日,AWS最关键的 us-east-1 区域发生了一场持续 15 小时的重大故障,导致全球超过 1000 家企业服务中断。 而这场故障背后的根因,竟然仅仅是一条 AWS 内部 DNS 解析失效。 从凌晨的 DNS 解析失效开始,AWS DynamoDB、EC2、Lambda 等 142 项服务相继受到影响,进而导致全球互联网的大部分功能停转。 Snapchat、Roblox、Coinbase、Signal、Reddit、Robinhood 等热门应用离线,数十亿美元在半天内蒸 …
Etcd坑了多少公司?

前几天 影视飓风分享的 Pigsty / PostgreSQL 高可用案例 里面踩的一个雷在 X 上引起网友热议。 “因为 etcd 未开启自动压实功能,且默认仅为 2GB 容量”,ayanamist 评论到:“ 我倒要看看 etcd 这个傻逼 2G 的设计可以坑多少公司 ”。 etcd 的 slogan 是:“一个分布式的、可靠的键-值存储,用于存放系统中最为关键的配置数据”。 目前最常见的场景是用于存储 K8S 的元数据。当然类似 Patroni 这样的 PostgreSQL 高可用方案也可 …
前几天 影视飓风分享的 Pigsty / PostgreSQL 高可用案例 里面踩的一个雷在 X 上引起网友热议。 “因为 etcd 未开启自动压实功能,且默认仅为 2GB 容量”,ayanamist 评论到:“ 我倒要看看 etcd 这个傻逼 2G 的设计可以坑多少公司 ”。 etcd 的 slogan 是:“一个分布式的、可靠的键-值存储,用于存放系统中最为关键的配置数据”。 目前最常见的场景是用于存储 K8S 的元数据。当然类似 Patroni 这样的 PostgreSQL 高可用方案也可 …
OpenAI全球宕机复盘:K8S循环依赖

12月11日,OpenAI 出现了全球范围内的不可用故障,影响了 ChatGPT,API,Sora,Playground 和 Labs 等服务。影响范围从 12 月 11 日下午 3:16 至晚上 7:38 期间,持续时间超过四个小时,产生显著影响。 根据 OpenIA 在事后发布的故障报告,此次故障的直接原因是新部署了一套监控,压垮了 Kubernetes 控制面。然后因为控制面故障导致无法直接回滚,进一步放大的故障影响,导致了长时间的不可用。 其实这个故障和去年双十一 阿里云全球史诗故障 非 …
12月11日,OpenAI 出现了全球范围内的不可用故障,影响了 ChatGPT,API,Sora,Playground 和 Labs 等服务。影响范围从 12 月 11 日下午 3:16 至晚上 7:38 期间,持续时间超过四个小时,产生显著影响。 根据 OpenIA 在事后发布的故障报告,此次故障的直接原因是新部署了一套监控,压垮了 Kubernetes 控制面。然后因为控制面故障导致无法直接回滚,进一步放大的故障影响,导致了长时间的不可用。 其实这个故障和去年双十一 阿里云全球史诗故障 非 …
阿里云:高可用容灾神话破灭

2024年9月10日,阿里云新加坡可用区C数据中心因锂电池爆炸导致火灾,到现在已经过去一周了,仍未完全恢复。 按照月度 SLA 定义的可用性计算规则(7天+/30天≈75%),服务可用性别说几个9了,连一个8都不剩了,而且还在进一步下降中。 当然,可用性八八九九已经是小问题了 —— 真正的问题是,放在单可用区里的数据还能不能找回来? 截止至 09-17,关键服务如 ECS, OSS, EBS, NAS, RDS 等仍然处于异常状态 通常来说,如果只是机房小范围失火的话,问题并不会特别大,因为电源 …
2024年9月10日,阿里云新加坡可用区C数据中心因锂电池爆炸导致火灾,到现在已经过去一周了,仍未完全恢复。 按照月度 SLA 定义的可用性计算规则(7天+/30天≈75%),服务可用性别说几个9了,连一个8都不剩了,而且还在进一步下降中。 当然,可用性八八九九已经是小问题了 —— 真正的问题是,放在单可用区里的数据还能不能找回来? 截止至 09-17,关键服务如 ECS, OSS, EBS, NAS, RDS 等仍然处于异常状态 通常来说,如果只是机房小范围失火的话,问题并不会特别大,因为电源 …
我们能从网易云音乐故障中学到什么?

今天下午 14:44 左右,网易云音乐出现 不可用故障,至 17:11 分恢复。网传原因为 基础设施/云盘存储 相关问题。 故障经过 故障期间,网易云音乐客户端可以正常播放离线下载的音乐,但访问在线资源会直接提示报错,网页版则直接出现 502 服务器报错无法访问。 在此期间,网易 163门户也出现 502 服务器报错,并在一段时间后 302 重定向到移动版主站。期间也有用户反馈 网易新闻 与其他服务也受到影响。 许多用户都反馈连不上网易云音乐后,以为是自己网断了,卸了APP重装,还有以为公司 …
今天下午 14:44 左右,网易云音乐出现 不可用故障,至 17:11 分恢复。网传原因为 基础设施/云盘存储 相关问题。 故障经过 故障期间,网易云音乐客户端可以正常播放离线下载的音乐,但访问在线资源会直接提示报错,网页版则直接出现 502 服务器报错无法访问。 在此期间,网易 163门户也出现 502 服务器报错,并在一段时间后 302 重定向到移动版主站。期间也有用户反馈 网易新闻 与其他服务也受到影响。 许多用户都反馈连不上网易云音乐后,以为是自己网断了,卸了APP重装,还有以为公司 …
蓝屏星期五:甲乙双方都是草台班子

最近,因为网络安全公司 CrowdStrike 发布的一个配置更新,全球范围内无数 Windows 电脑都陷入蓝屏死机状态,无数的混乱 —— 航司停飞,医院取消手术,超市、游乐园、各行各业歇业。 表:受到影响的行业领域、国家地区与相关机构(CrowdStrike导致大规模系统崩溃事件的技术分析) 涉及领域 相关机构 航空运输 美国、澳大利亚、英国、荷兰、印度、捷克、匈牙利、西班牙、中国香港、瑞士等部分航空公司出现航班延误或机场服务中断。美国达美航空、美国航空和忠实航空宣布停飞所有航班。 媒体通信 …
最近,因为网络安全公司 CrowdStrike 发布的一个配置更新,全球范围内无数 Windows 电脑都陷入蓝屏死机状态,无数的混乱 —— 航司停飞,医院取消手术,超市、游乐园、各行各业歇业。 表:受到影响的行业领域、国家地区与相关机构(CrowdStrike导致大规模系统崩溃事件的技术分析) 涉及领域 相关机构 航空运输 美国、澳大利亚、英国、荷兰、印度、捷克、匈牙利、西班牙、中国香港、瑞士等部分航空公司出现航班延误或机场服务中断。美国达美航空、美国航空和忠实航空宣布停飞所有航班。 媒体通信 …
CVE-2024-6387 SSH漏洞修复

漏洞描述,CVE-2024-6387: https://nvd.nist.gov/vuln/detail/CVE-2024-6387 基本上影响的都是比较新版本的操作系统,老的系统,比如 CentOS 7.9,RockyLinux 8.9 ,Ubuntu 20.04,Debian 11 因为 OpenSSH 版本老逃过一劫。 在 Pigsty 支持的操作系统发行版中,RockyLinux 9.3,Ubuntu 22.04,Debian 12 受到影响: ssh -V OpenSSH_8.7p1, …
漏洞描述,CVE-2024-6387: https://nvd.nist.gov/vuln/detail/CVE-2024-6387 基本上影响的都是比较新版本的操作系统,老的系统,比如 CentOS 7.9,RockyLinux 8.9 ,Ubuntu 20.04,Debian 11 因为 OpenSSH 版本老逃过一劫。 在 Pigsty 支持的操作系统发行版中,RockyLinux 9.3,Ubuntu 22.04,Debian 12 受到影响: ssh -V OpenSSH_8.7p1, …
删库:Google云爆破了大基金的整个云账户

由于“前所未有的配置错误”,Google Cloud 误删了 UniSuper 的云账户。 澳洲养老金基金负责人与 Google Cloud 全球首席执行官联合发布声明,为这一“极其令人沮丧和失望”的故障表示道歉。 https://x.com/0xdabbad00/status/1789011008549450025 因为一次 Google Cloud “举世无双” 的配置失误,澳洲养老金基金 Unisuper 的整个云账户被误删了,超过五十万名 UniSuper 基金会员一周都无法访问他们的养 …
由于“前所未有的配置错误”,Google Cloud 误删了 UniSuper 的云账户。 澳洲养老金基金负责人与 Google Cloud 全球首席执行官联合发布声明,为这一“极其令人沮丧和失望”的故障表示道歉。 https://x.com/0xdabbad00/status/1789011008549450025 因为一次 Google Cloud “举世无双” 的配置失误,澳洲养老金基金 Unisuper 的整个云账户被误删了,超过五十万名 UniSuper 基金会员一周都无法访问他们的养 …
我们能从腾讯云大故障中学到什么?

故障过去八天后,腾讯云发布了 4.8 号大故障的复盘报告。我认为是一件好事,因为阿里云双十一大故障的官方故障复盘至今仍然是拖欠着的。公有云厂商想要真正成为 —— 提供水与电的公共基础设施,那就需要承担起责任,接受公众监督 —— 云厂商有义务披露自己故障原因,并提出切实的可靠性改进方案与措施。 那么我们就来看一看这份复盘报告,看看里面有哪些信息,以及可以从中学到什么教训。 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 按照腾讯云官方给出的复盘报告(官方发布的“ …
故障过去八天后,腾讯云发布了 4.8 号大故障的复盘报告。我认为是一件好事,因为阿里云双十一大故障的官方故障复盘至今仍然是拖欠着的。公有云厂商想要真正成为 —— 提供水与电的公共基础设施,那就需要承担起责任,接受公众监督 —— 云厂商有义务披露自己故障原因,并提出切实的可靠性改进方案与措施。 那么我们就来看一看这份复盘报告,看看里面有哪些信息,以及可以从中学到什么教训。 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 按照腾讯云官方给出的复盘报告(官方发布的“ …
从降本增笑到真的降本增效

年底正是冲绩效的时间,互联网大厂大事故却是一波接一波。硬生生把降本增效搞成了“降本增笑” —— 这已经不仅仅是梗了,而是来自官方的自嘲。 双十一刚过,阿里云就出了打破行业纪录的 全球史诗级大翻车,然后开始了11月连环炸模式,在几次小故障后,又来了一场云数据库管控面跨国俩小时大故障—— 从月爆到周爆再到日爆。 但话音未落,滴滴 又出现了一场超过12小时的大失效,资损 几个亿 —— 替代品阿里旗下的高德打车直接爆单赚翻,堪称失之桑榆,收之东隅。 我已经替装死的阿里云做过复盘了《我们能从阿里云史诗级故 …
年底正是冲绩效的时间,互联网大厂大事故却是一波接一波。硬生生把降本增效搞成了“降本增笑” —— 这已经不仅仅是梗了,而是来自官方的自嘲。 双十一刚过,阿里云就出了打破行业纪录的 全球史诗级大翻车,然后开始了11月连环炸模式,在几次小故障后,又来了一场云数据库管控面跨国俩小时大故障—— 从月爆到周爆再到日爆。 但话音未落,滴滴 又出现了一场超过12小时的大失效,资损 几个亿 —— 替代品阿里旗下的高德打车直接爆单赚翻,堪称失之桑榆,收之东隅。 我已经替装死的阿里云做过复盘了《我们能从阿里云史诗级故 …
我们能从阿里云全球故障中学到什么?

时隔一年阿里云又出大故障,并创造了云计算行业闻所未闻的新记录 —— 全球所有区域/所有服务同时异常。阿里云不愿意发布故障复盘报告,那我就来替他复盘 —— 我们应当如何看待这一史诗级故障案例,以及,能从中学习到什么经验与教训? 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 2023年11月12日,双十一后第一天,阿里云出了一场史诗级大翻车。全球所有区域同时出现故障,创造了闻所未闻的行业新记录。 根据阿里云官方的服务状态页,全球所有区域/可用区 ✖️ 所有服务全 …
时隔一年阿里云又出大故障,并创造了云计算行业闻所未闻的新记录 —— 全球所有区域/所有服务同时异常。阿里云不愿意发布故障复盘报告,那我就来替他复盘 —— 我们应当如何看待这一史诗级故障案例,以及,能从中学习到什么经验与教训? 事实是什么? 原因是什么? 影响是什么? 评论与观点? 能学到什么? 事实是什么? 2023年11月12日,双十一后第一天,阿里云出了一场史诗级大翻车。全球所有区域同时出现故障,创造了闻所未闻的行业新记录。 根据阿里云官方的服务状态页,全球所有区域/可用区 ✖️ 所有服务全 …
如何用 pg_filedump 抢救数据?

备份是DBA的生命线 —— 但如果你的 PostgreSQL 数据库已经爆炸了又没有备份,那么该怎么办呢?也许 pg_filedump 可以帮到你! 最近遇到了一个比较离谱的活儿,情况是这样的:有个用户的 PostgreSQL 数据库损坏了,是 Gitlab 自己拉起的 PostgreSQL。没有从库,没有备份,也没有 dump。跑在拿 SSD 当透明缓存的BCACHE上,断电后起不来了。 但这还没完,接连经受了几轮摧残之后,它彻底歇菜了:首先是因为忘了挂BCACHE盘,导致 Gitlab重新 …
备份是DBA的生命线 —— 但如果你的 PostgreSQL 数据库已经爆炸了又没有备份,那么该怎么办呢?也许 pg_filedump 可以帮到你! 最近遇到了一个比较离谱的活儿,情况是这样的:有个用户的 PostgreSQL 数据库损坏了,是 Gitlab 自己拉起的 PostgreSQL。没有从库,没有备份,也没有 dump。跑在拿 SSD 当透明缓存的BCACHE上,断电后起不来了。 但这还没完,接连经受了几轮摧残之后,它彻底歇菜了:首先是因为忘了挂BCACHE盘,导致 Gitlab重新 …
故障档案:时间回溯导致的Patroni故障

摘要:机器因为故障重启,NTP服务在PG启动后修复了PG的时间,导致 Patroni 无法启动。 Patroni中的故障信息如下所示: Process %s is not postmaster, too much difference between PID file start time %s and process start time %s patroni 进程启动时间和pid时间不一致。就会认为:postgres is not running。 两个时间相差超过30秒。patroni 就 …
摘要:机器因为故障重启,NTP服务在PG启动后修复了PG的时间,导致 Patroni 无法启动。 Patroni中的故障信息如下所示: Process %s is not postmaster, too much difference between PID file start time %s and process start time %s patroni 进程启动时间和pid时间不一致。就会认为:postgres is not running。 两个时间相差超过30秒。patroni 就 …
故障档案:PG安装Extension导致无法连接

今天遇到一个比较有趣的Case,客户报告说数据库连不上了。报这个错: psql: FATAL: could not load library "/export/servers/pgsql/lib/pg_hint_plan.so": /export/servers/pgsql/lib/pg_hint_plan.so: undefined symbol: RINFO_IS_PUSHED_DOWN 当然,这种错误一眼就知道是插件没编译好,报符号找不到。因此数据库后端进程在启动时尝试加载 …
今天遇到一个比较有趣的Case,客户报告说数据库连不上了。报这个错: psql: FATAL: could not load library "/export/servers/pgsql/lib/pg_hint_plan.so": /export/servers/pgsql/lib/pg_hint_plan.so: undefined symbol: RINFO_IS_PUSHED_DOWN 当然,这种错误一眼就知道是插件没编译好,报符号找不到。因此数据库后端进程在启动时尝试加载 …
故障档案:pg_dump导致的连接池污染

PostgreSQL很棒,但这并不意味着它是Bug-Free的。这一次在线上环境中,我又遇到了一个很有趣的Case:由 pg_dump 导致的线上故障。这是一个非常微妙的Bug,由Pgbouncer,search_path,以及特殊的 pg_dump 操作所触发。 背景知识 连接污染 在PostgreSQL中,每条数据库连接对应一个后端进程,会持有一些临时资源(状态),在连接结束时会被销毁,包括: 本会话中修改过的参数。RESET ALL; 准备好的语句。 DEALLOCATE ALL 打开的游 …
PostgreSQL很棒,但这并不意味着它是Bug-Free的。这一次在线上环境中,我又遇到了一个很有趣的Case:由 pg_dump 导致的线上故障。这是一个非常微妙的Bug,由Pgbouncer,search_path,以及特殊的 pg_dump 操作所触发。 背景知识 连接污染 在PostgreSQL中,每条数据库连接对应一个后端进程,会持有一些临时资源(状态),在连接结束时会被销毁,包括: 本会话中修改过的参数。RESET ALL; 准备好的语句。 DEALLOCATE ALL 打开的游 …
PostgreSQL数据页面损坏修复

PostgreSQL是一个很可靠的数据库,但是再可靠的数据库,如果碰上了不可靠的硬件,恐怕也得抓瞎。本文介绍了在PostgreSQL中,应对数据页面损坏的方法。 最初的问题 线上有一套统计库跑离线任务,业务方反馈跑SQL的时候碰上一个错误: ERROR: invalid page in block 18858877 of relation base/16400/275852 看到这样的错误信息,第一直觉就是硬件错误导致的关系数据文件损坏,第一步要检查定位具体问题。 这里,16400是数据库的 …
PostgreSQL是一个很可靠的数据库,但是再可靠的数据库,如果碰上了不可靠的硬件,恐怕也得抓瞎。本文介绍了在PostgreSQL中,应对数据页面损坏的方法。 最初的问题 线上有一套统计库跑离线任务,业务方反馈跑SQL的时候碰上一个错误: ERROR: invalid page in block 18858877 of relation base/16400/275852 看到这样的错误信息,第一直觉就是硬件错误导致的关系数据文件损坏,第一步要检查定位具体问题。 这里,16400是数据库的 …
故障档案:序列号消耗过快导致整型溢出

0x01 概览 故障表现: 某张使用自增列的表序列号涨至整型上限,无法写入。 发现表中的自增列存在大量空洞,很多序列号没有对应记录就被消耗掉了。 故障影响:非核心业务某表,10分钟左右无法写入。 故障原因: 内因:使用了INTEGER而不是BIGINT作为主键类型。 外因:业务方不了解 SEQUENCE 的特性,执行大量违背约束的无效插入,浪费了大量序列号。 修复方案: 紧急操作:降级线上插入函数为直接返回,避免错误扩大。 应急方案:创建临时表,生成5000万个浪费空洞中的临时ID,修改插入函 …
0x01 概览 故障表现: 某张使用自增列的表序列号涨至整型上限,无法写入。 发现表中的自增列存在大量空洞,很多序列号没有对应记录就被消耗掉了。 故障影响:非核心业务某表,10分钟左右无法写入。 故障原因: 内因:使用了INTEGER而不是BIGINT作为主键类型。 外因:业务方不了解 SEQUENCE 的特性,执行大量违背约束的无效插入,浪费了大量序列号。 修复方案: 紧急操作:降级线上插入函数为直接返回,避免错误扩大。 应急方案:创建临时表,生成5000万个浪费空洞中的临时ID,修改插入函 …
故障档案:PostgreSQL事务号回卷

遇到一次磁盘坏块导致的事务回卷故障: 主库(PostgreSQL 9.3)磁盘坏块导致几张表上的VACUUM FREEZE执行失败。 无法回收老旧事务ID,导致整库事务ID濒临用尽,数据库进入自我保护状态不可用。 磁盘坏块导致手工VACUUM抢救不可行。 提升从库后,需要紧急VACUUM FREEZE才能继续服务,进一步延长了故障时间。 主库进入保护状态后提交日志(clog)没有及时复制到从库,从库产生存疑事务拒绝服务。 摘要 这是一个即将下线老旧库,疏于管理。坏块征兆在一周前就已经出现,没有及 …
遇到一次磁盘坏块导致的事务回卷故障: 主库(PostgreSQL 9.3)磁盘坏块导致几张表上的VACUUM FREEZE执行失败。 无法回收老旧事务ID,导致整库事务ID濒临用尽,数据库进入自我保护状态不可用。 磁盘坏块导致手工VACUUM抢救不可行。 提升从库后,需要紧急VACUUM FREEZE才能继续服务,进一步延长了故障时间。 主库进入保护状态后提交日志(clog)没有及时复制到从库,从库产生存疑事务拒绝服务。 摘要 这是一个即将下线老旧库,疏于管理。坏块征兆在一周前就已经出现,没有及 …
故障档案:快慢不匀雪崩

最近发生了一起匪夷所思的故障,某数据库切走了一半的数据量和负载。 其他什么都没变,本来还好;压力减小,却在高峰期陷入濒死状态,完全不符合直觉。 但正如福尔摩斯所说,当你排除掉一切不可能之后,剩下的即使再离奇,也是事实。 一、摘要 某日凌晨4点,进行了核心库进行分库迁移,拆走一半的表和一半的查询负载,原库节点规模不变。 当日晚高峰核心库所有热备库(15台)出现连接堆积,压力暴涨,针对性地清理慢查询不再起效。 无差别持续杀查询,有立竿见影的救火效果(22:30后),且暂停后故障立刻重现 …
最近发生了一起匪夷所思的故障,某数据库切走了一半的数据量和负载。 其他什么都没变,本来还好;压力减小,却在高峰期陷入濒死状态,完全不符合直觉。 但正如福尔摩斯所说,当你排除掉一切不可能之后,剩下的即使再离奇,也是事实。 一、摘要 某日凌晨4点,进行了核心库进行分库迁移,拆走一半的表和一半的查询负载,原库节点规模不变。 当日晚高峰核心库所有热备库(15台)出现连接堆积,压力暴涨,针对性地清理慢查询不再起效。 无差别持续杀查询,有立竿见影的救火效果(22:30后),且暂停后故障立刻重现 …