<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Incident on VONNG</title><link>https://blog.vonng.com/en/tags/incident/</link><description>Recent content in Incident on VONNG</description><generator>Hugo</generator><language>en-US</language><lastBuildDate>Sun, 26 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.vonng.com/en/tags/incident/index.xml" rel="self" type="application/rss+xml"/><item><title>Huawei Cloud Incident: Was IAM Involved?</title><link>https://blog.vonng.com/en/cloud/huawei-iam/</link><pubDate>Sun, 26 Jul 2026 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/huawei-iam/</guid><description>Huawei Cloud confirmed abnormalities affecting some International Site accounts during a scheduled IAM upgrade window. The timing is suggestive, but the causal link remains unconfirmed.</description></item><item><title>When AI Gets the Power to Gridlock a City</title><link>https://blog.vonng.com/en/cloud/robo-clog/</link><pubDate>Wed, 01 Apr 2026 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/robo-clog/</guid><description>On the night of March 31, a large number of Apollo Go robotaxis in Wuhan failed at the same time. The real concern is not merely that autonomous driving failed, but that a centrally controlled, cloud-based architecture may amplify a single-vehicle failure into a city-scale systemic risk.</description></item><item><title>Claude's Global Outage: Missiles or a Success Tax?</title><link>https://blog.vonng.com/en/cloud/claude-outage/</link><pubDate>Tue, 03 Mar 2026 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/claude-outage/</guid><description>Claude went down globally on March 2, 2026. The cinematic theory blamed drone strikes on AWS in the Middle East, but the failure pattern points much more strongly to a front-end and authentication crunch triggered by explosive user growth.</description></item><item><title>Drones Took Out Three AWS AZ: Into the Era of Bombable Data Centers</title><link>https://blog.vonng.com/en/cloud/aws-me-bomb/</link><pubDate>Tue, 03 Mar 2026 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/aws-me-bomb/</guid><description>On March 1, 2026, Iranian drones reportedly hit AWS facilities in the UAE and Bahrain. If the reporting is accurate, this may be the first public case of a hyperscale cloud provider suffering direct military damage to data-center infrastructure.</description></item><item><title>Alipay, Taobao, Xianyu Went Dark. Smells Like a Message Queue Meltdown.</title><link>https://blog.vonng.com/en/cloud/alipay-crash/</link><pubDate>Fri, 05 Dec 2025 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/alipay-crash/</guid><description>Dec 4, 2025, Taobao, Alipay, and Xianyu all cratered. Users got charged while orders still showed “unpaid,” a carbon copy of the 2024 Double-11 fiasco.</description></item><item><title>Don't Run Docker Postgres for Production!</title><link>https://blog.vonng.com/en/db/no-docker-pg/</link><pubDate>Thu, 20 Nov 2025 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/db/no-docker-pg/</guid><description>Tons of users running the official docker postgres image got burned during recent minor version upgrades. A friendly reminder: think twice before containerizing production databases.</description></item><item><title>Cloudflare’s Nov 18 Outage, Translated and Dissected</title><link>https://blog.vonng.com/en/cloud/cf-ck-down/</link><pubDate>Wed, 19 Nov 2025 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/cf-ck-down/</guid><description>A ClickHouse permission tweak doubled a feature file, tripped a Rust hard limit, and froze Cloudflare’s core traffic for six hours—their worst outage since 2019. Here’s the full translation plus commentary.</description></item><item><title>AWS’s Official DynamoDB Outage Postmortem</title><link>https://blog.vonng.com/en/cloud/aws-postmotem/</link><pubDate>Fri, 24 Oct 2025 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/aws-postmotem/</guid><description>AWS finally published the Oct 20 us-east-1 postmortem. I translated the key parts and added commentary on how one DNS bug toppled half the internet.</description></item><item><title>How One AWS DNS Failure Cascaded Across Half the Internet</title><link>https://blog.vonng.com/en/cloud/aws-dns-failure/</link><pubDate>Tue, 21 Oct 2025 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/aws-dns-failure/</guid><description>us-east-1’s DNS control plane faceplanted for 15 hours and dragged 142 AWS services—and a good chunk of the public internet—down with it. Here’s the forensic tour.</description></item><item><title>How Many Shops Has etcd Torched?</title><link>https://blog.vonng.com/en/db/bad-etcd/</link><pubDate>Wed, 07 May 2025 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/db/bad-etcd/</guid><description>Plenty. If you’re rolling your own Kubernetes, odds are you’ll crash because etcd ships with a 2 GB time bomb.</description></item><item><title>OpenAI Global Outage Postmortem: K8S Circular Dependencies</title><link>https://blog.vonng.com/en/cloud/openai-failure/</link><pubDate>Sat, 14 Dec 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/openai-failure/</guid><description>Even trillion-dollar unicorns can be a house of cards when operating outside their core expertise.</description></item><item><title>Alibaba-Cloud: High Availability Disaster Recovery Myth Shattered</title><link>https://blog.vonng.com/en/cloud/aliyun-ha/</link><pubDate>Tue, 17 Sep 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/aliyun-ha/</guid><description>Seven days after Singapore Zone C failure, availability not even reaching 8, let alone multiple 9s. But compared to data loss, availability is just a minor issue</description></item><item><title>What Can We Learn from NetEase Cloud Music's Outage?</title><link>https://blog.vonng.com/en/cloud/netease/</link><pubDate>Sun, 18 Aug 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/netease/</guid><description>NetEase Cloud Music experienced a two-and-a-half-hour outage this afternoon. Based on circulating online clues, we can deduce that the real cause behind this incident was&amp;hellip;</description></item><item><title>Blue Screen Friday: Amateur Hour on Both Sides</title><link>https://blog.vonng.com/en/cloud/bsod-friday/</link><pubDate>Tue, 23 Jul 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/bsod-friday/</guid><description>Both client and vendor failed to control blast radius, leading to this epic global security incident that will greatly benefit local-first software philosophy.</description></item><item><title>CVE-2024-6387 SSH Vulnerability Fix</title><link>https://blog.vonng.com/en/db/cve-2024-6387/</link><pubDate>Thu, 04 Jul 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/db/cve-2024-6387/</guid><description>This vulnerability affects EL9, Ubuntu 22.04, Debian 12. Users should promptly update OpenSSH to fix this vulnerability.</description></item><item><title>Database Deletion Supreme - Google Cloud Nuked a Major Fund's Entire Cloud Account</title><link>https://blog.vonng.com/en/cloud/gcp-unisuper/</link><pubDate>Sat, 11 May 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/gcp-unisuper/</guid><description>Due to an &amp;ldquo;unprecedented configuration error,&amp;rdquo; Google Cloud mistakenly deleted trillion-RMB fund giant UniSuper&amp;rsquo;s entire cloud account, cloud environment and all off-site backups, setting a new record in cloud computing history!</description></item><item><title>What Can We Learn from Tencent Cloud's Major Outage?</title><link>https://blog.vonng.com/en/cloud/qcloud/</link><pubDate>Sun, 14 Apr 2024 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/qcloud/</guid><description>Tencent Cloud&amp;rsquo;s epic global outage after Double 11 set industry records. How should we evaluate and view this failure, and what lessons can we learn from it?</description></item><item><title>From Cost-Reduction Jokes to Real Cost Reduction and Efficiency</title><link>https://blog.vonng.com/en/cloud/smile/</link><pubDate>Wed, 29 Nov 2023 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/smile/</guid><description>Alibaba-Cloud and Didi had major outages one after another. This article discusses how to move from cost-reduction jokes to real cost reduction and efficiency — what costs should we really reduce, what efficiency should we improve?</description></item><item><title>What Can We Learn from Alibaba-Cloud's Global Outage?</title><link>https://blog.vonng.com/en/cloud/aliyun/</link><pubDate>Mon, 13 Nov 2023 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/cloud/aliyun/</guid><description>Alibaba-Cloud&amp;rsquo;s epic global outage after Double 11 set an industry record. How should we evaluate this incident, and what lessons can we learn from it?</description></item><item><title>How to Use pg_filedump for Data Recovery?</title><link>https://blog.vonng.com/en/pg/pg-filedump/</link><pubDate>Wed, 27 Sep 2023 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/pg-filedump/</guid><description>Backups are a DBA&amp;rsquo;s lifeline — but what if your PostgreSQL database has already exploded and you have no backups? Maybe pg_filedump can help you!</description></item><item><title>Incident-Report: Patroni Failure Due to Time Travel</title><link>https://blog.vonng.com/en/pg/time-travel/</link><pubDate>Mon, 22 Feb 2021 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/time-travel/</guid><description>Machine restarted due to failure, NTP service corrected PG time after PG startup, causing Patroni to fail to start.</description></item><item><title>Incident: PostgreSQL Extension Installation Causes Connection Failure</title><link>https://blog.vonng.com/en/pg/extension/</link><pubDate>Thu, 13 Jun 2019 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/extension/</guid><description>Today encountered an interesting case where a customer reported database connection issues caused by extensions.</description></item><item><title>Incident-Report: Connection-Pool Contamination Caused by pg_dump</title><link>https://blog.vonng.com/en/pg/pg-dump-failure/</link><pubDate>Tue, 11 Dec 2018 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/pg-dump-failure/</guid><description>Sometimes, interactions between components manifest in subtle ways. For example, using pg_dump to export data from a connection pool can cause connection pool contamination issues.</description></item><item><title>PostgreSQL Data Page Corruption Repair</title><link>https://blog.vonng.com/en/pg/page-corruption/</link><pubDate>Thu, 29 Nov 2018 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/page-corruption/</guid><description>Using binary editing to repair PostgreSQL data pages, and how to make a primary key query return two records.</description></item><item><title>Incident-Report: Integer Overflow from Rapid Sequence Number Consumption</title><link>https://blog.vonng.com/en/pg/sequence-overflow/</link><pubDate>Fri, 20 Jul 2018 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/sequence-overflow/</guid><description>If you use Integer sequences on tables, you should consider potential overflow scenarios.</description></item><item><title>Incident-Report: PostgreSQL Transaction ID Wraparound</title><link>https://blog.vonng.com/en/pg/xid-wrap-around/</link><pubDate>Fri, 20 Jul 2018 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/xid-wrap-around/</guid><description>XID WrapAround is perhaps a unique type of failure specific to PostgreSQL</description></item><item><title>Incident-Report: Uneven Load Avalanche</title><link>https://blog.vonng.com/en/pg/download-failure/</link><pubDate>Sun, 08 Apr 2018 00:00:00 +0000</pubDate><guid>https://blog.vonng.com/en/pg/download-failure/</guid><description>Recently there was a perplexing incident where a database had half its data volume and load migrated away, but ended up being overwhelmed due to increased load.</description></item></channel></rss>