# 腾讯云：颜面尽失的草台班子

LLMS 索引： [llms.txt](/llms.txt)

---

昨天下午，2024年04月08日，腾讯云出现了一场全球性的大故障，用腾讯云官方的说法，崩了 74 分钟（15:31 - 16:45），波及全球 17 个区域与数十款服务。

## 事实影响是什么

**但这与我观察到的事实不符** —— 从故障范围上来说，这次的故障几乎是去年[阿里云双十一史诗级大故障](https://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247486452&idx=1&sn=29cff4ee30b90483bd0a4f0963876f28&scene=21#wechat_redirect "阿里云双十一史诗级大故障")的翻版 —— 小道消息是整个管控面 GG，云 API 挂了，所以现象与去年阿里云如出一辙：依赖云 API 的云产品控制台不能用了。

被管控的纯资源，如云服务器 CVM，云数据库 RDS， 设置了公开读写访问对象存储 COS 不受影响可以继续使用。然而依赖认证与API 的各种云 PaaS 服务，例如标准的私有读写的对象存储 COS，就抓瞎了。

因为阿里云至今没有做一个像样的事后故障复盘，因此在《[我们能从阿里云史诗级故障中学到什么](https://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247486468&idx=1&sn=7fead2b49f12bc2a2a94aae942403c22&scene=21#wechat_redirect "我们能从阿里云史诗级故障中学到什么")》中，我为阿里云的这次故障做了非官方的技术复盘。同样的判断逻辑完全也适用于这次故障 —— 这样的爆炸半径，根因出在 Auth 上的概率很大。目前，腾讯云仍然没有给出官方的事后故障复盘报告，也可能不会有了。

------------------------------------------------------------------------

## 忽悠人的状态页

我的朋友杨攀曾写过一篇《[中国云服务走向全球？先把 Status Page 搞定](https://mp.weixin.qq.com/s?__biz=MjM5NzY0NzAwMQ==&mid=2456881916&idx=1&sn=7d62bfe73053c1f0460d318b2b87203e&scene=21#wechat_redirect "中国云服务走向全球？先把 Status Page 搞定")》，讨论了 Status Page （服务健康状态页）对于公有云服务的重要性，各家本土云厂商也跟进了这一特性，包括腾讯云。—— 状态页能在服务宕机的情况下有效减少客户的焦虑，降低沟通成本，但它的核心价值在于 “**建立与客户的信任关系**”。

![图片](01.webp)

看上去，腾讯云与阿里云的 Status Page 反应都比较迟缓，在故障发生后三四十分钟才开始更新。而不是像 [**Cloudflare**](http://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247487240&idx=1&sn=ba535fd0c1026bc2482ea6ad1e1fb8bf&chksm=fe4b3ad3c93cb3c50bfeaed64963cce25c49bee80364d3a8ca78b87d7c9f19fd4d79d3c62ddc&scene=21#wechat_redirect) 等产品一样及时更新故障，或采用自动化方式监测到故障后立即推送。但不同于阿里云 —— 虽慢却诚实地标记了所有服务受到影响，腾讯云的 Status Page 连基本的真实性与准确性都堪称稀烂。

例如，受到影响的对象存储 COS 服务，在有用户上报问题的几个可用区中，我并没有看到 Status 标红。而这样的例子还有更多。事实上如果问题真出在管控 API 上，那么影响的范围应该和阿里云一样 —— 所有服务的控制面。因此，这样鸡贼的做法只会给客户留下：“**不透明、有猫腻**“ 的负面印象。

------------------------------------------------------------------------

## 撒谎的三无公告

在故障出现 40 ～ 50 分钟后，腾讯云终于发出了第一份故障公告，也是截止到目前 Status Page 上唯一一份公告。但其内容就一句话 —— **三无公告**：无时间（故障时间），无地点（可用区/AZ），无范围（影响服务）。而且姗姗来迟，比我替它发的公告《[【腾讯】云计算史诗级二翻车来了](/cloud/tencent-epic-fail-2/)》还晚了十分钟。

![图片](02.webp)

但这份公告最致命的问题是真实性与准确性：首先，故障绝对不仅仅是“控制台”，而是整个控制面。作为一个专业的云计算服务供应商，一字之差天壤之别，混淆两者区别的原因，**要么是蠢**（缺乏专业素养，台面混为一谈）。**要么是坏**（避重就轻，推卸责任）。

请问，一个全身休克的人，说他 “面色异常”，这是一个真诚的回复吗？请问，一台被砸烂的笔记本电脑，说它“敲击键盘没有反应”是一个有意义的描述吗？同理，一个控制面爆炸的公有云，说自己“**控制台异常**”，是一个认真的回复吗？

其次，从事后官微的发布与用户群的反馈来看，在这个时间，**“目前故障已恢复”**  **是在撒谎**。至少相当一部分服务的可用性事件是在 16:45 标记恢复的，在17 点前后，腾讯云产品吐槽群中也仍然有一些问题上报。

**我认为这份对腾讯云带来的伤害远比服务宕机要大的多** —— 首先，在及时性，准确性上体现出了极差的专业素养。其次，在真实性上有意做手脚，会伤及公有云，或者说一切生意的根本 —— **诚信**。**这对品牌形象是一个摧毁性打击。**

------------------------------------------------------------------------

## 灾难级别的公关

按理说，出现了这么严重的故障，应当用诚恳认真的态度去处理，但腾讯云官方微博居然还在抖机灵 —— **堪称灾难级别的公关水平**。

![图片](03.webp)

这条微博也再次扇了腾讯云自己官网公告的大嘴巴子 —— 16:45 分发第一条帖子时，“***工程师仍在紧急修复中***”，17:16，距离第一次报告故障的 15:31已经过去近两个小时，“***已经整体恢复***”。然而，根据腾讯云官网 16:21 发布的公告<sup>[1]</sup>声称：“***故障已恢复***”。从实际情况来看，**再次证明了官网公告在说谎**。

阿里云双十一大故障的时候，刚刚开完云栖大会，打脸了吹下的极致高可用的牛逼，但毕竟隔了一周了。而腾讯云这次大故障的**同时**还在开发布会吹牛逼，还找特大号发了一篇软文：《[太意外了！国内80%大模型都存在鹅厂！](https://mp.weixin.qq.com/s?__biz=MzI3MzAzNDAyMQ==&mid=2657846320&idx=1&sn=78ace56768acb5f2d8f914cc69687bd6&scene=21#wechat_redirect "太意外了！国内80%大模型都存在鹅厂！")》，发布时间 **16:19**，2分钟后官网发出故障通告，堪称光速打脸二次方。

![图片](04.webp)

与之形成鲜明对照的是，[去年 11 月 Cloudflare 的故障](http://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247486468&idx=1&sn=7fead2b49f12bc2a2a94aae942403c22&chksm=fe4b39dfc93cb0c92e5d4c67241de0519ae6a23ce6f07fe5411b95041accb69e5efb86a38150&scene=21#wechat_redirect)，Cloudflare CEO Matthew 亲自出来对故障进行道歉与复盘，相比之下，国内云厂商的危机公关堪称灾难级别 —— 彻底做实了草台班子的称号。

## 实锤的草台班子

请允许我引用瑞典马工的一句名言 ：“[***阿里云是个工程质量差劲的正经云，但腾讯云是一群业余销售加业务码农玩游戏***](http://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247485363&idx=1&sn=8622b25fd2309d4fc969d22964a04129&chksm=fe4b3268c93cbb7efb8757e876574bebf5d615bdd3c4ceb76e48b2bd907d78faeb450ca1e825&scene=21#wechat_redirect)”。所谓光鲜亮丽的大厂，在里面也不过是一个又一个的草台班子。

![图片](05.webp)

## Reference

### **公告: *https://cloud.tencent.com/announce/detail/1995***

https://www.oschina.net/news/286685

https://www.v2ex.com/t/1030638

https://www.v2ex.com/t/103061

------------------------------------------------------------------------

[云计算泥石流](http://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247486813&idx=1&sn=ffb126fdd061c1e27626dd558f6fa26a&chksm=fe4b3886c93cb190e2acf7af6cfd25f298199f6ee73da566bed050c066b96753b913e3453d4f&scene=21#wechat_redirect)曾几何时，“上云“近乎成为技术圈的政治正确，整整一代应用开发者的视野被云遮蔽。就让我们用实打实的数据分析与亲身经历，讲清楚公有云租赁模式的价值与陷阱 —— 在这个降本增效的时代中，供您借鉴与参考。[【腾讯】云计算史诗级二翻车来了](/cloud/tencent-epic-fail-2/)\
[从降本增笑到真的降本增效](/cloud/smile/)[我们能从阿里云史诗级故障中学到什么](https://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247486468&idx=1&sn=7fead2b49f12bc2a2a94aae942403c22&scene=21#wechat_redirect "我们能从阿里云史诗级故障中学到什么")[阿里云周爆：云数据库管控又挂了](/cloud/aliyun-weekly-crash/)\
[【阿里】云计算史诗级大翻车来了](https://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247486452&idx=1&sn=29cff4ee30b90483bd0a4f0963876f28&scene=21#wechat_redirect "【阿里】云计算史诗级大翻车来了")

### [牙膏云？您可别吹捧云厂商了](/cloud/toothpaste-cloud/)\

[罗永浩救不了牙膏云](http://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247487223&idx=1&sn=da885170d5d65a3c646d8b3d9da3aed3&chksm=fe4b3b2cc93cb23a5625e8c183860a9e1528eca0a1311439f1ec308a74d53f10cf5dbbb9a1d0&scene=21#wechat_redirect)[吊打公有云的赛博佛祖 Cloudflare](/cloud/cloudflare/)\
[云计算为啥还没挖沙子赚钱？](/cloud/profit/)[FinOps终点是下云](/cloud/finops/)[卡在政企客户门口的阿里云](/cloud/aliyun-enterprise-market/)[云厂商眼中的客户：又穷又闲又缺爱](/cloud/cloud-customers-poor-bored-lonely/) [阿里云降价背后折射出的绝望](/cloud/aliyun-price-cut-despair/)迷失在阿里云的年轻人[互联网故障背后的草台班子们](/cloud/amateur-internet-outages/) [门内的国企如何看门外的云厂商](/cloud/state-owned-enterprise-cloud-view/)[剖析云算力成本，阿里云真的降价了吗？](http://mp.weixin.qq.com/s?__biz=MzU5ODAyNTM5Ng==&mid=2247487089&idx=1&sn=ca16c2e7e534380eadcb3a3870d8e3b4&chksm=fe4b3baac93cb2bc8c4b68c468acf3e8ac5ee124080a3e738262fe99dd1765c3adf9c56ea650&scene=21#wechat_redirect)\
