这波大厂全线宕机到底是怎么回事
今天早些时候看到消息,ChatGPT、Claude 还有 Grok 这几家主流大模型几乎在同一时间段集体“罢工”了,这在以往的运维记录里确实挺罕见的。
这种“三家同时挂掉”的情况,通常有两个排查方向。一个是上游的基础设施问题,比如 Cloudflare 这种 CDN 或者 AWS 之类的云服务商如果出了大面积路由故障,确实能让这么多厂商同时掉线。另一个是大家都在抢着部署某种底层架构更新,但这种概率极低。
下一篇
Google 这次把 Gemini Live 的实时语音功能直接塞进 →
我当时正在用 Claude Code 写一段重构逻辑,结果刚敲完一个命令就直接报错。这种感觉很微妙,不是说某一个模型抽风,而是感觉整个 AI 基础设施层好像出了什么问题。根据目前整理出的时间点,故障大约是从美国东部时间上午 11 点左右开始爆发的。
具体表现来看,这不只是简单的对话框报错,而是全功能的“瘫痪”:
- OpenAI 侧: ChatGPT 官方状态页直接报了 "elevated errors across ChatGPT and Codex",这范围挺广的。不仅是聊天,连登录、文件上传、Voice Mode 甚至最近刚出的 Deep Research 功能全都挂了。
- Anthropic 侧: Claude 网页版和 Claude Code 接口也同步出现了响应异常。
- xAI 侧: Grok 也没能幸免。
这种“三家同时挂掉”的情况,通常有两个排查方向。一个是上游的基础设施问题,比如 Cloudflare 这种 CDN 或者 AWS 之类的云服务商如果出了大面积路由故障,确实能让这么多厂商同时掉线。另一个是大家都在抢着部署某种底层架构更新,但这种概率极低。
最巧合的一个细节是,OpenAI 这次故障发生的时候,正赶上他们在预热 Astra 模型。虽然没法直接断定这两者有因果关系,但这种“关键时刻掉链子”的节奏确实让人心里没底。目前看这几家都已经陆续恢复了,但对于我们这种高度依赖 API 和自动化工具的开发者来说,这种集群式的故障暴露了目前 AI 服务生态的一个隐患:核心生产力工具的可用性高度集中,一旦底层链路出问题,几乎没有备选方案可以无缝切换。
免费 AI 工具箱 · 全部完全免费
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。
