GitHub 一个月内两次翻车
8 月 17 号,GitHub 挂了 7 小时 47 分钟。github.com、认证、Actions、API、PR、Issue、Copilot 全线瘫痪。上一次是 8 月 6 号 Actions 挂了,两次事故核心原因一模一样:容量规划没跟上流量增长。

下一篇
Template-as-Code 这事儿 →
官方事后复盘里有个数字扎心:4 月以来月提交量从 14 亿涨到 29 亿,翻了一倍多。可关键组件在 Central US 数据中心根本没扩容,流量峰值一到直接压垮认证链路,连锁反应把半个平台拖崩。更搞笑的是恢复阶段,Copilot 客户端疯狂重试反而把恢复中的流量再顶回去,不得不先限流再放行。
他们在往 Azure 迁移,现在平台负载 58% 跑在 Azure 上,Git 操作一半在 Azure。硬件也上了:300 万 CPU 核心、120 PB 高速存储、网络带宽全加满了。但架构层面的共享依赖还没拆干净,单点一炸全家遭殃。
两个直接改动值得记下来:
- 服务间调用统一加重试预算、变超时、限重试次数,防雪崩
- 重新审视低优先级 CPU/内存告警,找出突发流量下会先死的组件

说白了,规模增长是借口,不是理由。开发者不关心你后台多难,只关心能不能 push 代码、跑 Action、用 Copilot。一个月两次核心服务不可用,信任分扣光了。
免费 AI 工具箱 · 全部完全免费
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。
