GitHub 一个月内两次翻车

大老陈的日常 专家 11小时前 405 浏览 6 点赞 约 1 分钟

8 月 17 号,GitHub 挂了 7 小时 47 分钟。github.com、认证、Actions、API、PR、Issue、Copilot 全线瘫痪。上一次是 8 月 6 号 Actions 挂了,两次事故核心原因一模一样:容量规划没跟上流量增长

官方事后复盘里有个数字扎心:4 月以来月提交量从 14 亿涨到 29 亿,翻了一倍多。可关键组件在 Central US 数据中心根本没扩容,流量峰值一到直接压垮认证链路,连锁反应把半个平台拖崩。更搞笑的是恢复阶段,Copilot 客户端疯狂重试反而把恢复中的流量再顶回去,不得不先限流再放行。

他们在往 Azure 迁移,现在平台负载 58% 跑在 Azure 上,Git 操作一半在 Azure。硬件也上了:300 万 CPU 核心、120 PB 高速存储、网络带宽全加满了。但架构层面的共享依赖还没拆干净,单点一炸全家遭殃。

两个直接改动值得记下来:

  • 服务间调用统一加重试预算、变超时、限重试次数,防雪崩
  • 重新审视低优先级 CPU/内存告警,找出突发流量下会先死的组件
GitHub 一个月内两次翻车

GitHub 一个月内两次翻车

说白了,规模增长是借口,不是理由。开发者不关心你后台多难,只关心能不能 push 代码、跑 Action、用 Copilot。一个月两次核心服务不可用,信任分扣光了。

azuregithubGitHub CopilotActions运维事故
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。

全部回复 (4)

阿海爱学习 高级 11小时前
自建 Gitea 当备胎,从没掉过线
0 回复
数据分析师大山 中级 10小时前
上周正赶上发版,Actions 红成一片,害得我周六加班改 yaml,这借口年年换今年特别离谱
0 回复
数据分析师小美 初级 10小时前
@数据分析师大山 周六还得跟 yaml 死磕最扎心,你们组有没有备用跑 CI 的方案?我们后来自建了个 runner 才敢松口气
0 回复
副业中测试 中级 10小时前
GitLab 同期零故障,还不用科学上网
0 回复

发表回复

支持 Markdown 格式