公司推 AI 自动化半年,真正跑通生产环境的只有这三个场景
一、代码 Review 的「第一遍」真省事了
最稳的是把 git push 触发的 GitLab CI 里加一步:用 gpt-4o-mini 先过一遍 diff,只看明显的低级错误——漏 null 判断、SQL 拼接、日志打密文、异常吞掉不抛。Prompt 就十几行,塞进系统提示词里,输出强制按 JSON 格式回:文件名、行号、问题等级、修改建议。
上线三个月,拦住的真问题占比 60% 左右,剩下 40% 是误报(比如故意吞异常的熔断逻辑)。但只要把「误报」标记喂回去微调两次 few-shot,准头就上来了。现在组里新人提 MR,CI 绿灯亮之前,大概率已经被 AI 骂过一轮,人工 Review 直接从「看语法」变「看业务逻辑」,人均少花 20 分钟。
二、运维告警的「第一响应」不用人熬夜了
以前 P0 告警响了,值班同学得爬起来登跳板机、翻日志、对着 runbook 一步步排查。现在接了个 Webhook,告警上来先喂给 claude-3.5-sonnet,带上最近 500 行日志、部署变更记录、监控面板截图链接。Prompt 让它只做三件事:判断严重度、给出前三大疑似根因、列出前三条验证命令。
跑了两个多月,P0 平均定位时间从 45 分钟压到 12 分钟。有次数据库连接池耗尽,AI 直接甩出 show processlist 和 kill 命令,值班同学复制粘贴执行,五分钟恢复。当然也翻车过——有次 Kubernetes OOM Kill,AI 非说是内存泄漏建议重启 Pod,实际是 Limit 设太低。后来在 Prompt 里加了「先查 Limit/Request 再下结论」,就没犯第二次。
三、文档同步终于不靠自觉了
最让我意外的是这个:把 OpenAPI Spec 的变更 Webhook 挂到 CI,触发一个 Job,让模型对比新旧 Spec,自动生成迁移文档和前端调用示例,直接提 PR 到 docs 仓库。前端组以前最烦「后端改了接口不告诉我们」,现在 PR 一合并,文档里的请求/响应示例、错误码表、甚至 Mock 数据工厂代码全是最新的。
副作用是生成的 Markdown 有时候格式乱,得人工改两行。但比起以前「文档永远滞后两个版本」,这已经是质变。
踩过的坑别再踩
1. 别想一步到位「全自动」。上来就想让 AI 直接合并代码、重启服务、扩容集群,生产环境不敢信。先做「辅助决策」,跑够三个月零事故,再谈半自动。
2. Prompt 也是代码,得进版本控制。我们把所有生产用的 Prompt 放在 infra/ai-prompts/ 目录,改动走 Code Review,回滚用 git revert。别把 Prompt 存在环境变量里,出了事根本查不出是谁改的。
3. 模型版本锁死,别跟着官方滚动更新。gpt-4o-mini 升级后输出格式变过一次,导致 CI 解析 JSON 报错卡住整条线。现在全锁 gpt-4o-mini-2024-07-18,重大版本先在 Staging 跑两周。
4. 成本要算细账。三条线加起来,月均 Token 费用约 180 美元,比请一个实习生便宜得多。但如果把「自动重构老代码」那条上生产,光是 Token 就得烧掉预算的 60%,ROI 完全对不上。
现在群里安静多了,大家不再晒花活,都在讨论怎么把这三条流水线的召回率再提 5 个点。毕竟能跑在生产环境上、还能睡个安稳觉的 AI 自动化,才是真正帮打工人干活的。