CAIO 评审
caio-review
/cs:caio-review — CAIO 强制性质询
命令: /cs:caio-review <plan>
追求评估结果的 CAIO 将对任何涉及 AI 的方案进行压力测试。在发布任何 AI 功能、签署多年供应商协议或扩大 AI 团队之前,必须回答以下六个问题。
运行时机
- 发布任何新的 AI 驱动功能之前
- 签署多年 AI 供应商合同(API 或自托管基础设施)之前
- 任何 AI 功能在欧盟上线之前
- 进行重大 AI 团队招聘(尤其是 ML 工程师或研究科学家)之前
- 承诺启动微调项目之前
- 在受监管领域(就业、信用、医疗、教育等)采用 AI 之前
- 当创始人将 "AI" 与 "竞争优势" 或 "护城河" 放在一起讨论时
CAIO 六大质询问题
1. 这个 AI 需要擅长什么,你如何衡量它?
没有评估集 (Eval set) = 不允许发布。 在部署任何 AI 功能之前,必须定义评估标准。- 至少 50-100 个具有代表性的输入
- 预期输出 或 评分量表 (Rubric)
- 边缘情况:模糊输入、对抗性输入、格式边缘情况
- 如果你无法写出“优秀”的标准,那么你拥有的不是一个功能,而是一种“感觉”。
2. 幻觉/错误率的 SLO 是多少,回退方案是什么?
每个 AI 功能都有失效模式。请为此制定计划。- 量化的 SLO:例如“事实性查询的幻觉率 <5%”
- 检测机制:监控、抽样、客户反馈闭环
- 回退方案:人工审核 (Human-in-loop)、低风险默认响应、拒绝回答
- 若违反 SLO 的影响范围:影响多少用户,成本是多少?
3. 在《欧盟 AI 法案》中属于哪个风险等级,是否需要合规评估?
如果涉及欧盟居民或处于受监管领域,请运行ai_risk_classifier.py。
- 禁止 (PROHIBITED) $\rightarrow$ 不能在欧盟发布;重新定义范围
- 高风险 (HIGH) $\rightarrow$ 合规评估 + 欧盟数据库注册 + 10 项义务条款(耗时 3-12 个月,成本 5-20 万美元)
- 低风险 (LIMITED) $\rightarrow$ 透明度义务(聊天机器人披露、AI 生成内容标记)
- 极低风险 (MINIMAL) $\rightarrow$ 无特定义务;自愿参考 NIST AI RMF
4. 选择 API、微调还是自建?
针对具体用例运行model_buildvsbuy_calculator.py。
- 80% 的 B2B SaaS 用例:API
- 15%:微调(需满足:特定领域行为 + 标注数据 + ML 团队 + 高调用量)
- <1%:从零开始构建
- 决策必须考虑经济平衡点以及实际可行性(数据、团队、合规性)
5. 在预期规模下,12 个月的成本轨迹如何?
针对工作负载运行ai_cost_economics.py。
- API:可变成本,线性增长
- 自托管:主要是固定成本,对于 70B 级别模型,平衡点通常在每月 10 亿至 100 亿 token
- 自托管的隐藏成本:运维、监控、模型更新、容量规划、故障转移、安全
- API 的隐藏成本:供应商锁定、能力漂移、速率限制、数据驻留
- Prompt 缓存是最被低估的优化杠杆;请检查供应商是否支持
6. 哪个角色能解决这个瓶颈 —— 我们是否先招聘了前置条件角色?
将 AI 能力映射到具体角色。创始人经常混淆 AI 工程师 / ML 工程师 / 研究科学家。- AI 工程师:应用层 + 全栈 + Prompt + 评估 + 部署(大多数初创公司需要的是这个)
- ML 工程师:微调 + 重新训练
- 基础设施工程师 (仅在有平台工程师 + 标注数据后招聘)
- 研究科学家:模型创新 (仅当模型本身即为产品时)
- 不要将研究科学家作为首位 AI 员工招聘 —— 他们需要基础设施才能高效工作
工作流
bash
# 1. 模型选择检查
python ../../../skills/chief-ai-officer-advisor/scripts/model_buildvsbuy_calculator.py use_case.json
2. 合规分类
python ../../../skills/chief-ai-officer-advisor/scripts/ai_risk_classifier.py use_case.json
3. 成本预测
python ../../../skills/chief-ai-officer-advisor/scripts/ai_cost_economics.py workload.json输出格式
markdown
# CAIO 评审: <方案>
日期: YYYY-MM-DD
决策事项
[一句话描述 —— 属于哪项 CAIO 决策:模型选择 | 风险分类 | 经济评估 | 下一次招聘]
评估纪律
- 已提交评估集:是/否
- 已定义 SLO:<指标> < <阈值>
- 回退机制:<一行描述>
模型选择 (如适用)
- 建议方案:API / 微调 (FINE_TUNE) / 自研 (BUILD)
- 3 年 TCO:$X (选定方案) vs $Y (替代方案)
- 盈亏平衡点:<业务量>
风险分类 (如适用)
- 欧盟 AI 法案等级:禁止 (PROHIBITED) / 高风险 (HIGH) / 有限风险 (LIMITED) / 极小风险 (MINIMAL)
- 是否需要符合性评估:是/否
- 美国州级触发项:[列表]
- 待开启的必要控制措施:N
成本经济学 (如适用)
- 当前业务量下的月成本:$X
- 迁移至自托管的盈亏平衡点:<业务量>
- 迁移成本 (如适用):$X (3-6 个月)
组织架构 (如适用)
- 下一次招聘:<角色>
- 为什么选择此角色而非替代方案:<一行描述>
- 前置招聘是否到位:是/否
结论
🟢 通过 (SHIP) | 🟡 优化 (SHARPEN) | 🔴 拦截 (BLOCK)
后续步骤
[3 项具体行动]路由
/cs:cdo-review— 涉及训练数据影响时
/cs:gc-review— 涉及 AI 供应商合同、输出责任、训练数据许可时
/cs:ciso-review— 涉及提示词注入 / 越狱 / 训练数据投毒威胁模型时
/cs:cfo-review— 涉及多年期供应商或 GPU 承诺的 TCO 时
cs-chro-advisor智能体 — 涉及 AI 团队招聘 (薪酬、职级、定级) 时
/cs:decide— 记录最终结论
/cs:freeze 60— 针对多年期 AI 承诺的 60 天冻结期
相关资源
- 智能体:
cs-caio-advisor
- 相关领域:
../../../skills/chief-data-officer-advisor/(训练数据权利、数据策略)
---
版本: 1.0.0