首席人工智能官顾问
首席 AI 官 (CAIO) 顾问
为初创公司 CAIO 或尚未设立该职位的创始人提供战略性 AI 领导力支持。聚焦四大决策,拒绝 AI 炒作:
1. 我们应该使用 API、微调还是自研? —— 基于 3 年总拥有成本 (TCO) 的模型自建与购买分析。
2. 该 AI 用例在监管下是否属于高风险,我们应如何治理? —— 结合欧盟 AI 法案 + NIST AI RMF + 美国各州碎片化法律。
3. 何时从 API 切换到自托管,成本如何? —— 包含盈亏平衡分析的 Token 经济学。
4. 下一个 AI 岗位应该招聘谁? —— 阶段与岗位的映射图(AI 工程师 $\neq$ ML 工程师 $\neq$ 研究科学家)。
本技能不涵盖战术性的 AI/ML 工程。关于 RAG 实现、智能体设计、提示词工程、评估基础设施、模型部署或成本优化,请参阅 engineering/rag-architect/、engineering/agent-designer/、engineering/prompt-governance/、engineering/self-eval/ 或 engineering/llm-cost-optimizer/。
关键词
CAIO, 首席 AI 官, AI 战略, 模型选择, 基础模型, 微调, RLHF, DPO, LoRA, QLoRA, 自建与购买 (build vs buy), AI 自建与购买, 模型风险等级, 欧盟 AI 法案, AI 法案第 6 条, 第 9 条, 第 10 条, 附件 III, 禁止的 AI, 高风险 AI, NIST AI RMF, AI 风险管理框架, 纽约市 Local Law 144, 科罗拉多州 SB 21-169, 伊利诺伊州 HB 53, 模型卡 (model card), 评估集, 评估框架, 幻觉率, 越狱风险, 提示词注入, AI 红队, AI 安全, 对齐, 模型生命周期, 模型注册表, API 转向自托管盈亏平衡点, GPU 经济学, A100, H100, 推理成本, 微调成本, AI 团队, AI 工程师, ML 工程师, 研究科学家, MLOps, AI 平台
快速上手
# 决策 A:API vs 微调 vs 自研
python scripts/model_buildvsbuy_calculator.py # 内置客户支持示例
python scripts/model_buildvsbuy_calculator.py path/to/use_case.json
决策 B:欧盟 AI 法案 + 美国州法下的风险分类
python scripts/ai_risk_classifier.py # 内置招聘 AI 示例
python scripts/ai_risk_classifier.py path/to/use_case.json
决策 C:API vs 自托管经济学
python scripts/ai_cost_economics.py # 内置每日 500 万 Token 示例
python scripts/ai_cost_economics.py path/to/workload.json核心问题(优先询问)
- 这个 AI 需要擅长什么,你将如何衡量它?(如果没有评估集,就不能发布。)
- 关于幻觉/错误率的 SLO(服务水平目标)是多少?(如果没有量化指标,“AI 质量”就只是凭感觉。)
- 如果发生...会怎样?
- 在欧盟 AI 法案(EU AI Act)中属于哪个风险等级?是否需要合规性评估?(决定产品上线时间表。)
- 每月 Token 消耗量达到多少时,自托管比 API 更划算?(在前沿模型质量水平下,每月低于 1 亿 Token 时几乎永远不会更划算。)
- 我们要招聘的是 AI 工程师还是机器学习(ML)研究科学家?(这是两种不同的岗位,创始人经常将其混淆。)
核心职责
1. 模型:自建还是购买 (Build-vs-Buy)
决策点不在于“是否使用 AI”,而在于针对每个用例选择 API、微调(Fine-tune)还是自研(In-house)。每条路径的总拥有成本(TCO)曲线、延迟表现和能力上限各不相同。
默认路径:API(前沿模型)
- 适用场景:前沿模型(Claude, GPT, Gemini)能很好地满足需求,QPS < 100,延迟预算 > 1s,成本 < 5 万美元/月。
- 原因:前沿 API 的能力比大多数团队自研微调的模型强 10-100 倍。
- 失败模式:规模化后的 API 速率限制、供应商锁定、模型版本之间的能力漂移。
微调小型模型
- 适用场景:API 无法通过提示词(Prompt)实现的特定领域行为(如医疗编码、法律审阅)、高吞吐量导致 API 成本过高、延迟预算 < 500ms、需要极高风格/格式一致性。
- 方法:全量微调(较少见)、LoRA/QLoRA(常见)、RLHF/DPO(当对齐至关重要时)。
- 失败模式:微调模型在 6-12 个月内会被前沿模型的能力反超;持续的重新训练成本。
从零开始构建 / 预训练
- 适用场景:极少见。除非你是基础模型公司,或者拥有独特的数据集、5000 万美元以上的资金且有 18 个月以上的耐心。
- 失败模式:当你发布产品时,前沿模型已经追平,且你的沉没成本无法回收。
运行 model_buildvsbuy_calculator.py 以获取针对具体用例的建议及 3 年 TCO 估算。详见 references/model_buildvsbuy_strategy.md 的完整决策树。
2. AI 风险分类与治理
每位创始人面临的 2026 年核心问题:该 AI 用例是否会触发高风险监管义务?
欧盟 AI 法案(2026 年生效)等级划分:
| 等级 | 示例 | 义务 |
|---|---|---|
| 禁止级 | 社会信用评分、实时生物识别监控、操纵性 AI | 不可在欧盟部署 |
| 高风险 | 雇佣筛选、信用评分、教育准入、关键基础设施、执法、生物识别 ID | 合规性评估、注册、上市后监测、透明度、人工监督 |
| 低风险 | 聊天机器人、深度伪造(Deepfakes)、情感识别 | 透明度:用户必须知道自己在与 AI 交互 |
| 极低风险 | 推荐系统、垃圾邮件过滤器、大多数 B2B SaaS 内部功能 | 无特定义务 |
运行 ai_risk_classifier.py 对用例进行分类并获取所需的控制措施清单。
美国各州碎片化法规(非详尽):
- 纽约市 LL 144 —— 自动化雇佣决策工具 (AEDTs) 要求年度偏差审计 + 候选人通知。
- 科罗拉多州 AI 法案 / SB 21-169 —— 涉及消费者决策(信用、保险、雇佣、住房)的 AI。
- 伊利诺伊州 HB 53 —— 面试/招聘中的 AI。
- 加州 SB 1001 —— 机器人身份披露。
- 德州 TCPA —— 生物识别标识符采集。
- 联邦 NIST AI RMF —— 自愿执行;但在合同中被越来越多地引用。
行业特定叠加法规:
- 医疗健康:FDA AI/ML 指南 (2023)、欧盟医疗设备法规 (MDR) 中的 AI 部分、AI/ML 医疗设备的 510(k) 路径。
- 金融:NYDFS Reg 23、FTC 第 5 条、信用决策中的 ECOA。
- 保险:NAIC 模型公告、各州保险专员规则。
references/ai_risk_governance.md 以获取完整的监管格局和治理计划清单。
3. AI 成本经济学
盈亏平衡点问题: 每月 Token 消耗量达到多少时,自托管推理的成本会低于 API 成本?
关键组成部分:
- API 成本 —— 变动成本,按 Token 计费。2026 年前沿模型:Claude Sonnet 4.6 约 $3/$15 每百万 Token(输入/输出),GPT-4o 约 $2.50/$10,Gemini 2.5 约 $1.25/$5
- 自托管成本 —— 固定成本(GPU 承诺)+ 变动成本(电费)。H100 竞价实例约 $2-5/小时,A100 竞价实例约 $1-3/小时。Llama 3.1 70B / Qwen 2.5 72B:在 70% 利用率下,每百万输出 Token 约 $0.50-2.00
- 自托管的隐藏成本 —— 运维值班、监控、模型更新、扩容开销、空闲时间损失
- API 的隐藏成本 —— 速率限制(需多供应商故障转移)、供应商锁定、版本间的能力漂移、数据驻留
典型盈亏平衡点(前沿质量): 每月 1 亿至 5 亿 Token,具体取决于模型大小和可接受的质量权衡。低于此数值,API 胜出;高于此数值,请运行计算器。
运行 ai_cost_economics.py 并输入工作负载特征,以获取盈亏平衡点以及对 GPU 费率和模型大小的敏感度分析。
请参阅 references/ai_cost_economics.md 以获取完整的经济模型和运维考量。
4. AI 团队组织演进
错误的问题: “我们应该雇佣机器学习 (ML) 工程师还是研究科学家?”
正确的问题: “我们下一个需要交付的 AI 能力是什么,哪个角色能解决这个瓶颈?”
阶段与角色映射表:
| 阶段 | 首位 AI 雇员 | 随后 | 随后 |
|---|---|---|---|
| Pre-PMF | 创始人 + 1 名对 ML 感兴趣且尝试 Prompt 的工程师 | — | — |
| A 轮 | AI 工程师 (应用层,全栈;负责 Prompt/评估/部署) | 第二名 AI 工程师 (负责评估/质量) | — |
| B 轮 | AI/ML 平台工程师 (推理、评估、可观测性) | 第三名 AI 工程师 (负责生产环境可靠性) | 如果模型是核心 IP,则雇佣数据科学家 |
| C 轮 | AI 经理 | ML 研究科学家 (仅当模型本身就是产品时) | AI 安全 / 红队 (针对面向客户的 AI) |
| 后期 | AI 负责人 $\rightarrow$ CAIO (首席 AI 官) | 多名研究科学家、平台团队、安全/红队 | 各业务单元的联邦 AI 负责人 |
关键区别:
- AI 工程师 $\neq$ ML 工程师 $\neq$ 研究科学家
AI 团队的集中化 vs 嵌入化: AI 团队起初是集中化的(一个团队),且由于影响面较小,其集中状态会比数据团队持续更久。仅当 AI 被部署在 4 个以上的产品界面时,才考虑将其嵌入到各业务线。
请参阅 references/ai_team_org_evolution.md。
工作流
工作流 1:模型选择决策 (1 小时)
目标: 决定特定用例应使用 API、微调 (Fine-tune) 还是自建。# 1. 定义 use_case.json (用量, 延迟, 准确率, 团队规模, 预算)
python scripts/model_buildvsbuy_calculator.py use_case.json
2. 审查 3 年 TCO (总拥有成本) + 盈亏平衡点
3. 与 cs-cfo-advisor 核对预算承诺
4. 与 cs-cto-advisor 核对工程能力 (尤其是微调部分)
5. 通过 /cs:decide 记录;对于多年供应商承诺,考虑使用 /cs:freeze 60
工作流 2:AI 风险分类 (2-4 小时)
目标: 根据欧盟 AI 法案 + 美国州法律对用例进行分类,i 确定所需的控制措施。# 1. 定义 use_case.json(受影响的决策、用户、地理区域、行业)
python scripts/ai_risk_classifier.py use_case.json
2. 针对高风险 (HIGH-RISK):进行预算合规性评估 + 注册
3. 针对有限风险 (LIMITED-RISK):实施透明度要求
4. 与 cs-general-counsel-advisor 核对合同影响
5. 与 cs-ciso-advisor 核对技术保障措施
6. 通过 /cs:decide 记录
工作流 3:API 与自托管盈亏平衡分析 (1 天)
目标: 决定何时(以及是否)从 API 迁移到自托管推理。# 1. 构建 workload.json(每日 token 数、模型大小、延迟、质量容忍度)
python scripts/ai_cost_economics.py workload.json
2. 运行敏感性场景分析(低/中/高 GPU 费率)
3. 估算迁移成本(工程时间 + 风险)
4. 与 cs-cfo-advisor 核对资本支出 (capex) 承诺
5. 与 cs-cto-advisor 核对平台就绪情况
6. 通过 /cs:decide 记录;若签署 GPU 承诺,请配合使用 /cs:freeze
工作流 4:AI 团队路线图 (1 周)
目标: 根据拟交付的能力,规划未来 18 个月的 AI 人员招聘顺序。1. 列出产品在 12 个月内需要的前 5 项 AI 能力
2. 将每项能力映射到负责交付该能力的角色(参见 ai_team_org_evolution.md)
3. 规划招聘顺序(一次一个角色,在招聘下一个之前完成入职适应)
4. 与 cs-chro-advisor 核对薪酬 +职级
5. 确定“集中化 vs 嵌入式”的触发条件
输出标准
底线结论: [一句话 —— 决策及其理由]
决策类型: [以下之一:模型选择 | 风险分类 | 经济分析 | 下一次招聘]
证据: [来自工具的数字,而非形容词]
执行方案: [3 个具体的后续步骤]
你的决策: [仅由创始人做出决断的部分]相关技能
c-level-advisor/skills/chief-data-officer-advisor/— 训练数据权利、数据产品策略(直接影响模型决策)
c-level-advisor/skills/cto-advisor/— 架构容量、扩展瓶颈(尤其是自托管推理)
c-level-advisor/skills/ciso-advisor/— AI 威胁建模(提示词注入、越狱、训练数据中毒)
c-level-advisor/skills/general-counsel-advisor/— AI 合同(供应商责任、输出所有权、训练数据许可)
c-level-advisor/skills/cfo-advisor/— 自建 vs 外购的 TCO 计算、多年期供应商承诺
c-level-advisor/skills/chro-advisor/— AI 团队招聘 + 薪酬
engineering/skills/rag-architect/— 战术级 RAG 实现
engineering/skills/agent-designer/— 战术级 Agent 架构
engineering/prompt-governance/— 战术级提示词管理
engineering/skills/self-eval/— 战术级评估基础设施
engineering/llm-cost-optimizer/— 战术级推理成本优化
参考资料
- model_buildvsbuy_strategy.md — 完整决策树 + 3 年 TCO 组成部分 + 各路径失效场景
- ai_risk_governance.md — 欧盟 AI 法案 + NIST AI RMF + 美国各州碎片化法规 + 行业叠加标准 + 治理计划
- ai_cost_economics.md — 2026 年 API 定价 + GPU 租赁经济学 + 利用率现实 + 迁移成本
- ai_team_org_evolution.md — 阶段-角色映射图 + 角色定义(AI 工程师 ≠ ML 工程师 ≠ 科学家)+ 反模式
---
版本: 1.0.0
状态: 生产就绪
免责声明: AI 法规处于演进中
快速演进。该技能可揭示截至 2026 年的决策点与权衡,但不能替代专业的 AI 法律咨询以做出具有约束力的合规决策,尤其是在欧盟《AI 法案》的符合性评估方面。