交叉评估
/cs:cross-eval — 多模型共识评估
命令: /cs:cross-eval <memo-or-brief>
将同一份备忘录提交给多个模型供应商并协调分歧。适用于高风险、不可逆的决策,因为在这种场景下,单一模型的偏差代价太高:例如并购 (M&A)、重大融资、裁员、战略转型、监管承诺。
该命令改编自 gstack 的 /codex 交叉评审模式,将应用场景从代码 PR 泛化到了商业备忘录。
适用场景
- 签署条款清单 (Term Sheet) 之前
- 宣布裁员之前
- 进入受监管市场之前
- 任何撤销成本超过公司 6 个月时间成本的决策之前
- 董事会投票出现分歧或有关键反对意见时
使用模型(优雅降级)
命令将按顺序尝试调用每个可用模型:
1. Claude(首选,始终可用)—— 董事会的原生之声
2. Codex / OpenAI(若 OPENAI_API_KEY 或 codex CLI 可用)
3. Gemini(若 GEMINI_API_KEY 或 gemini CLI 可用)
如果仅 Claude 可用,命令将运行 Claude 专属对抗模式 —— 使用同一模型但采用不同的提示词种子 —— 并在输出中明确标注为单一模型结果。
工作流
1. 读取备忘录 / 简报
2. 探测环境中可用的模型 CLI / API 密钥
3. 针对每个可用模型:
- 发送备忘录,并附带以下提示词前缀:
> “你是一位独立的 C-level 评审员。以下是另一家公司董事会的备忘录。请指出前 3 个担忧点、前 3 个支持点,并给出你的投票结果(批准 APPROVE / 拒绝 REJECT / 暂缓 DEFER)。不要盲目同意 —— 在被证明正确之前,请假设该备忘录的推理存在缺陷。”
4. 收集三份独立的评审报告
5. 协调:哪些点达成一致?哪些点存在分歧?
6. 将分歧点作为问题提交给创始人
输出格式
保存至 ~/.claude/cross-eval/YYYY-MM-DD-<slug>.md:
# Cross-Eval: <备忘录标题>
日期: YYYY-MM-DD
评审备忘录: <链接>
调用模型: Claude / Codex / Gemini (或标注回退方案)
投票统计
| 模型 | 投票 | 置信度 |
|---|---|---|
| Claude | APPROVE | 高 |
| Codex | DEFER | 中 |
| Gemini | APPROVE | 低 |
共识担忧点 (≥2 个模型标记)
1. <担忧点> — 由 Claude + Codex 标记
2. <担忧点> — 由全部 3 个模型标记
分歧担忧点 (仅 1 个模型标记)
- <仅 Codex:> <担忧点> — 值得再次审视
- <仅 Gemini:> <担忧点> — 可能是噪音,但建议检查
共识支持点 (≥2 个模型认可)
1. <支持点>
2. <支持点>
建议
- 🟢 执行 (GO):若 2 个或更多模型 APPROVE 且没有任何模型提出 CRITICAL (关键) 担忧
- 🟡 暂停 (PAUSE):若任何模型为 DEFER 或任何担忧点被标记为 CRITICAL
- 🔴 停止 (STOP):若 2 个或更多模型 REJECT
给创始人的开放性问题
1. <由分歧引发的问题>
2. <由分歧引发的问题>为什么这很重要
单一模型的建议存在系统性偏差。Claude 倾向于提供帮助,可能会低估风险。Codex (OpenAI) 在新兴市场和监管话题上倾向于更谨慎。Gemini 在技术规模主张上倾向于更谨慎。分歧即信号,而非噪音。
这是不可逆决策前的安全网 —— 但不能替代外部法律顾问或真实的董事会。
优雅降级
若仅可用 Claude:可用模型: 仅 Claude
模式: 对抗模式 (ADVERSARIAL) —— 使用 3 个不同的系统提示词运行 3 次独立的 Claude 评审:
1. 标准评审员
2. 唱反调者 (必须提出 3 个关键质疑)
3. 强力支持者 (必须提出 3 个最强有力的通过理由)
此方案弱于真正的多模型评审。结果仅供参考,不具决定性。
路由
/cs:decide— 若共识为 通过 (GO)
/cs:freeze— 若共识为 暂停 (PAUSE)
/cs:boardroom(重新运行) — 若共识为 停止 (STOP)
相关
- 灵感来源:gstack 的
/codex交叉评审模式 (适配于业务备忘录)
---
版本: 1.0.0