交叉评估

cross-eval
分类通用
作者Alireza Rezvani
许可MIT
评分4.30/5
使用13.9K

/cs:cross-eval — 多模型共识评估

命令: /cs:cross-eval <memo-or-brief>

将同一份备忘录提交给多个模型供应商并协调分歧。适用于高风险、不可逆的决策,因为在这种场景下,单一模型的偏差代价太高:例如并购 (M&A)、重大融资、裁员、战略转型、监管承诺。

该命令改编自 gstack 的 /codex 交叉评审模式,将应用场景从代码 PR 泛化到了商业备忘录

适用场景

  • 签署条款清单 (Term Sheet) 之前
  • 宣布裁员之前
  • 进入受监管市场之前
  • 任何撤销成本超过公司 6 个月时间成本的决策之前
  • 董事会投票出现分歧或有关键反对意见时

使用模型(优雅降级)

命令将按顺序尝试调用每个可用模型:

1. Claude(首选,始终可用)—— 董事会的原生之声
2. Codex / OpenAI(若 OPENAI_API_KEYcodex CLI 可用)
3. Gemini(若 GEMINI_API_KEYgemini CLI 可用)

如果仅 Claude 可用,命令将运行 Claude 专属对抗模式 —— 使用同一模型但采用不同的提示词种子 —— 并在输出中明确标注为单一模型结果。

工作流

1. 读取备忘录 / 简报
2. 探测环境中可用的模型 CLI / API 密钥
3. 针对每个可用模型:
- 发送备忘录,并附带以下提示词前缀:
> “你是一位独立的 C-level 评审员。以下是另一家公司董事会的备忘录。请指出前 3 个担忧点、前 3 个支持点,并给出你的投票结果(批准 APPROVE / 拒绝 REJECT / 暂缓 DEFER)。不要盲目同意 —— 在被证明正确之前,请假设该备忘录的推理存在缺陷。”
4. 收集三份独立的评审报告
5. 协调:哪些点达成一致?哪些点存在分歧?
6. 将分歧点作为问题提交给创始人

输出格式

保存至 ~/.claude/cross-eval/YYYY-MM-DD-<slug>.md

markdown
# Cross-Eval: <备忘录标题>
日期: YYYY-MM-DD
评审备忘录: <链接>
调用模型: Claude / Codex / Gemini (或标注回退方案)

投票统计

| 模型 | 投票 | 置信度 | |---|---|---| | Claude | APPROVE | 高 | | Codex | DEFER | 中 | | Gemini | APPROVE | 低 |

共识担忧点 (≥2 个模型标记)

1. <担忧点> — 由 Claude + Codex 标记 2. <担忧点> — 由全部 3 个模型标记

分歧担忧点 (仅 1 个模型标记)

  • <仅 Codex:> <担忧点> — 值得再次审视
  • <仅 Gemini:> <担忧点> — 可能是噪音,但建议检查

共识支持点 (≥2 个模型认可)

1. <支持点> 2. <支持点>

建议

  • 🟢 执行 (GO):若 2 个或更多模型 APPROVE 且没有任何模型提出 CRITICAL (关键) 担忧
  • 🟡 暂停 (PAUSE):若任何模型为 DEFER 或任何担忧点被标记为 CRITICAL
  • 🔴 停止 (STOP):若 2 个或更多模型 REJECT

给创始人的开放性问题

1. <由分歧引发的问题> 2. <由分歧引发的问题>

为什么这很重要

单一模型的建议存在系统性偏差。Claude 倾向于提供帮助,可能会低估风险。Codex (OpenAI) 在新兴市场和监管话题上倾向于更谨慎。Gemini 在技术规模主张上倾向于更谨慎。分歧即信号,而非噪音。

这是不可逆决策前的安全网 —— 但不能替代外部法律顾问或真实的董事会。

优雅降级

若仅可用 Claude:
markdown
可用模型: 仅 Claude
模式: 对抗模式 (ADVERSARIAL) —— 使用 3 个不同的系统提示词运行 3 次独立的 Claude 评审:
  1. 标准评审员
  2. 唱反调者 (必须提出 3 个关键质疑)
  3. 强力支持者 (必须提出 3 个最强有力的通过理由)

此方案弱于真正的多模型评审。结果仅供参考,不具决定性。

路由

  • /cs:decide — 若共识为 通过 (GO)
  • /cs:freeze — 若共识为 暂停 (PAUSE)
  • /cs:boardroom (重新运行) — 若共识为 停止 (STOP)

相关

  • 灵感来源:gstack 的 /codex 交叉评审模式 (适配于业务备忘录)

---

版本: 1.0.0