我的多智能体工作流实测:复杂度 $\neq$ 效果

老Neo在路上 高级 4小时前 更新于 2026年7月26日 307 浏览 0 点赞 约 1 分钟

很多搞AI Agent的同学(包括我之前)都有个执念:只要加个Planner规划,再弄个评审员(Judge)来审核,结果一定会更好。毕竟逻辑是:思考越多 → 审核越严 → 答案越准。

为了验证这个想法,我写了个测试工具跑了20个代码任务,结果直接被打脸。

实测结论:

  • 单模型直接出结果: 成功率 95%,单次成本 $0.031,耗时 2.2s。
  • Planner → 执行者: 成功率 90%,单次成本 $0.264,耗时 9.1s。
  • Planner → 双执行者 → 评审员: 成功率 80%,单次成本 $0.692,耗时 18.3s。

最离谱的是,那个最复杂的“评审团”方案在20个任务里一个都没赢过单模型,反而输了3个。成本翻了22倍,速度慢了8倍,结果反而下降了。

这里有个很深刻的坑:很多评测工具直接给个百分比排名,容易让人误以为“评审团”真的更烂。但实际上,17个任务是平手,只有3个有差异。这意味着在小样本量下,增加复杂度根本没带来统计学上的显著提升。

这个测试工具是怎么跑的:

  • 配置驱动: 通过 JSON 定义角色、模型和拓扑图,直接运行矩阵测试。
  • 确定性评分: 绝对禁止用 AI 给 AI 打分。工具直接运行生成的代码,对或错由程序判定,排除模型评审的随机性。
  • 配对比较: 采用符号检验(Sign Test),对比同一任务在不同方案下的胜负,而不是对比平均分。

踩坑记录:
如果你想在浏览器端直接调用 API 做这种测试,注意 OpenAI 的 CORS 预检问题。api.openai.com 虽然响应了 preflight,但在实际响应中经常缺失 access-control-allow-origin,导致浏览器直接拦截。

这次实操给我的最大启发是:别盲目追求复杂的 AI Agent 架构。在没有大规模量化评测之前,所谓的“多步思考”和“自我反思”可能只是在浪费 Token。

工作流AILLMAI落地testing

全部回复 (3)

调参侠小美 初级 12小时前
我之前也试过套娃,结果反倒在审核环节把对的改错了。
0 回复
阿海爱学习 高级 12小时前
确实,多环节一来,Token消耗快得惊人,延迟也高了。
0 回复
早八人AI炼丹师 专家 12小时前
确实,太复杂反而容易跑偏。你这测试用的是哪个模型?
0 回复

发表回复

支持 Markdown 格式