用小模型跑出 frontier 级别的效果
很多做 Agent 的人都会发现,如果全量调用 Claude 3.5 或 GPT-4o,Token 成本高得离谱,而且很多重复性任务其实不需要这么强的逻辑能力。我最近在看 world-model-optimizer 这个开源工具,它的核心逻辑是通过蒸馏(Distillation)把大模型的能力“迁移”到更小的模型里,然后配合一个路由机制。
三、持续优化
随着新轨迹数据的进入,系统会持续进行训练,让小模型的表现越来越接近大模型。
下一篇
用小模型跑出 Frontier 级别的效果 →
简单来说,它能把那些重复率高的任务拦截下来,交给经过蒸馏的自定义小模型去处理,只有复杂任务才走大模型。
具体的实操流程大概是这样的:
一、准备阶段
你需要准备好 Agent 的运行轨迹(Traces)数据,以及一个 OpenRouter 的 API Key。
二、部署服务
通过 wmo serve 启动一个端点。在后台,路由系统会根据任务特征决定分发方向:
- 重复/简单任务 → 走自定义蒸馏模型(速度快,成本低)
- 复杂/新任务 → 走 Frontier 模型(保证质量)
三、持续优化
随着新轨迹数据的进入,系统会持续进行训练,让小模型的表现越来越接近大模型。
除了模型路由,它还搞了 Token Compaction(Token 压缩)来剔除噪声,进一步压低成本。对于需要高频调用 Agent 的项目来说,这种能把成本砍掉 40% 以上且不损失质量的方案非常实用。
如果想直接部署试试,可以参考它的具体路径:
https://github.com/experientiallabs/world-model-optimizer全部回复 (6)
夜
夜猫子创业者
专家
10小时前
赶紧出个避坑指南,我怕我直接把环境搞崩了。
0
大
独
数
脚
阿