用小模型跑出 frontier 级别的效果

咖啡续命折腾党 中级 3小时前 更新于 2026年7月27日 484 浏览 8 点赞 约 1 分钟

很多做 Agent 的人都会发现,如果全量调用 Claude 3.5 或 GPT-4o,Token 成本高得离谱,而且很多重复性任务其实不需要这么强的逻辑能力。我最近在看 world-model-optimizer 这个开源工具,它的核心逻辑是通过蒸馏(Distillation)把大模型的能力“迁移”到更小的模型里,然后配合一个路由机制。

简单来说,它能把那些重复率高的任务拦截下来,交给经过蒸馏的自定义小模型去处理,只有复杂任务才走大模型。

具体的实操流程大概是这样的:

一、准备阶段
你需要准备好 Agent 的运行轨迹(Traces)数据,以及一个 OpenRouter 的 API Key。

二、部署服务
通过 wmo serve 启动一个端点。在后台,路由系统会根据任务特征决定分发方向:

  • 重复/简单任务 → 走自定义蒸馏模型(速度快,成本低)
  • 复杂/新任务 → 走 Frontier 模型(保证质量)

三、持续优化
随着新轨迹数据的进入,系统会持续进行训练,让小模型的表现越来越接近大模型。

除了模型路由,它还搞了 Token Compaction(Token 压缩)来剔除噪声,进一步压低成本。对于需要高频调用 Agent 的项目来说,这种能把成本砍掉 40% 以上且不损失质量的方案非常实用。

如果想直接部署试试,可以参考它的具体路径:

https://github.com/experientiallabs/world-model-optimizer
AI编程AI编程实战

全部回复 (6)

夜猫子创业者 专家 10小时前
赶紧出个避坑指南,我怕我直接把环境搞崩了。
0 回复
大Tom在路上 初级 10小时前
算力成本得算上电费和显卡折旧吧?如果你是用自己的卡跑,其实可以对比一下等量 token 的 API 计费,看看哪个更划算。
0 回复
独立开发者Leo 专家 10小时前
Retort这项目怎么搞?最近也在测几个代码模型,手动跑测试集真的跑死人,求分享下你的评测结果!
0 回复
数据分析师Neo 专家 10小时前
是不是得搞个本地向量数据库?如果数据全传到云端,除非能做端到端加密,否则隐私这块总觉得有点心虚。
0 回复
脚本小子阿强 初级 10小时前
这种论文里的Benchmark水分太大了,除非能把权重文件直接扔到 Hugging Face 上让大家跑一遍,否则很难相信所谓的提升。
0 回复
阿福在路上 高级 10小时前
其实管它叫什么,只要能把推理成本压下来且效果没掉,就是个巨大的进步!期待更多这类优化方案。
0 回复

发表回复

支持 Markdown 格式