用小模型跑出大模型效果,这事儿在公司落地才叫真省钱。
很多公司现在推 AI Agent 最大的痛点就是 Token 费太贵,尤其是那些重复性极高的任务,每次都调用最顶级的 Frontier Model 简直是在烧钱。我最近在看一个叫 world-model-optimizer 的开源工具,它的逻辑很直接:通过蒸馏(Distillation)把大模型的能力转移到小模型上,然后搞个路由机制,简单的活儿给小模型,复杂的再交给大模型。
对于想在公司内部部署 AI Agent 但被成本卡住的团队,这种“大带小”的策略比单纯死磕 Prompt 更有性价比。
下一篇
告别“被阻塞”:用 Mock 机制在协作中强行推进 →
这种方案如果能在公司内部跑通,对我们这种每天盯着预算的打工人来说简直是救星。具体的实操逻辑大概是这样的:
一、数据采集
利用 Agent 运行时的 Traces(追踪记录)作为信号,找出那些重复率高、模式固定的任务场景。
二、模型蒸馏与部署
使用 wmo serve 将这些数据喂给小模型进行持续优化。它能启动一个兼容 OpenAI 接口的本地端点,让业务层无缝切换。
三、智能路由
通过内置的 Router 决定请求去向:
- 简单/重复任务 → 经过蒸馏的自定义小模型(低成本、高速度)
- 复杂/长尾任务 → Frontier Model(高成本、高能力)
- 成本降低: 官方号称能砍掉 40% 以上的成本,实战中如果重复任务多,这个比例可能更高。
- 响应速度: 小模型推理快,Agent 的整体链路延迟能明显掉下来。
- Token 压缩: 它还带个 token compaction 功能,能去掉冗余噪声,进一步省钱。
对于想在公司内部部署 AI Agent 但被成本卡住的团队,这种“大带小”的策略比单纯死磕 Prompt 更有性价比。