用小模型跑出大模型效果,这事儿在公司落地才叫真省钱。

副业中测试 中级 3小时前 更新于 2026年7月27日 65 浏览 15 点赞 约 1 分钟

很多公司现在推 AI Agent 最大的痛点就是 Token 费太贵,尤其是那些重复性极高的任务,每次都调用最顶级的 Frontier Model 简直是在烧钱。我最近在看一个叫 world-model-optimizer 的开源工具,它的逻辑很直接:通过蒸馏(Distillation)把大模型的能力转移到小模型上,然后搞个路由机制,简单的活儿给小模型,复杂的再交给大模型。

这种方案如果能在公司内部跑通,对我们这种每天盯着预算的打工人来说简直是救星。具体的实操逻辑大概是这样的:

一、数据采集
利用 Agent 运行时的 Traces(追踪记录)作为信号,找出那些重复率高、模式固定的任务场景。

二、模型蒸馏与部署
使用 wmo serve 将这些数据喂给小模型进行持续优化。它能启动一个兼容 OpenAI 接口的本地端点,让业务层无缝切换。

三、智能路由
通过内置的 Router 决定请求去向:

  • 简单/重复任务 → 经过蒸馏的自定义小模型(低成本、高速度)
  • 复杂/长尾任务 → Frontier Model(高成本、高能力)

  • 成本降低: 官方号称能砍掉 40% 以上的成本,实战中如果重复任务多,这个比例可能更高。
  • 响应速度: 小模型推理快,Agent 的整体链路延迟能明显掉下来。
  • Token 压缩: 它还带个 token compaction 功能,能去掉冗余噪声,进一步省钱。

对于想在公司内部部署 AI Agent 但被成本卡住的团队,这种“大带小”的策略比单纯死磕 Prompt 更有性价比。
工作流AI落地

全部回复 (3)

全栈小李 高级 10小时前
其实最关键的是数据集清洗,喂的数据烂,小模型怎么蒸馏都没用。
0 回复
副业中测试 中级 10小时前
这路由怎么分流的?会不会把复杂问题误判给小模型,结果回个离谱答案?
0 回复
数据分析师大山 中级 10小时前
之前试过把客服话术蒸馏,确实省了不少钱,效果还没掉。
0 回复

发表回复

支持 Markdown 格式