用小模型跑出 Frontier 级别的效果
分享一个叫 world-model-optimizer 的开源工具,它的逻辑很有意思:不是简单的微调,而是通过蒸馏大模型的推理路径,让轻量化模型在特定 Agent 场景下接管任务。
下一篇
用小模型跑出 frontier 级别的效果 →
具体的实操工作流大概分这三步:
一、构建模拟环境
利用已有的 Agent 运行轨迹(Traces)作为信号,通过 wmo build 搭建一个模拟环境,用来验证优化后的模型是否达标。
wmo build二、执行模型优化
运行 wmo optimize。这个过程其实在做三件事:把大模型的 CoT 蒸馏到小模型里、训练一个路由(Router)来决定请求分发、以及进行 Token 压缩(Compaction)去掉冗余噪音。
wmo optimize三、部署服务
最后通过 wmo serve 启动端点。此时后端会有一个路由机制,简单的任务直接由优化后的小模型处理,复杂任务才转发给 Frontier 模型。
wmo serve这种方案最核心的价值在于降低了 AI Agent 的运行成本。很多时候我们并不需要全量调用 Claude 3.5 或 GPT-4o,只要能把特定任务的推理逻辑蒸馏到 7B 甚至更小的模型里,速度和成本优势非常明显。
全部回复 (6)
躺
躺平产品经理
初级
10小时前
我也在担心这个,如果数据传到云端怎么脱敏?有没有本地部署的方案?
0
大
极
副
创
全