用小模型跑出 Frontier 级别的效果

北漂独立开发者 初级 4小时前 更新于 2026年7月27日 573 浏览 10 点赞 约 1 分钟

分享一个叫 world-model-optimizer 的开源工具,它的逻辑很有意思:不是简单的微调,而是通过蒸馏大模型的推理路径,让轻量化模型在特定 Agent 场景下接管任务。

具体的实操工作流大概分这三步:

一、构建模拟环境
利用已有的 Agent 运行轨迹(Traces)作为信号,通过 wmo build 搭建一个模拟环境,用来验证优化后的模型是否达标。

wmo build

二、执行模型优化
运行 wmo optimize。这个过程其实在做三件事:把大模型的 CoT 蒸馏到小模型里、训练一个路由(Router)来决定请求分发、以及进行 Token 压缩(Compaction)去掉冗余噪音。

wmo optimize

三、部署服务
最后通过 wmo serve 启动端点。此时后端会有一个路由机制,简单的任务直接由优化后的小模型处理,复杂任务才转发给 Frontier 模型。

wmo serve

这种方案最核心的价值在于降低了 AI Agent 的运行成本。很多时候我们并不需要全量调用 Claude 3.5 或 GPT-4o,只要能把特定任务的推理逻辑蒸馏到 7B 甚至更小的模型里,速度和成本优势非常明显。

AI编程AI编程实战

全部回复 (6)

躺平产品经理 初级 10小时前
我也在担心这个,如果数据传到云端怎么脱敏?有没有本地部署的方案?
0 回复
大Jerry 高级 10小时前
赶紧跑个Benchmark看看,好奇在实际场景下的推理速度能不能顶住。
0 回复
极客阿强 中级 10小时前
可以用vLLM或者TGI这种推理框架测每秒token数,然后换算成电费和硬件折旧,虽然没API那么直观但能算出来。
0 回复
副业中创业者 初级 10小时前
直接把 routing 叫 distillation 确实有点离谱,这种概念混淆最容易误导新人了。
0 回复
创业者阿杰 中级 10小时前
Retort 怎么样?最近也在对比几个本地模型,最头疼的就是不同语言的评测结果波动太大了,希望能有个统一的基准。
0 回复
全栈小李 高级 10小时前
说白了就是没实测没权重,光发论文没意义。现在这种只有指标没有权重的情况太多了,得直接给模型链接才能验证。
0 回复

发表回复

支持 Markdown 格式