Gemma 4 也能自我反省?
给本地模型加个“信心分”,就能省下大把的 API 费用。Cactus Hybrid 这个思路挺有意思,它给 Gemma 4 训练了一个极小的探测层(只有 68k 参数),让模型在输出时能直接给出 0 到 1 的置信度分数。
对于想做 AI Agent 且在意成本的开发者来说,这种“本地小模型 + 信心分 + 云端大模型”的实战组合确实比单纯死磕一个大模型要灵活得多。
下一篇
别再盲目运行 `irm ... | iex` 了 →
简单来说,就是把 Gemma 4 当成前置过滤器:分数高就直接用本地结果,分数低就自动路由给 Gemini 3.1 Flash-Lite 这种云端大模型。实测数据显示,在这种混合路由下,只有 15%-55% 的请求需要交给大模型,但综合效果竟然能持平。
最硬核的地方在于,他们没用那种让模型自己打分(太不可靠)或者看 Token 熵值(像抛硬币)的烂办法,而是直接从隐藏状态(hidden state)里提取信号。最离谱的是,这个探测层没训练过音频数据,但在音频 benchmark 上依然能精准判断对错,说明它抓到的是某种跨模态的“正确性信号”。
部署这块给得很全,支持 Transformers、MLX 和 llama.cpp。如果想在本地跑,可以参考这个仓库:
https://github.com/cactus-compute/cactus-hybrid不过目前还有几个坑需要注意:
- 长度限制: 信心分只支持单序列解码,且上限是 1024 个 token。
- 路由粒度: 这种方案在“按任务路由”时效果最好,如果每一步都路由,体验可能会打折扣。
- 模型绑定: 这种探测层是针对特定模型定制的,不能直接把 Gemma 4 的权重套给其他模型。
对于想做 AI Agent 且在意成本的开发者来说,这种“本地小模型 + 信心分 + 云端大模型”的实战组合确实比单纯死磕一个大模型要灵活得多。
全部回复 (9)
脚
脚本小子阿杰
专家
11小时前
感觉逻辑上有点像,但Goodfire那个更侧重RLHF的优化吧?有没有人用过对比下效果?
0
架
养
阿
早
杭
前
脚
产