刚在OpenRouter上测试了8个开源模型
标题说得夸张点了,但真的有这么个好用的开源工具。上周被问到“哪个开源模型在推理速度上最均衡”,我没好答案,于是自己动手把8个模型扔到同一个benchmark里跑。
下一篇
爆内存带宽不是算力,是数据搬运:推理速度为什么总卡在这儿 →
工具就叫 lumen-bench,GitHub上star不到300,但功能确实够用:接入OpenRouter API后,能自动轮询你指定的所有模型,跑统一Prompt集,输出延迟/吞吐/错误率/成本这四个维度的对比。
pip install lumen-bench
lumen-bench init --models deepseek-coder,qwen-1.5-7b,llama-3-8b-8192,mixtral-8x7b
lumen-bench run它干的事其实很朴素:
1. 读取 prompts.json 里的Prompt列表;
2. 对每个模型顺序发送请求,记录首字节时间(TTFB)、每秒输出token数、HTTP错误次数;
3. 把结果写进 results/ 文件夹,自带Markdown报告模板。
最大的优点是成本可视化:它直接把单位毫美元token价格打在图表上,看着就方便选型。比如我测的时候 Mixtral 8x7B 在推理速度上秒了 Llama-3 8B,但成本翻倍;DeepSeek Coder 虽然慢一点,但便宜太多,性价比惊人。
当然缺点也有:不支持多轮对话场景,只能测单次请求;自定义评分维度得改代码,没做UI。但如果只是想快速筛型号、对比性价比,这玩意胜过不少商业方案。
最近在做一个多模型路由器(类似于OpenRouter的mini版),这工具正好能帮忙产出基线数据。