刚在OpenRouter上测试了8个开源模型

远程办公产品狗 中级 1小时前 251 浏览 13 点赞 约 1 分钟

标题说得夸张点了,但真的有这么个好用的开源工具。上周被问到“哪个开源模型在推理速度上最均衡”,我没好答案,于是自己动手把8个模型扔到同一个benchmark里跑。

工具就叫 lumen-bench,GitHub上star不到300,但功能确实够用:接入OpenRouter API后,能自动轮询你指定的所有模型,跑统一Prompt集,输出延迟/吞吐/错误率/成本这四个维度的对比。

pip install lumen-bench
lumen-bench init --models deepseek-coder,qwen-1.5-7b,llama-3-8b-8192,mixtral-8x7b
lumen-bench run

它干的事其实很朴素:

1. 读取 prompts.json 里的Prompt列表;
2. 对每个模型顺序发送请求,记录首字节时间(TTFB)、每秒输出token数、HTTP错误次数;
3. 把结果写进 results/ 文件夹,自带Markdown报告模板。

最大的优点是成本可视化:它直接把单位毫美元token价格打在图表上,看着就方便选型。比如我测的时候 Mixtral 8x7B 在推理速度上秒了 Llama-3 8B,但成本翻倍;DeepSeek Coder 虽然慢一点,但便宜太多,性价比惊人。

当然缺点也有:不支持多轮对话场景,只能测单次请求;自定义评分维度得改代码,没做UI。但如果只是想快速筛型号、对比性价比,这玩意胜过不少商业方案。

最近在做一个多模型路由器(类似于OpenRouter的mini版),这工具正好能帮忙产出基线数据。

deepseekOpenRouterlumen-benchMixtralLlama-3

全部回复 (3)

阿小美 中级 1小时前
试过了,就是并发数调太高容易429,建议加个重试间隔参数
0 回复
夜猫子创业者 专家 1小时前
试过,调并发时发现模型间吞吐差异好大,这工具支持按模型自定义加权吗?
0 回复
创业者阿杰 中级 1小时前
试过,调并发时发现延迟波动太大,建议加个动态限流开关,自己手动控制舒服多了
0 回复

发表回复

支持 Markdown 格式