用 OpenRouter 跑了 8 个开源模型,发现这个冷门评测工具 lumen-bench 效率极高
最近在开发一个多模型路由器的原型,最头疼的就是给不同模型建立性能基线。之前总有人问我哪个开源模型在推理速度和成本之间最均衡,说实话,在这种动态变化的 API 环境下,看官方公布的 Benchmark 根本没参考价值,因为不同供应商的量化程度和调度策略完全不同。为了拿到真实数据,我尝试用一个 GitHub 上 Star 数不到 300 的小工具 lumen-bench 把 8 个主流开源模型拉出来跑了一遍。
这个工具的逻辑非常纯粹,它不是那种复杂的端到端评测框架,而是一个专门针对 API 延迟和成本的轮询工具。只要你接入 OpenRouter 的 API Key,它就能自动遍历你指定的模型列表,运行统一的 Prompt 集,并实时记录四个核心维度:首字节时间(TTFB)、吞吐量(Tokens/sec)、错误率以及实际产生的 Token 成本。
具体部署非常快,直接 pip install lumen-bench 就能安装。初始化的时候,你可以直接在命令行里指定想要对比的模型,比如 lumen-bench init --models deepseek-coder,qwen-1.5-7b,llama-3-8b-8192,mixtral-8x7b,然后执行 lumen-bench run 即可开始压力测试。
在实际运行过程中,我发现它的工作流极其简单:首先读取本地的 prompts.json 文件,然后对每个模型顺序发送请求。它最核心的价值在于能把结果直接输出到 results/ 文件夹下,并生成一份 Markdown 格式的对比报告。
这次测试结果给了我很大的启发,尤其是成本可视化这一块。很多评测只看速度,但 lumen-bench 把单位毫美元的价格直接打在图表上,这种对比非常直观。在我的测试样本中,Mixtral 8x7B 在推理速度上确实有绝对优势,几乎秒杀了 Llama-3 8B,但由于 Token 计费更高,总成本直接翻倍。而 DeepSeek Coder 虽然在响应速度上稍慢,但性价比极高,这种量化的数据比单纯地描述“快”或“慢”要有意义得多。
当然,这个工具也存在明显的局限性。它目前只支持单次请求的测试,这意味着如果你需要评测多轮对话的上下文维持能力,它完全不适用。而且它没有提供图形化界面(UI),如果你想自定义评分维度,必须直接去修改源代码。
但即便如此,对于像我这样需要快速筛选模型型号、对比性价比的开发者来说,它比那些臃肿的商业评测方案好用得多。它把复杂的 API 响应时间拆解成了可量化的数据,让我能迅速在 Llama、Qwen 和 Mixtral 之间找到那个平衡点,为我的路由器基线数据提供了最真实的参考。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
并发数拉高直接报429错误,得赶紧在代码里加个重试间隔!