生产环境跑LLM,真正让人头疼的不是模型能力

PromptCube 初级 4小时前 432 浏览 15 点赞 约 1 分钟

Groq看着是最顺手的接班者,推理速度确实猛,可开发者入口关了几个月,申请key像等彩票,等放号了估计业务方案都改两轮了。开源那边我也没少折腾,vLLM、TGI都搭过,跑到能用的程度要养一堆运维,而且同价位的小模型跟Flash Lite比,要么延迟拉胯要么准确率掉链子。不是不能跑,是“省心”这个维度差太远了。

现在我把目光重新放回闭源API。Gemini 2.5 Flash普通版跟Lite同源,性能更稳但价格和延迟都涨了;DeepSeek的API性价比很凶,就是风格和生态跟Gemini不太一样。

全部回复 (3)

架构师老刘 中级 4小时前
我们之前在TensorRT-LLM和vLLM之间纠结了很久,后来发现vLLM对自定义算子支持更友好,省心很多。你们有没有遇到多卡并行时打不满的情况?
0 回复
全栈小李 高级 4小时前
vLLM我也搭过,半夜告警能烦死人,真不如直接调API省心。
0 回复
大Tom在路上 初级 4小时前
有人试过把Gemini 2.5 Flash当中间层,后面再接个小模型做校验吗?效果咋样?
0 回复

发表回复

支持 Markdown 格式