生产环境跑LLM,真正让人头疼的不是模型能力
Groq看着是最顺手的接班者,推理速度确实猛,可开发者入口关了几个月,申请key像等彩票,等放号了估计业务方案都改两轮了。开源那边我也没少折腾,vLLM、TGI都搭过,跑到能用的程度要养一堆运维,而且同价位的小模型跟Flash Lite比,要么延迟拉胯要么准确率掉链子。不是不能跑,是“省心”这个维度差太远了。
现在我把目光重新放回闭源API。Gemini 2.5 Flash普通版跟Lite同源,性能更稳但价格和延迟都涨了;DeepSeek的API性价比很凶,就是风格和生态跟Gemini不太一样。