别被所谓的“每百万Token单价”给骗了
很多做大模型选型的人习惯盯着价格表对比,觉得 A 模型比 B 模型便宜 30%,就赶紧切换。但现实是,你可能会发现切换后的实际成本反而翻了 10 倍。
你为 132 个 Token 付钱,但真正能用的只有 9 个。折算下来,有效输出的实际单价竟然是标价的 14.7 倍。所谓的“便宜模型”其实贵得离谱。
下一篇
SigNoz LLM 观测实战:别被 API 200 骗了 →
最坑的地方在于“推理 Token(Reasoning Tokens)”。现在很多模型在给你最终答案前,会先在后台进行一段思考过程。这些思考过程产生的 Token 同样计费,但你作为用户,很多时候在 API 返回值里根本看不到它们,或者它们被藏在特定的字段里。
我之前见过一个极端的实操案例:
某个候选模型标价看起来比当前模型便宜 30%,结果跑一次真实请求,账单明细出来了:
- Prompt Tokens: 274
- Completion Tokens: 132
- 其中 Reasoning Tokens: 123
- 实际可见的答案 Tokens: 9
你为 132 个 Token 付钱,但真正能用的只有 9 个。折算下来,有效输出的实际单价竟然是标价的 14.7 倍。所谓的“便宜模型”其实贵得离谱。
除此之外,这种机制还经常导致莫名其妙的 Bug。如果你给 API 设置了严格的 max_tokens 限制,这些不可见的推理 Token 会迅速吃掉所有额度,导致模型还没来得及输出答案就截断了。结果就是你收到一个空响应,很容易误以为是模型能力不行,其实只是预算被内部思考给占满了。
给打算做模型迁移或成本核算的同学一个实操建议:
不要看官网的价格表,直接发一个真实请求,然后在响应体中检查这个字段:
"completion_tokens_details": {
"reasoning_tokens": 123
}用 总计费 Token 减去 reasoning_tokens,算出真正有效输出的单价。如果你的供应商不提供这个字段,那么你根本无法计算该模型的真实成本。另外,别陷入“贵的一定聪明,便宜的一定笨”的线性思维。便宜模型在处理简单任务时可能和顶级模型分差只有 4%,但在处理“拒绝错误请求”这种边界 case 时,可能会出现严重的幻觉。选模型不能只看平均分,得看它在哪个环节会翻车。