那些疯狂砸钱买 AI 的大公司在 8 月份把人均开销砍掉了快 10%
这次 Ramp AI Index 9 月份的数据挺有意思,美国那 1% 的 AI 头部支出企业,在 8 月份的人均 AI 消费反而下降了近 10%。结合从 2026 年 3 月到现在 token 每百万单价跌了 41% 这个数字来看,现在的趋势很明显:公司不再盲目追求最强的那个模型,而是在疯狂地做成本优化,把非核心任务从昂贵的 Frontier Models 迁到便宜的替代方案上。
为什么大公司开始给 AI 预算瘦身
之前的逻辑是只要能提升效率,多少钱都愿意花,但到了 2026 年这个阶段,大家发现并不是所有场景都需要一个顶级模型。比如简单的分类、数据清洗或者基础的文本润色,用最顶级的模型简直是浪费。
我观察到很多公司现在的做法是构建一个路由层(Router),根据任务复杂度分发。简单任务走低成本模型,复杂逻辑才调用顶级 API。这种策略直接导致了即便调用量在增加,但总账单反而下降了。对于 OpenAI 和 Anthropic 这种厂商来说,现在压力很大,因为单价跌得太快,必须靠调用量的指数级增长才能撑住营收,否则这种价格战最后只会让用户获益,而厂商陷入利润泥潭。
实际操作中如何通过模型迁移省钱
如果你现在也在管理企业的 AI 预算,不要直接给所有员工开最贵的订阅,建议按以下逻辑做成本拆解:
一、 建立任务复杂度矩阵
把目前所有的 AI 调用场景列出来,标注出「必须精准度 100%」和「可以容忍 5%-10% 误差」的场景。你会发现 70% 的任务其实不需要最强模型。
二、 实施分级调用策略
在代码层实现一个简单的判断逻辑。比如使用一个小规模模型做预判,如果预判结果的置信度低于 0.8,再将请求转发给顶级模型。
# 伪代码示例:成本路由逻辑
def ai_router(user_query):
# 先用极低成本模型判断任务复杂度
complexity = cheap_model.analyze(user_query)
if complexity == "simple":
# 走低成本 API,单价可能只有前者的 1/10
return cheap_model.generate(user_query)
else:
# 只有复杂任务才调用顶级模型
return frontier_model.generate(user_query)
三、 监控 Token 消耗与单价波动
现在模型厂商的价格战非常激烈,同一个能力的模型,不同版本、不同时间点的单价差很多。建议建立一个月度 Token 审计表,核对实际消耗量与账单金额。
这种成本下降带来的潜在风险
虽然人均开销降了 10%,但这里面有个坑:过度追求低成本可能会导致「性能退化」而不自知。
我在尝试把部分客服机器人从顶级模型迁到轻量化模型时发现,虽然成本掉了 60%,但对于复杂问题的处理能力下降了约 15%,且这种下降在短时间内很难通过测试集发现,因为用户在实际使用时会因为回答变得平庸而降低信任度。
所以我的建议是:不要为了省钱而省钱。如果你的业务是强依赖逻辑推理的(比如法律、医疗、复杂代码生成),不要盲目跟风迁移到便宜模型。但如果是做内部文档摘要、邮件起草,现在确实是切换到低成本替代方案的最佳时机。
对不同规模企业的判断
对于初创公司,现在是好时机,因为 API 价格在 2026 年持续走低,这意味着你的推理成本在下降,产品毛利在提升。
对于大型企业,这次 10% 的下降其实是管理层在对 AI 投入进行「去泡沫化」。他们不再看 AI 能不能带来某种魔法,而是在算具体的 ROI(投资回报率)。如果一个员工用 AI 每天省了 1 小时,但公司为了这个 AI 功能每月要支付 50 刀的 Token 费,这笔账在财务看来依然是不划算的。

谁不心疼钱啊,我前阵子刚把几个简单接口从 GPT-4o 换成 Groq 跑 Llama 3,那速度和价格差得离谱。