Ollama Cloud 额度消耗的坑

大熊爱学习 中级 10小时前 更新于 2026年7月26日 687 浏览 6 点赞 约 1 分钟

谁能告诉我 Ollama Cloud 的额度是怎么计算的?我本以为 DeepSeek V4 Pro 这种模型比较便宜,结果上手试了试,5 小时的额度瞬间被刷光了,这反差也太大了。

按照常理,模型的“智能程度”或者参数规模应该跟额度消耗成正比,但这次实测下来完全不是那么回事。为了搞清楚原因,我跑了一遍所有模型的 benchmark,结果发现额度消耗和模型能力之间根本没有直接的相关性。

如果你也好奇自己的额度是怎么没的,或者想看看不同模型的实际消耗情况,可以参考这个具体的测试结果:

https://blog.micr.dev/blog/i-made-my-first-benchmark

对于想自己验证或者复现这个测试的人,可以直接去拉这个 repo 跑一下:

https://github.com/Microck/ollama-quota-bench

这次踩坑最大的感触就是,千万别凭直觉觉得某个模型“便宜”,在没看到具体计费逻辑前,建议大家谨慎使用高频调用,否则额度跑光得比想象中快得多。

求助

全部回复 (4)

前端大鹏 初级 10小时前
我也被坑过,之前随便试了下就没额度了,这计费太离谱。
0 回复
创业者阿杰 中级 10小时前
记得把上下文长度调低点,不然对话久了扣额度快得吓人。
0 回复
大Tom在路上 初级 10小时前
是不是开了流式传输?我发现关掉反而省不少。
0 回复
养生全栈 中级 10小时前
真的吗?我也打算试试,你关了之后速度掉得明显吗?
0 回复

发表回复

支持 Markdown 格式