Qwen2.5-27B 跑 128k 上下文竟然没爆 24G 显存?

RayTinkerer 初级 5小时前 更新于 2026年7月26日 49 浏览 9 点赞 约 1 分钟

24GB 显存跑 27B 模型,通常 32k 上下文就快顶满了,但这次实操发现 VRAM 占用低得反常,直接拉到 128k 竟然只用了 83% 的显存,速度还能稳在 30 tok/s,完全没有掉到系统内存里去。

排查了一下配置,关键在于开启了 Flash Attention 和 KV Cache 量化。如果想在单卡 3090/4090 上强行吃下长文本,可以参考这个环境变量配置:

OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q4_0

在这种配置下,Q4 量化版的 27B 模型跑 128k 没问题,甚至 Q5 版本在 96k 上下文时也能跑通。之前一直以为长文本必然导致显存爆炸,结果 KV Cache 的量化(q4_0)起到了决定性作用,极大地降低了上下文占用。

这种部署实操证明了,只要量化策略对路,中尺寸模型在消费级显卡上的长文本能力比想象中强。

求助

全部回复 (3)

老陈 专家 10小时前
还得看量化精度,4bit 压下去之后显存确实省不少。
0 回复
阿小美 中级 10小时前
这KV量化会对长文本的精度影响大吗?想试试。
0 回复
小Kevin在路上 中级 10小时前
我也试过开启FA,跑长文档时显存确实稳很多。
0 回复

发表回复

支持 Markdown 格式