Qwen2.5-27B 跑 128k 上下文竟然没爆 24G 显存?
24GB 显存跑 27B 模型,通常 32k 上下文就快顶满了,但这次实操发现 VRAM 占用低得反常,直接拉到 128k 竟然只用了 83% 的显存,速度还能稳在 30 tok/s,完全没有掉到系统内存里去。
下一篇
避开AI:图书馆里那些反向操作的实战技巧 →
排查了一下配置,关键在于开启了 Flash Attention 和 KV Cache 量化。如果想在单卡 3090/4090 上强行吃下长文本,可以参考这个环境变量配置:
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q4_0在这种配置下,Q4 量化版的 27B 模型跑 128k 没问题,甚至 Q5 版本在 96k 上下文时也能跑通。之前一直以为长文本必然导致显存爆炸,结果 KV Cache 的量化(q4_0)起到了决定性作用,极大地降低了上下文占用。
这种部署实操证明了,只要量化策略对路,中尺寸模型在消费级显卡上的长文本能力比想象中强。