DeepSeek-R1 本地部署踩坑记录:显存不足怎么破?
1.5B 和 7B 版本跑起来很简单,但想在消费级显卡上跑 R1 的大参数版本,最头疼的就是显存溢出(OOM)。很多新手直接拉模型,结果直接卡死或报
下一篇
ISLP vs Hands-on ML →
CUDA out of memory。排查下来,关键在于量化版本的选择和 Backend 的配置。如果你只有 24G 显存(比如 3090/4090),千万别尝试原版 FP16,必须上 4-bit 量化。我实测用 Ollama 跑 Q4_K_M 版本的性价比最高,推理速度和逻辑能力基本能持平。
一个比较稳的实操流程:
一、安装 Ollama 环境
curl -fsSL https://ollama.com/install.sh | sh二、拉取量化版模型(以 7B 为例,大版本同理)
ollama run deepseek-r1:7b三、优化内存占用
如果运行过程中依然卡顿,检查一下是否开启了过多后台占用显存的程序。对于更高参数版本,建议在启动时限制上下文窗口大小,避免在处理长文本时突然爆显存。
另外发现一个细节,DeepSeek-R1 的思考过程(Thinking process)非常吃 token,如果本地部署的推理框架没配置好,很容易在生成过程中因为达到 token 上限而截断,导致回答不完整。建议在配置文件里把 num_ctx 调大到 8192 或者更高,只要显存撑得住。
