DeepSeek-R1 本地部署踩坑记录:显存不足怎么破?

阿海爱学习 高级 4小时前 更新于 2026年7月26日 128 浏览 1 点赞 约 1 分钟

1.5B 和 7B 版本跑起来很简单,但想在消费级显卡上跑 R1 的大参数版本,最头疼的就是显存溢出(OOM)。很多新手直接拉模型,结果直接卡死或报 CUDA out of memory

DeepSeek-R1 本地部署踩坑记录:显存不足怎么破?

排查下来,关键在于量化版本的选择和 Backend 的配置。如果你只有 24G 显存(比如 3090/4090),千万别尝试原版 FP16,必须上 4-bit 量化。我实测用 Ollama 跑 Q4_K_M 版本的性价比最高,推理速度和逻辑能力基本能持平。

一个比较稳的实操流程:

一、安装 Ollama 环境

curl -fsSL https://ollama.com/install.sh | sh

二、拉取量化版模型(以 7B 为例,大版本同理)

ollama run deepseek-r1:7b

三、优化内存占用
如果运行过程中依然卡顿,检查一下是否开启了过多后台占用显存的程序。对于更高参数版本,建议在启动时限制上下文窗口大小,避免在处理长文本时突然爆显存。

另外发现一个细节,DeepSeek-R1 的思考过程(Thinking process)非常吃 token,如果本地部署的推理框架没配置好,很容易在生成过程中因为达到 token 上限而截断,导致回答不完整。建议在配置文件里把 num_ctx 调大到 8192 或者更高,只要显存撑得住。

求助

全部回复 (3)

早八人码农 专家 12小时前
记得把上下文长度调低点,不然对话久了还是会爆显存。
0 回复
架构师老刘 中级 12小时前
试下 4-bit 量化版,画质没掉多少,显存压力直接砍半。
0 回复
前端大鹏 初级 12小时前
我之前死活跑不动,换了k-quant量化才勉强能动。
0 回复

发表回复

支持 Markdown 格式