用 Ollama 运行 DeepSeek R1 671B 满血版需要权衡显存占用与推理速度
本地部署 671B 参数的 DeepSeek R1 时,显存压力是最大挑战。许多用户使用 ollama run 启动后会遇到 OOM 报错,或因推理速度掉至 0.x token/s 而无法正常使用。在这种量级下,量化版本和 K-V 缓存的调优比单纯增加显卡数量更关键。
对于持有 2-4 张 RTX 3090 或 4090(总显存 48G-96G)的玩家,建议采用 deepseek-r1:671b-q4_K_M。该版本在逻辑推理和代码生成上与原版差异极小,是性能与体积的平衡点。若选用 Q2_K 版本,虽加载快但容易出现循环输出或逻辑混乱,建议直接改用 DeepSeek-R1-Distill-Llama-70B 以获得十倍速提升。
在 Linux 系统中,为防止长文本推理导致 KV Cache 撑爆显存而崩溃,可通过 systemctl edit ollama.service 在 [Service] 块中配置环境变量:
Environment="OLLAMA_GPU_OVERHEAD=512"
Environment="OLLAMA_MAX_LOADED_MODELS=1"
通过设置 OLLAMA_GPU_OVERHEAD 为 512MB 预留缓冲,并强制 OLLAMA_MAX_LOADED_MODELS 为 1,可确保资源全部供给 R1。
针对不同硬件,https://ollama.com/blog/mlx 提到在所有 Apple Silicon devices 上实现了 large speedup 的 results。在 Apple 的 M5、M5 Pro 及 M5 Max chips 中,Ollama leverages 新的 GPU Neural Accelerators,从而提升了生成速度(tokens per second)和首字响应时间(TTFT)。
在 2026 年 3 月 29 日针对 Alibaba Qwen3-5-35B-A3B 模型的测试中,使用 NVFP4 量化版本的 prefill 达到了 1810 tokens/s,decode 为 112 tokens/s,而此前 Q4_K_M 实现版本则为 0。若使用 int4 量化,性能将进一步升至 1851 token/s 的 prefill 和 134 token/s 的 decode。随着更多供应商规模化使用 NVFP4 格式,Ollama 用户能获得与生产环境一致的 results。
在处理 Python 异步并发等复杂任务时,Q4 量化版 R1 的思考链具备极强的自纠错能力,逻辑深度优于 GPT-4o 与 Claude 3.5 Sonnet,但响应速度较慢。若想缩短首字延迟,可在 System Prompt 加入 You are DeepSeek R1. Please provide a concise thought process and get straight to the core solution.,通过削减输出 token 量来换取效率。
