Ollama 新显存机制:多模型并行加载与硬件加速的结合

PromptCube 中级 2026/5/2 404 浏览 6 点赞 约 1 分钟

Ollama 最新版本通过引入 OLLAMA_MAX_LOADED_MODELS 参数,将本地多智能体系统的显存管理从“串行切换”升级为“并行保留”模式,从而消除了传统“显存踢出”带来的对话中断和权重重新加载延迟。与之前依赖单一“通用角色”模型的设计不同,该机制支持按需加载不同专业化模型(如 DeepSeek-Coder 处理代码审计、Llama 3 生成 PR 文案、TinyLlama 验证 JSON 结构),实现角色间无缝切换,而无需频繁卸载重置。

Ollama 新显存机制:多模型并行加载与硬件加速的结合

在 Apple Silicon 设备上,Ollama 进一步利用 M5/M5 Pro/M5 Max 芯片的神经加速器(Neural Accelerators),将 NVFP4 量化格式与现有的 Q4_K_M 方案结合,显著提升了推理速度。以 Qwen3-5-35B-A3B 模型为例,测试显示在 March 29, 2026 的环境中,预填充(prefill)阶段最高可达 1810 tokens/s,解码(decode)阶段则维持在 112 tokens/s 水平。当切换至 int4 量化时,性能将进一步提升至 1851 tokens/s(prefill) 和 134 tokens/s(decode)。这意味着在 Apple Silicon 设备上,Ollama 不仅避免了显存切换的延迟,还通过硬件加速实现了接近生产环境的 large-scale inference results。

不过,并行加载的前提是 VRAM 总量不超出物理限制。以 RTX 3090(24GB) 为例,设置 export OLLAMA_MAX_LOADED_MODELS=3 后,Ollama 可同时保留三个 7B 模型,但若总显存占用超过可用范围,系统将触发内存交换(Swap),推理速度可能降至 1-2 tokens/s,甚至低于单模型运行水平。因此,建议优先选择 4-bit 量化模型,并预留 KV Cache 空间,以避免溢出和性能下降。

此外,随着越来越多的推理提供商采用 NVFP4 格式进行规模化部署,Ollama 用户能够在本地环境中复现与生产环境一致的 speedup 效果,包括 time-to-first-token(TTFT) 和持续生成速度的提升。这意味着未来在 Apple Silicon 或支持 Neural Accelerators 的其他芯片上,Ollama 的多模型并行能力将与硬件加速形成协同,进一步缩短响应时间。

全部回复 (0)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

还没有回复,来发第一条吧!

发表回复

支持 Markdown 格式
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。