本地部署LLM:从环境搭建到模型跑通
把大模型跑在自己电脑上,本质上是在用显存换隐私和响应速度。很多人被复杂的环境配置劝退,其实现在只要搞定运行时环境,剩下的就是选模型文件的问题。
下一篇
本地化处理大型JSON:拒绝上传数据的格式化方案 →
想要在本地实操,最稳妥的路径是走 Ollama 或者 LM Studio,这类工具把复杂的 C++ 编译和依赖库给封装好了。
一、环境准备
首先确认你的硬件,尤其是显存(VRAM)。8GB 显存是起步线,能跑 7B 左右的量化模型;如果想跑 14B 或 32B 的模型,得考虑增加内存并接受 CPU 离线推理的极慢速度。
二、快速部署步骤
以最轻量化的 Ollama 为例,安装完成后直接在终端执行:
# 下载并运行 Llama 3
ollama run llama3
# 如果想试试 DeepSeek-R1
ollama run deepseek-r1三、进阶配置
如果你需要更精细的控制(比如调整 Temperature 或 System Prompt),建议配合 Open WebUI 使用。通过 Docker 部署一个前端界面,可以让本地大模型拥有类似 ChatGPT 的对话体验。
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main本地部署最核心的坑在于“量化版本”的选择。建议优先选择 4-bit 量化(Q4_K_M),它在模型能力损失和内存占用之间达到了一个微妙的平衡点。对于大多数开发者来说,这套工作流足以支撑日常的本地代码补全或私密文档分析。
