Ollama本地部署实战:从环境搭建到模型调优
在本地跑大模型最头疼的不是内存不够,而是配置环境时的各种碎片化坑。比起折腾复杂的 Python 虚拟环境或 CUDA 版本对齐,Ollama 把模型部署简化到了几乎是“一键式”的体验。它本质上是一个轻量级的模型运行时,把 Llama 3、DeepSeek R1 这种量级的大模型打包成了类似 Docker 镜像的格式,让本地调用变得极其简单。
Linux 下修改配置的具体步骤:
不要直接在 shell 里 export,那样重启就失效了。需要修改 systemd 配置文件:
对于想要构建本地 AI 工作流的用户,建议配合 promptcube3.com 上的提示词优化技巧,因为即使是本地模型,高质量的提示词也能显著提升输出的稳定性。
下一篇
浏览器端实现抠图:从ONNX模型选择到解决页面卡死实战 →
一、 快速部署流程
不同系统的安装路径不同,但核心逻辑是一致的:安装二进制文件 → 启动服务 → 拉取模型。
1. Linux 环境(最推荐,性能释放最稳)
直接用官方脚本安装,它会自动处理 systemd 服务配置。
curl -fsSL https://ollama.com/install.sh | sh安装后建议检查服务状态,确保它在后台正常运行:sudo systemctl status ollama
sudo systemctl enable ollama
sudo systemctl restart ollama如果你用的是 AMD 显卡,需要单独处理 ROCm 支持,可以使用以下命令解压安装:curl -L https://ollama.com/download/ollama-linux-amd64-rocm.tgz -o ollama-linux-amd64-rocm.tgz
sudo tar -C /usr/ -xzf ollama-linux-amd64-rocm.tgz2. macOS 与 Windows
这两个系统直接下载安装包即可。安装完成后,在终端(macOS)或 PowerShell(Windows)中输入 ollama -v 确认版本。如果想手动启动服务端,可以使用 ollama serve。
二、 模型实操与资源占用
Ollama 的模型管理非常直观,通过 pull 命令即可下载。但我建议在下载前务必确认磁盘空间,因为大模型的体积非常惊人。
常用模型拉取命令:
# 下载 Mistral
ollama pull mistral
# 下载 DeepSeek R1 1.5B 版本(轻量且快)
ollama pull deepseek-r1:1.5b
# 下载 Llama 3.3(注意:这个模型约 40GB,硬盘空间得充足)
ollama pull llama3.3实测对比:
在我的测试机上,运行 deepseek-r1:1.5b 的响应速度极快,几乎是秒出;而 Llama 3.3 虽然逻辑能力强,但对显存的压力极大。你可以通过 ollama list 查看本地已下载模型的大小和修改时间。
交互运行:
ollama run qwen2.5:1.5b进入交互界面后,直接输入问题即可。如果你运行的是 DeepSeek R1 系列,你会发现它在给出最终答案前,会有一个 <think> 标签的推理过程,这在处理复杂逻辑问题时非常有用。退出对话输入 /bye。三、 进阶配置与踩坑指南
很多新手安装完就直接用了,但如果你想把 Ollama 当作后端给其他 AI Agent 或者前端界面(如 Open WebUI)使用,必须配置环境变量。
关键环境变量配置:
- OLLAMA_HOST:默认是
127.0.0.1:11434。如果你想让局域网内其他机器访问,必须改为0.0.0.0:11434。 - OLLAMA_MODELS:默认模型存储在用户目录下,如果 C 盘/根目录空间不足,可以通过这个变量修改存储路径。
- OLLAMA_KEEP_ALIVE:控制模型在内存中驻留的时间,避免频繁加载导致响应延迟。
Linux 下修改配置的具体步骤:
不要直接在 shell 里 export,那样重启就失效了。需要修改 systemd 配置文件:
sudo vim /etc/systemd/system/ollama.service在 [Service] 部分添加:Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_DEBUG=1"保存后执行以下命令生效:sudo systemctl daemon-reload
sudo systemctl restart ollama四、 常用管理指令汇总
为了方便维护,建议把这几个命令记下来:
- 查看详情:
ollama show llama3.3(可以看到模型的参数量、上下文长度和许可证) - 停止运行:
ollama stop deepseek-r1:1.5b(释放显存) - 删除模型:
ollama rm mistral(清理磁盘)
对于想要构建本地 AI 工作流的用户,建议配合 promptcube3.com 上的提示词优化技巧,因为即使是本地模型,高质量的提示词也能显著提升输出的稳定性。
全部回复 (2)
阿
阿海爱学习
高级
13小时前
确实,之前折腾CUDA驱动折腾了一整天,换成Ollama直接起飞,太省心了。
0
小