如果没有 llama.cpp 这种量级的项目
很多本地部署大模型的朋友可能没意识到,Georgi Gerganov 搞出的 llama.cpp 简直是把 LLM 从实验室拉到消费级硬件上的头功之作。最让我感慨的是,在大家还在纠结怎么在 Python 环境里折腾各种依赖、面对
下一篇
给 RAG 加上一个能决定何时停止的 Dispatcher 调度器才 →
OutOfMemory 报错抓狂的时候,他直接用 C++ 重写了推理后端,让量化成了可能。我之前在尝试给一台只有 16G 内存的旧 Mac 部署模型时,原本以为得放弃,结果用了 GGUF 格式的量化模型,竟然能跑起来而且速度还能接受。这种把模型权重压缩到 4-bit 甚至更低,同时尽量维持性能的工程实现,才是真正让本地 LLM 生态爆发的底层逻辑。
如果你现在想在没有顶级显卡的情况下实操部署,建议走这条路:
一、安装与编译
首先得把项目克隆下来,根据自己的硬件环境(比如是 Apple Silicon 还是 NVIDIA GPU)进行编译。如果是 Mac 用户,直接用 CMake 编译即可,性能释放非常快。
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release二、准备量化模型
不要直接去下原版权重,那是给训练准备的。去 Hugging Face 找已经转换成 .gguf 格式的量化版本,这样才能在 CPU 或端侧 GPU 上跑通。
三、运行推理
通过简单的命令行参数就能启动,比如设置 context size 和线程数:
./build/bin/llama-cli -m models/llama-3-8b-q4_k_m.gguf -p "Write a Python script to scrape a website" -n 128这种纯 C++ 的实现方案彻底打破了对 CUDA 的绝对依赖,让很多非 NVIDIA 用户也能体验到大模型。现在的本地推理工作流基本都绕不开这个底座,真的得给这种硬核的工程优化点赞。
免费 AI 工具箱 · 全部完全免费
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。