LFM2.5-2.6B本地部署实战:在任意设备跑通Agent工作流
LightOn 的 LFM2.5-2.6B 在本地跑 Agent 这件事,门槛比想象中低。我上周把它部署到一台 8GB 显存的旧笔记本上,整套流程跑通只花了两小时。
先说结论:2.6B 参数量在本地部署里属于“甜点区间”——小到单卡塞得下,大到指令跟随不至于拉胯。它原生支持多种量化格式,GGUF、AWQ、EXL2 都能跑,显存调配空间很大。
环境我用 Ubuntu 22.04 + CUDA 12.1,Python 3.10:
pip install torch torchvision transformers accelerate
pip install llama-cpp-python模型直接从 HuggingFace 拉,Q4_K_M 量化版在 8GB 显存下基本流畅:
from huggingface_hub import hf_hub_download
model_path = hf_hub_download(
repo_id="LightOn/LFM2.5-2.6B",
filename="LFM2.5-2.6B-Q4_K_M.gguf",
local_dir="./models"
)用 llama.cpp 起一个本地 API 服务,上层就能挂任何习惯的框架:
llama-server -m ./models/LFM2.5-2.6B-Q4_K_M.gguf \
--host 0.0.0.0 --port 8080 \
-ngl 35 -c 4096-ngl 35 把 35 层 offload 到 GPU,-c 4096 是上下文窗口。这套在 RTX 3060 上占约 6GB 显存,剩余的够跑轻量工具调用。服务起来后用兼容 OpenAI 格式的客户端连上去即可。
三个坑记一下:默认上下文太短,多轮拼接频繁截断,得手动调 -c;Q4 量化输出 JSON 时偶尔格式错乱,加 "response_format": {"type": "json_object"} 能缓解;CPU-only 模式推理慢到没法用,没独显的话直接上 Q8 换稳定性。
2.6B 的体积让它几乎能在任何消费级硬件上跑,想搞完全离线的本地工作流,这个模型值得进候选名单。
事件追踪 · 相关报道
英伟达用二十年堆出来的CUDA生态墙,现在被AI编程代理盯上了。
1天前
mere.run: 一个CLI搞定文本图像视频音乐3D本地生成
5天前
算力规模的指数级增长将直接决定下一代大模型的智力上限
6天前