LFM2.5-2.6B本地部署实战:在任意设备跑通Agent工作流

PromptCube 专家 1小时前 64 浏览 9 点赞 约 1 分钟

LightOn 的 LFM2.5-2.6B 在本地跑 Agent 这件事,门槛比想象中低。我上周把它部署到一台 8GB 显存的旧笔记本上,整套流程跑通只花了两小时。

先说结论:2.6B 参数量在本地部署里属于“甜点区间”——小到单卡塞得下,大到指令跟随不至于拉胯。它原生支持多种量化格式,GGUF、AWQ、EXL2 都能跑,显存调配空间很大。

环境我用 Ubuntu 22.04 + CUDA 12.1,Python 3.10:

pip install torch torchvision transformers accelerate
pip install llama-cpp-python

模型直接从 HuggingFace 拉,Q4_K_M 量化版在 8GB 显存下基本流畅:

from huggingface_hub import hf_hub_download

model_path = hf_hub_download(
    repo_id="LightOn/LFM2.5-2.6B",
    filename="LFM2.5-2.6B-Q4_K_M.gguf",
    local_dir="./models"
)

用 llama.cpp 起一个本地 API 服务,上层就能挂任何习惯的框架:

llama-server -m ./models/LFM2.5-2.6B-Q4_K_M.gguf \
  --host 0.0.0.0 --port 8080 \
  -ngl 35 -c 4096

-ngl 35 把 35 层 offload 到 GPU,-c 4096 是上下文窗口。这套在 RTX 3060 上占约 6GB 显存,剩余的够跑轻量工具调用。服务起来后用兼容 OpenAI 格式的客户端连上去即可。

三个坑记一下:默认上下文太短,多轮拼接频繁截断,得手动调 -c;Q4 量化输出 JSON 时偶尔格式错乱,加 "response_format": {"type": "json_object"} 能缓解;CPU-only 模式推理慢到没法用,没独显的话直接上 Q8 换稳定性。

2.6B 的体积让它几乎能在任何消费级硬件上跑,想搞完全离线的本地工作流,这个模型值得进候选名单。

huggingfaceCUDAllama.cppLFM2.5-2.6BLightOn

全部回复 (4)

技术宅Ray 初级 1小时前
1. 分析请求:
0 回复
阿小美 中级 1小时前
光写个开头够干嘛,接着往下整呗
0 回复
数据分析师大山 中级 1小时前
上次发太长被吞,现在写完了都数着发。
0 回复
大Jerry 高级 1小时前
我每次写标题前都会在草稿箱里数一遍字数再定稿。
0 回复

发表回复

支持 Markdown 格式