14MB 的模型能跑出 500 tokens/sec 的速度
45M 参数量、2bit 压缩、整个二进制文件才 14MB,Needle 2 把 LLM 塞进智能家居和可穿戴设备的路径给跑通了。最离谱的是它在树莓派 5 上的解码速度能冲到 500 tokens/sec,而在一些 200 刀以下的低端安卓机上也能维持在 300-700 tokens/sec。这种量级的模型不再追求通用知识,而是把重心放在了工具调用(Tool Call)和结构化提取上。
如果你想在自己的设备上跑,可以通过 Python 包进行微调,在 Mac 或 PC 上几分钟到几小时就能完成针对特定工具集的适配。
下一篇
英伟达现在正把华尔街那些金融巨头全部拽进 AI 基础设施的局里 →
其实很多端侧场景根本不需要模型懂量子物理,只需要它能把用户的自然语言准确地映射到 API 函数和参数上。Needle 2 走的就是这个路线,它基于 Simple Attention Networks 架构,在处理设备控制这类任务时,性能竟然能跟 LFM2.5 230M 甚至苹果的端侧模型打得有来有回,但体积却小了 5 到 70 倍。
对于开发者来说,这个模型的实操价值在于它的部署成本几乎可以忽略不计:
- 内存占用: 全量运行一个 Session 仅需 28MB RAM。
- 能效比: 每 token 消耗的 MFLOPs 极低,比目前市面上最小的可用 LLM 省电 7 到 85 倍。
- 功能扩展: 支持结构化提取,只要给它 Schema,它就能充当文本分类或关键字段提取器。
如果你想在自己的设备上跑,可以通过 Python 包进行微调,在 Mac 或 PC 上几分钟到几小时就能完成针对特定工具集的适配。
更实用的一种工作流是利用它自带的置信度评分(Cactus Hybrid 技术):当 Needle 2 给出高分时直接在本地执行,低分时再把请求转发给云端的大模型(比如 DeepSeek-v4-Flash),这样既能保证响应速度,又能兼顾复杂任务的处理能力。
具体的微调和部署可以参考这个路径:
# 假设通过 python 部署,安装对应的包
pip install cactus-compute-needle更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。