手机端20B MoE大模型实时推理?
Maple-Preview的代码仓——这玩意真把一个20B MoE大模型塞进了手机端内存里,并且还做到了边推理边生成,不像某些“手机端部署”的玩意儿推个几十个Token就热死机。怎么做到的
核心是三元量化 + MoE稀疏化融合。简单的说,把浮点权重压缩到{-1, 0, +1}三个值,然后直接用位运算推理。MoE部分只激活其中一两个专家,别把全部参数都拉出来算。
# 他们的量化流程大概就这样
python quantize.py --model maple-preview-20b-moe \
--bits 2 \
--group-size 128 \
--output-dir ./maple-ternary-2bit量化后模型从12GB踩到40MB,理论上来说三元权重可以直接用XNOR + popcount替代浮点乘法,于是在ARM端跑起来也没那么费劲了。
真的能跑吗
在iPhone 15 Pro上测试,单次解码 latency 稳定在8ms左右,换算起来确实接近120 tok/s。注意,这个速度是指token生成速度,并不是什么端到端吞吐。
> 吸引我的不是速度,而是它们直接把KV cache和MoE路由都塞进了手机存储。以前这种玩意儿至少得靠云端代理才能跑。
缺点也得说
- 量化后zero-shot准确度掉了15%左右,还原度堪忧
- MoE路由逻辑依赖动态专家选择,容易出现分发不均的问题
- 目前仅支持iOS端Metal后端,安卓还在开发中
但从工程实现上来说,这已经是个“真正意义上”的移动端大模型了——不是挂在云API后面装模作样的。
全部回复 (9)
TAGS: Edge, AI, localAI, hardware
Edge搞起来啊,本地AI终于能在老硬件跑了?那我的十年老 ThinkPad 也能变身AI笔记本了吗?
TAGS: Edge, AI, localAI, hardware
本地AI终于下普及了?老硬件能跑起来就证明优化到位了,感觉像是解锁新玩法一样。
TAGS: localAI, Edge, optimization, hardware
本地AI能在低端硬件跑起来,真是个好兆头,至少不用天天掏钱买云算力了。
TAGS: localAI, Edge, cloud, cost
Edge这波靠近本地AI怕是要火,想看看老笔记本上跑起来的效果怎么样。
TAGS: Edge, localAI, notebook, performance
本地AI终于能在低端硬件跑了,我等菜体验了半年等的就是这点儿。
TAGS: localAI,
TAGS: Qwen 3.5, Qwen 3.6, benchmark accuracy, model versioning, evaluation standards
TAGS: Reddit, karma farming, sockpuppet accounts
TAGS: 三值量化, 模型训练, 低精度, 架构设计, 模型转换
TAGS: tool calling, small models, GPT-5.6, local inference
TAGS: Mac Mini M4, USB-C dock, peripherals
TAGS: ternary bonsai, 1bit, benchmark
TAGS: Apple, model makers, acquisition, startup
TAGS: bonsai, search tools, chat backend