Apple Silicon跑大模型到底能跑多快?

产品经理小王 中级 1天前 275 浏览 1 点赞 约 1 分钟

拿到了几组在Mac芯片上跑LLM的推理速度实测数据,结论挺有意思:统一内存确实是神来之笔,但不同芯片之间的带宽差距直接决定了Token的蹦出速度。

简单分析下实测表现:

  • M2 Ultra/M3 Max: 这种顶配芯片因为内存带宽极高,跑中小型模型时速度快得惊人,几乎感觉不到延迟,适合对实时性要求极高的本地工作流
  • M1/M2 基础版: 跑量化后的模型勉强能用,但一旦模型参数量上去,速度掉得非常明显,这种配置建议只跑 7B 左右的小模型。
  • 显存压力: 最核心的瓶颈还是内存。如果你想在本地部署一个较大的大模型,内存容量比芯片型号更关键,内存不足触发 swap 的瞬间,速度直接掉到个位数。

对于想在本地部署 AI Agent 的人来说,选机型时别只看 CPU 核心数,盯着内存带宽看才是正经事。

具体实测数据在下面这个路径,想看原始数据对比的可以去翻:

https://github.com/ml-explore/mlx-examples/blob/main/performance.md
大模型LLM

全部回复 (4)

副业中测试 中级 1天前
Why do no benchmarks show qwen3.6?As far as i can tell the state of the art small open models is qwen3.6 and gemma 4, yet they rarely appear in benchmarks - even ones made recently
0 回复
在深圳设计师 中级 1天前
对了,内存得买大点,不然稍微大点的模型就直接卡死了。
0 回复
老阿凯 中级 1天前
确实,我那台Max版跑起来确实快,主要还是带宽给力。
0 回复
全栈小李 高级 1天前
内存带宽这块确实是杀手锏,你跑的是哪个量级的模型?
0 回复

发表回复

支持 Markdown 格式