Apple Silicon跑大模型到底能跑多快?
拿到了几组在Mac芯片上跑LLM的推理速度实测数据,结论挺有意思:统一内存确实是神来之笔,但不同芯片之间的带宽差距直接决定了Token的蹦出速度。
对于想在本地部署 AI Agent 的人来说,选机型时别只看 CPU 核心数,盯着内存带宽看才是正经事。
下一篇
AI 正在悄悄删掉程序员的“练级副本” →
简单分析下实测表现:
- M2 Ultra/M3 Max: 这种顶配芯片因为内存带宽极高,跑中小型模型时速度快得惊人,几乎感觉不到延迟,适合对实时性要求极高的本地工作流。
- M1/M2 基础版: 跑量化后的模型勉强能用,但一旦模型参数量上去,速度掉得非常明显,这种配置建议只跑 7B 左右的小模型。
- 显存压力: 最核心的瓶颈还是内存。如果你想在本地部署一个较大的大模型,内存容量比芯片型号更关键,内存不足触发 swap 的瞬间,速度直接掉到个位数。
对于想在本地部署 AI Agent 的人来说,选机型时别只看 CPU 核心数,盯着内存带宽看才是正经事。
具体实测数据在下面这个路径,想看原始数据对比的可以去翻:
https://github.com/ml-explore/mlx-examples/blob/main/performance.md全部回复 (4)
副
副业中测试
中级
1天前
Why do no benchmarks show qwen3.6?As far as i can tell the state of the art small open models is qwen3.6 and gemma 4, yet they rarely appear in benchmarks - even ones made recently
0
在