别再盯着算力 TOPS 看性能了
最近看苹果和小米的新品发布,发现一个很有意思的趋势:不管是苹果在 Mac mini 上吹的所谓“全天候 Agent 生产力”,还是小米那个玄戒 O100 芯片,大家都在疯狂卷一个看似不起眼、实则致命的参数——内存带宽。
现在的 AI 逻辑基本都是自回归生成,每生成一个 token,计算单元都要把内存里那几百亿个参数重新读一遍。这就好比后厨有个手速极快的大厨,但他手里没菜,得等着配菜员一盘一盘把食材送过来。如果配菜员(内存带宽)跑得慢,大厨(算力)再强也只能在灶台前干瞪眼。这种现象在架构里叫 memory-bound,也就是典型的“内存受限”。
最让我觉得有点讽刺的是,随着 AI 对高规格内存(比如 HBM)的需求暴增,存储巨头们正忙着把产能全给数据中心。这意味着咱们普通用户想升级个内存条,可能都在跟全球的 AI 服务器抢晶圆。
很多人对 AI 电脑的理解还停留在“内存容量要大”的阶段,觉得 128GB、512GB 就能跑大模型了。但这其实是个巨大的误区。容量决定了你能装下多大的模型,但带宽决定了模型吐字的速度。
- 容量: 决定了你的模型能不能跑起来。
- 带宽: 决定了你的模型是“秒回”还是“挤牙膏”。
现在的 AI 逻辑基本都是自回归生成,每生成一个 token,计算单元都要把内存里那几百亿个参数重新读一遍。这就好比后厨有个手速极快的大厨,但他手里没菜,得等着配菜员一盘一盘把食材送过来。如果配菜员(内存带宽)跑得慢,大厨(算力)再强也只能在灶台前干瞪眼。这种现象在架构里叫 memory-bound,也就是典型的“内存受限”。

现在的厂商为了拆掉这堵“内存墙”,基本都在走几条极其烧钱的路径:
- 暴力加宽: 像英伟达 RTX 5090 直接上 512-bit 的超宽位宽配 GDDR7,硬生生把带宽顶到 1.8TB/s。
- 空间换时间: 小米玄戒 O100 玩的是 3D 堆叠,把 DRAM 晶圆直接压在 NPU 上方,路程缩短到微米级。
- 架构统一: 苹果的统一内存架构最聪明,它省去了 CPU 和 GPU 之间搬运数据的废动作,大家直接共用一个“大粮仓”。
最让我觉得有点讽刺的是,随着 AI 对高规格内存(比如 HBM)的需求暴增,存储巨头们正忙着把产能全给数据中心。这意味着咱们普通用户想升级个内存条,可能都在跟全球的 AI 服务器抢晶圆。

说到底,存算分离这个冯·诺依曼架构的宿命,在 AI 时代被无限放大了。如果解决不了数据搬运的效率问题,所谓的“AI 芯片”不过是一个空有肌肉却吃不饱饭的巨人。
事件追踪 · 相关报道
硅谷这帮搞科技的最近在玩一种很新的公关逻辑,逻辑核心大概是
1小时前
算力租赁市场里的那些二手 H100 到底能撑多久
14小时前
英伟达这波狂赚的钱到底能不能支撑起整个 AI 产业的野心
15小时前
AI 数据中心居然成了美国左右两派唯一的“共识”?
1天前
黄仁勋在财报会上随口说了句我们已经实现 AGI 了
1天前
英伟达这次给出的 6730 亿美金营收预期是不是有点太疯狂了
1天前
免费 AI 工具箱 · 全部完全免费
