别再迷信 CUDA 护城河了,聊聊 AMD 试图通过 Mojo 绕路超车的底层逻辑
最让我触动的观点来自 Chris Lattner。作为 LLVM 的创建者,他看待硬件生态的视角非常毒辣。他认为,面对 CUDA 这种巨无霸,如果 AMD 只是试图做一个“兼容层”或者“翻译层”,永远无法实现真正的反超,因为那样始终是在对方定义的规则里玩游戏。真正的破局点在于“绕道而行”,即通过重新设计语言和编译器的关系,让硬件能力能够更直观地表达,而不是被锁定在某个厂商的专有语言中。
这正是 Mojo 诞生的核心逻辑。Mojo 并不是想做一个简单的 Python 替代品,它本质上是在尝试创造一种可移植的底层替代方案。如果开发者能够使用一种既具备 Python 灵活性,又拥有 LLVM 级别的底层控制力的语言,那么硬件厂商就可以通过优化编译器来提升性能,而不需要强迫开发者去学习一套极其沉重的专有 API。
在会上,Lattner 提到一个很有争议的观点:现在的 AI 其实很“mid”(平庸)。这句话在技术圈引起了不小讨论,但深挖下去你会发现,他指的不是 AI 没用,而是指目前绝大多数所谓的 LLM 创新其实都停留在顶层的“产品包装”阶段。真正的核心竞争力,其实在那些被掩盖在框架之下的底层训练逻辑、硬件调度以及计算效率上。
对于我们这些每天在写代码、调参数的开发者来说,这次峰会其实给出了几个非常具体的实战方向,建议大家关注:
首先是关于内核优化(Kernel Optimization)的认知反差。很多人的习惯是先写代码,发现慢了再去优化 Kernel。但现在的趋势是“算法优先”,在进入底层优化之前,必须在算法层面重新思考数据流向。
其次是不要死盯着 Attention 机制。虽然 Transformer 统治了现在,但非 Attention 的机制,比如 Liquid Foundation Models 这种能够动态调整参数的模型,在计算效率上有着巨大的潜力。当你意识到计算资源被浪费在冗余的注意力机制上时,你才会明白为什么底层架构的创新如此重要。
最后,最关键的一点是软硬协同。在 AI 时代,脱离硬件谈软件优化几乎是行不通的。你写的每一行 PyTorch 代码,最终是如何映射到 GPU 的计算单元(CU)上,这决定了你的模型是跑在 10% 的效率还是 80% 的效率。
总的来说,AI 的竞争正在从简单的“参数量比拼”回归到最原始的计算效率之争。AMD 试图通过 LLVM 和 Mojo 这种底层工具链的重构,把开发者从专有生态的束缚中解放出来。如果这一套逻辑能跑通,那么未来的算力竞争将不再是谁的库更全,而是谁的编译器能更高效地榨干硬件的每一分性能。
