AMD收购Taalas想把AI模型直接刻在硅片上,这能打破推理内存墙吗

PromptCube 专家 2026/8/7 355 浏览 11 点赞 约 3 分钟

在目前的AI算力竞赛中,大家习惯于在软件层优化算子,或者在硬件层堆叠 HBM 内存。但 AMD 最近收购 Taalas 的动作揭示了一个极其激进的思路:如果不再通过通用指令集去“运行”模型,而是直接把模型权重或计算逻辑通过电路设计(Etching in silicon)固化在硬件中,推理性能会发生什么变化?

简单来说,这就是将 AI 推理从“指令执行”模式转变为“电流流动”模式。

目前大模型推理最核心的痛点是“内存墙”。在传统的 GPU 架构中,计算单元(CU)在处理 Token 时,需要频繁地从内存中读取权重,这种数据搬运产生的功耗和延迟远超计算本身。即便使用了 HBM3e 这种极高带宽的内存,在面对万亿参数规模的模型时,数据传输依然是最大的瓶颈。

如果采用 Taalas 的方案,将特定的模型逻辑直接“刻”在硅片上,本质上是将软件定义的神经网络转化为硬件定义的逻辑门电路。这意味着权重不再需要通过总线从内存搬运到计算单元,而是直接存在于计算路径之中。从理论上讲,这种方式可以将推理延迟降低到纳秒级,因为电流通过电路的时间远短于 CPU/GPU 调度指令并读取内存的时间。

但这种方案在工程上存在一个巨大的矛盾:灵活性与性能的博弈。

传统的 GPU 架构之所以强大,是因为它具有通用性。无论你跑的是 Llama-3 还是 Mistral,只要驱动支持,硬件都能运行。但一旦进入“固化电路”阶段,硬件就失去了通用性。如果模型架构发生了微小变动,或者权重需要更新,已经刻在硅片上的电路可能直接失效。

这里就涉及到一个关键的技术细节,即如何平衡“高性能”与“可编程性”。目前的推测是,AMD 并不打算将整个模型完全固化,而是针对 Transformer 架构中那些极其稳定、计算量巨大的核心模块(例如特定的注意力机制计算逻辑)进行物理级优化。如果能将最耗能的矩阵乘法部分通过专用电路实现,而将灵活的参数部分保留在可编程区域,那么能效比的提升将是数量级的。

对于开发者和企业级用户来说,这意味着未来的硬件市场可能会出现分层。除了通用的 Mundefined 系列,可能会出现针对特定模型变体(比如针对特定尺寸的 Transformer 优化版)的物理加速芯片。

这种转变如果规模化,将直接导致推理成本的断崖式下跌。因为在端侧 AI 场景下,功耗决定了设备的续航和发热,如果推理过程不再依赖高频内存交换,而是在专用电路中完成,那么端侧设备运行本地大模型的能效比将获得质的飞跃。

总的来说,AMD 这次收购信号很明确:单纯堆砌 TFLOPS(每秒浮点运算次数)已经无法在推理市场建立绝对优势,必须在架构层面做减法,通过减少冗余的指令调度,用硬件级的深度定制来压榨最后一点性能。

AMDTaalas

全部回复 (10)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

前端老刘 高级 2026/8/7

要是真能把模型刻在硅片上,我愿意花光所有积蓄抢一张首发卡!

0 回复
大鹏的日常 初级 2026/8/7

直接把权重刻死在芯片里也太暴力了,要是能把推理延迟压到1ms以内我直接冲!

0 回复
数据分析师Neo 专家 2026/8/7

软件生态这块儿才是最大的坑,如果CUDA的壁垒还没破,就算硬件性能翻倍也白搭。

0 回复
远程办公技术宅 中级 2026/8/7

五年后估计就成电子垃圾了,到时候这种特制芯片在闲鱼最多卖两百块。

0 回复
程序员Tom 高级 2026/8/7

直接把权重刻进芯片?这要是成了,显存焦虑终于能停了,赶紧出成品!

0 回复
大Jerry 高级 2026/8/7

直接把27B参数刻死在芯片里也太暴力了,这推理速度得起飞到什么程度?

0 回复
阿小美 中级 2026/8/7

现在多伦多AI圈子疯涨,这波收购估计又是想在那边抢地盘。

0 回复
脚本小子阿杰 专家 2026/8/7

只要别又成了PPT产品,直接把权重刻进芯片里简直是暴力美学!

0 回复
阿福在路上 高级 2026/8/7

要是真能出个物理适配卡,我立刻把本地所有轻量模型全换掉!

0 回复
在深圳设计师 中级 2026/8/7

这要是成了,以后手机本地跑70B模型是不是就不用等加载了?

0 回复

发表回复

支持 Markdown 格式