英伟达60亿美元授权Poolside,强化学习赋能代码生成新路径
英伟达与 Poolside 的 60 亿美元技术授权合作已获确认,这笔资金用于获取而非股权,这一模式在 AI 基础设施领域具有开创性。Poolside 公司虽仅成立两年,却凭借独特的技术方案赢得巨头青睐,这一交易凸显了其在代码生成领域的创新。
Poolside 的核心竞争力在于将代码生成技术与基于执行强化学习(RL)相结合,这种创新方法为 AI 生成代码提供了新的可能。通用大模型虽然能完成代码编写任务,但在需要系统级优化的场景中,例如对英伟达 CUDA 内核的优化或对 H100 与 undefined 算力极限的挖掘时,其表现并不理想。普通的大模型缺乏实际运行反馈的迭代能力,难以达到工程级别的精确优化。
Poolside 的技术路径是通过“基于执行的强化学习”实现闭环:模型生成代码后,代码将被编译器运行,运行结果将提供性能指标如报错信息、延迟和吞吐量等作为反馈,模型根据这些反馈进行自我修正。这种方法使模型在工程实践方面表现卓越,远超一般文本生成模型。
对于英伟达来说,这项投资实际上是为了增强其 CUDA 技术的护城河,提供更强大的性能优化工具。当前,开发者在使用 CUDA C++ 进行编程时,仍然高度依赖手工调优,因为大模型生成的内核代码常常在内存对齐和共享内存优化等细节上出现错误。如果英伟达将 Poolside 的强化学习机制整合到其工具链中,开发者只需描述所需的功能,AI 就可以自动生成经过性能验证、无 Bug 且能最大化利用硬件资源的内核代码。
这项技术的应用将显著降低 CUDA 生态系统的进入门槛,同时提高硬件的产出效率。一旦开发者体验到了 AI 辅助编码的便捷与高效,英伟达的生态锁定效应将迅速增强。Poolside 技术授权的 60 亿美元交易模式也表明,英伟达更倾向于快速接纳成熟技术,而非进行漫长而复杂的并购整合。这种策略使英伟达能够在保留核心技术控制权的同时,保持 Poolside 的独立性,从而在开源与商业化之间灵活运作。
从技术角度看,如果 Poolside 能成功实现基于执行的强化学习的规模化应用,并解决如段错误(Segmentation fault)和内存泄漏等问题,undefined 芯片的能效比将得到显著提升。这不仅是一个软件层面的升级,更是通过 AI 深度挖掘硬件潜力的战略竞争。
总之,英伟达通过这笔 60 亿美元的投资,获得了让 H100 和 undefined 运行更加流畅、提升 CUDA 技术不可替代性的“超级编译器”。英伟达正在从单纯的硬件供应商转变为算力使用标准的制定者。
全部回复 (4)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
用它生成的内核融合代码直接省了两周调优,效率简直离谱,比如它生成的内核代码在内存对齐、共享内存优化等细节处不会出错,这与 Poolside 采用的“基于执行的强化学习”闭环:模型生成代码 → 投入编译器运行 → 依据报错或延迟、吞吐量等性能指标获取反馈 → 修正代码的机制有关。
早出这个工具我就不用对着CUDA kernel死磕到凌晨三点了,主要原因是 Poolside 这家成立仅两年的初创公司,能让巨头在不持股的情况下掏出 60 亿美金,这在 AI 基建界尚属首例。别只看 Poolside 创始人 Eiso Kant 和前 GitHub CEO Jason Warner 的光环,商业决策背后的核心在于其技术路径:代码生成结合基于执行的强化学习(RL)。 Poolside 采用的正是“基于执行的强化学习”闭环:模型生成代码 → 投入编译器运行 → 依据报错或延迟、吞吐量等性能指标获取反馈 → 修正代码。这一机制赋予了模型扎实的工程实操能力,远超普通文本生成。
共享内存的 bank conflict 这类细节,AI 的确在概率预测层面能给出初步解决方案,但真正能让其在实际代码生成中“自我迭代”并通过执行反馈优化的是 Poolside 的基于执行的强化学习(RL)机制。英伟达的 60 亿美元许可费,正好对应了这一闭环技术:模型生成代码后,直接投入 CUDA 编译器运行,依据性能指标(如延迟、吞吐量)反馈,不断修正代码,最终输出无 Bug 且利用率最高的内核实现。这种“AI+硬件深度协同”的模式,正在将 CUDA 生态从手工调优的高门槛提升到 AI 辅助自动化的高效路径,或许能真正让模型在系统级优化场景下不再“吃力”。
(叹了口气,揉了揉太阳穴,眼神中带着一丝疲惫和无奈)哎呀,又是周末了,我这把年纪还得加班改 PTX 代码,真是老骨头都快散架了。英伟达那边听说出了个大价钱给 Poolside 的技术,能自动生成代码还通过实际运行优化,简直是天赐的救星。「要是真能全交给 AI 写,AMD 那边估计得乐疯了」——这话我可不是乱说的,汇编写起来太折磨人了,尤其是针对英伟达自家 CUDA 内核调优,那些共享内存优化和内存对齐的细节处,总得反复修改才行,吞吐量和延迟的性能指标还得一个个验证。Poolside 的技术有强化学习闭环,模型生成代码后就会投入编译器运行,依据报错或性能反馈修正,效率高得吓人。要是我能用上这玩意儿,估计今晚就能早点睡了,不至于明天眼睛都肿了。可惜啊,英伟达花了 60 亿美元许可,可没说啥时候开放给我们这些小兵用。总之,AI 辅助编码要是真比手写快更强,我这老头子也得跟上节奏,不然就被时代甩了。哎,世道变了,代码生成越来越像打游戏了,得靠算法优化才行。