OpenAI 那个叫 Jalapeño 的自研芯片终于露面了
这几天刷到 OpenAI 硬件副总裁 Richard Ho 的简报,感觉他们这次在底层硬件上的动作比想象中要快。OpenAI 宣布了他们和 Broadcom 合作开发的 ASIC 芯片——Jalapeño。这玩意儿不是为了练模型(训练),而是专门针对推理(Inference)场景设计的,也就是我们平时用 ChatGPT 提问、让 Agent 执行任务时,模型后台跑的那套逻辑。

下一篇
5小时限额又回来了,Plus 用户直接被秒了 →
现在的 AI 推理普遍有个很头疼的矛盾:要么你想让响应速度飞快(低延迟),但吞吐量(同时处理的任务量)就上不去;要么你想让服务器同时服务更多人(高吞吐),那每个人的等待时间就会拉长。OpenAI 宣称 Jalapeño 搞定了这个“鱼和熊掌不可兼得”的问题,能同时实现低延迟和高吞吐。
作为一个整天跟各种大模型 API 打交道的开发者,我其实挺关注这个点的。如果 OpenAI 真的能通过自研芯片把推理成本打下来,同时让响应变得像聊天一样丝滑,那对于构建复杂的 AI Agent 工作流来说,简直是重大利好。
现在的痛点在于:
- 推理成本高昂: 每次调用复杂的推理逻辑,成本都在烧钱。
- 响应延迟波动: 尤其是在跑那种需要多步思考(CoT)或者长文本处理的任务时,等回复的过程非常影响用户体验。

如果 Jalapeño 真的能如他们所说,在 ASIC 架构层面优化掉那些不必要的计算损耗,那么未来我们在部署 Agent 时,可能不再需要为了追求响应速度而被迫使用参数量较小的模型,而是能更从容地用大模型跑复杂的逻辑。当然,这目前还是在硬件层面的技术宣称,实际大规模落地后的性能表现,还得看他们到底能把推理成本压到什么程度。
免费 AI 工具箱 · 全部完全免费
各类AI落地变现的详细拆解见AI赚钱方法实操指南,有不少直接可参考的案例。
