OpenAI公布自研推理芯片Jalapeño首份跑分,每千瓦吞吐量达英伟达系统1.5至1.9倍

不错!点赞

简介

OpenAI在Hot Chips公布与博通联合打造的推理芯片Jalapeño首份跑分:三款公开模型上每千瓦吞吐量达英伟达系统的1.5至1.9倍。该芯片从设计到流片仅用9个月,行业常规需18至24个月。

OpenAI在Hot Chips大会上公布了其与博通(Broadcom)联合打造的推理芯片Jalapeño的首份跑分数据:在三款公开模型上,该芯片的每千瓦吞吐量达到英伟达系统的1.5至1.9倍。更引人注目的是开发节奏——从设计到流片仅用9个月,而行业常规周期为18至24个月,OpenAI借助Codex等AI工具生成kernel加速了全流程。按计划,该芯片将在2026年底进行极小规模部署,其商业指向是对外出租推理算力、争夺AI定价权。与此同时,Google Cloud的TPU业务在2026年二季度收入同比增长超过200%,非英伟达算力体系正在加速成形。

一、事件速览

推理效率一直是AI大规模应用的核心瓶颈与竞争焦点,而每千瓦吞吐量则是最能反映这一瓶颈的指标——它直接关联数据中心可获取的电力额度与单位服务成本。OpenAI选择自研推理芯片,本质上是在回答一个问题:当模型服务规模持续膨胀,算力成本结构中最大的一块能否由自己掌控。Jalapeño与博通联合打造,说明OpenAI并未从头建设芯片工程体系,而是借助成熟的设计服务与制造资源加速落地。2026年二季度Google Cloud TPU业务收入同比增长超过200%、AWS Trainium拿下Anthropic与Stability AI等大客户的背景,共同指向一个判断:非英伟达算力体系正在从备选走向主流。

二、关键数据与技术细节

  • 能效表现:在三款公开模型上,Jalapeño每千瓦吞吐量达到英伟达系统的1.5至1.9倍。
  • 开发周期:从设计到流片仅用9个月,行业常规周期为18至24个月。
  • 提效手段:OpenAI借助Codex等AI工具生成kernel,加速了芯片设计全流程。
  • 合作方:与博通(Broadcom)联合打造,借助其设计与工程能力。
  • 部署节奏:计划2026年底极小规模部署,指向对外出租推理算力、争夺AI定价权。
  • 竞品态势:2026年二季度Google Cloud的TPU业务收入同比增长超过200%;AWS Trainium拿下Anthropic、Stability AI等大客户。

三、行业影响与解读

Jalapeño的信号意义大于其短期产能意义。9个月的流片周期如果可复制,意味着AI工具正在实质性地压缩芯片工程的时间成本——这本身就是AI反哺半导体产业的一个例证。而每千瓦吞吐量1.5至1.9倍的优势,若能在更大规模部署中保持,将直接影响推理服务的单位成本结构,进而影响AI服务的定价空间,这也是OpenAI规划对外出租推理算力的商业基础。对英伟达而言,挑战不再只来自同类GPU厂商,而是来自客户自研与专用架构两条路径:谷歌TPU出货与收入的高增长、AWS Trainium的客户拓展,都在分流原本高度集中的算力采购。有从业者称,从综合成本看,这套非英伟达算力体系的成本甚至可以做到英伟达阵营的50%以下。不过需要看到,2026年底的部署规模被描述为极小规模,从跑分到规模化量产之间仍有工程与良率的现实距离。

四、值得关注的信号

  • 能效取代峰值算力:每千瓦吞吐量成为推理芯片的核心指标,电力约束正在主导芯片设计。
  • AI加速芯片设计:Codex生成kernel把流片周期压到9个月,工具链变革外溢到硬件工程。
  • 客户自研分流需求:OpenAI、谷歌、亚马逊的自研路径,正在削弱单一供应商的定价能力。
  • 推理优化远未触顶:业内将推理优化空间视为2026年重要技术趋势,所谓技术泡沫被质疑为假命题。

小结:OpenAI公布Jalapeño跑分,以每千瓦吞吐1.5至1.9倍与9个月流片周期两个数据,同时回应了能效与工程效率两个问题。2026年底的极小规模部署只是起点,其真正目标是掌握推理成本与AI定价权。在谷歌TPU与AWS Trainium同步崛起的背景下,算力市场的多元化格局已经难以逆转。