OpenAI自研芯片Jalapeño首秀:9个月极速流片,能效比超英伟达Blackwell近两倍

科技区角 2026-08-31 17:02

【区角快讯】当人形机器人在真实的半程马拉松赛道上与人类选手并肩奔跑,并且最终以超越人类世界纪录的50分26秒完赛,这已经不是科幻电影中的场景了。而在一年前的同样比赛中,我们还在嘲笑机器人跑步像“醉汉”,短短一年时间机器人进步速度之快,令人咋舌。其背后所展现的技术突破,远比比赛本身更具深远意义。尤其值得关注的是,2026北京人形机器人半程马拉松比赛,参赛队伍总数超过100支,近四成队伍搭载自主导航技术,智能化水平显著提升,这更是5G-A(5G-Advanced)网络技术在高速移动、高并发、高可靠场景下,对具身智能产业提供支撑的一次关键性验证。5G-A网络:具身智能的“云端运动神经”具身智能机器人要实现真正的自主化,其核心瓶颈往往不在于本体的机械结构,而在于数据流的实时性与可靠性。一台人形机器人在奔跑过程中,需要实时处理海量的激光雷达、视觉摄像头、IMU等传感器数据,并进行毫秒级的决策。这对于本体的算力与能耗是巨大的挑战,因此云、端协同是当下的最优选择。

历经九个月的隐秘研发,OpenAI首款自研推理芯片Jalapeño的成绩单终于在8月25日的Hot Chips大会上揭晓。硬件负责人Richard Ho登台展示的数据显示,在与博通联合打造的这款芯片上,SemiAnalysis的InferenceX基准测试跑出了惊人结果。在GPT-OSS 120B、DeepSeek R1 670B及Kimi K2.5 1T三款大模型的对测中,Jalapeño在“每用户token数”和“每千瓦吞吐量”两项核心指标上,双双超越了当前业界标杆——英伟达Blackwell系统。具体而言,其峰值每瓦吞吐量达到英伟达系统的1.5至1.9倍,意味着同等电量下,Jalapeño能完成近乎翻倍的工作量。

低延迟场景下的差距更为悬殊。以运行DeepSeek R1为例,Jalapeño的单用户生成速度最高可达约700 token/s,而英伟达GB300仅为约169 token/秒。换算下来,前者的速度是后者的4.9倍,用户等待时间被压缩了近四分之三。OpenAI官方博客总结称,Jalapeño通过单一架构实现了更高吞吐与更低延迟的统一,打破了现有硬件通常需要在二者间权衡的局面。不过,这颗芯片的全面部署尚需时日,计划于2026年底进行极小规模试点,真正量产上量要等到2027年。

Jalapeño的独特之处不仅在于性能,更在于其诞生逻辑的反转。过去二十年,行业遵循“为芯片适配模型”的默认秩序,即围绕英伟达发布的硬件进行软件优化;而此次则是“为模型定制芯片”。从初始设计到完成流片,Jalapeño仅耗时9个月,若从2025年10月官宣合作算起,不到一年便拿出第三方见证的完整跑分。相比之下,传统高性能ASIC的研发周期通常长达18至24个月,谷歌TPU和亚马逊Trainium的第一代产品均耗时两年。作为芯片制造的新手,OpenAI将周期砍半以上,其秘诀在于利用AI加速造芯流程。

据悉,在GPT-OSS的部分attention和MoE模块中,AI生成的kernel代码比人工专家编写的版本快1.5至1.8倍。借助Codex和GPT-Astra,OpenAI仅用约两个月便完成了对DeepSeek R1和Kimi K2.5的移植优化。这种能力已渗透至芯片设计、驱动开发及软硬件适配的全流程。目前公开的跑分基于A0版工程芯片,改进版B0已进入台积电N3P工艺制造阶段,第二代芯片深入开发中,第三代也已开始规划。“一年一代”的迭代节奏,正让拥有前沿模型的公司具备抄近道的可能。

跑赢英伟达的秘密,归根结底在于“少搬数据”。芯片行业的常识是计算廉价而数据搬运昂贵,大模型推理的瓶颈往往在于内存带宽而非算力单元。Jalapeño将计算核心与HBM4内存切割为对应切片,每个核心拥有直达本地内存的低延迟通道,如同给工人配备专属工具箱而非共用公共仓库。单封装15.4TB/s的内存带宽确保了数据能被显式地放置在本地,避免反复远程调用。此外,Jalapeño由同一颗加速器同时处理prefill(输入处理)和decode(输出生成),避免了如英伟达Rubin那样拆分专用芯片导致的资源闲置风险,从而灵活适应聊天、推理及Agent等不同流量构成。

然而,这份成绩单并非毫无水分。跑分数据主要由OpenAI提供,SemiAnalysis仅现场见证运行而未独立完成全部测试。且公开结果均基于约8k输入、1k输出的单轮推理,这是相对容易调优的负载。对于更长上下文、多轮交互的智能体任务,OpenAI未公布任何数据,而这恰恰是当前推理需求增长最猛、最考验系统真功夫的场景。值得注意的是,在此次测评中,OpenAI甚至为竞争对手DeepSeek的MLA注意力机制从零开发了底层代码,这或许暗示了其未来向其他模型公司出租推理算力的野心。

巧合的是,就在Jalapeño公布成绩前一天,英伟达也发布了Vera Rubin的跑分,宣布新平台在长上下文场景下输出速度比竞品快4倍,每兆瓦token吞吐量较上一代提升10倍。同日,苹果推出全球首款量产2nm芯片M6,首发搭载于Mac mini,多线程性能提升40%,并试图通过本地AI算力绕开云端按量计费。48小时内,手机巨头、算力霸主与头部模型公司展示了三条截然不同的路径:苹果赌制程与端侧,英伟达赌通用与系统,OpenAI赌垂直与专用。这三条路在技术上互不兼容,却共同将算力生意从单一主导变为三方博弈,模型企业首次用自己的芯片和成本结构给出了另一种答案。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 芯片 英伟达
more
英伟达,入局定制HBM!
英伟达HBM,巨变
日赚44亿!英伟达交出炸裂财报:单季狂揽962亿美元
英伟达财报背后的“会计魔术”:1.5万亿AI投资缺口与630亿应收款疑云
英伟达预计2028财年营收增长70%,AI算力供给短缺至少持续至2028财年末
英伟达拟超130亿美元收购Hugging Face,AI开源生态或迎巨变
英伟达最新财报解读:依旧稳健的超预期
英伟达前AI总监颠覆Transformer!5万亿上下文物理AI,推演整个宇宙
大厂宣布,加购200万颗英伟达GPU
涨幅逾15%?英伟达或调涨AI服务器价格
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号