OpenAI首颗「辣椒」芯片压倒英伟达,GPT-6干崩CUDA
你敢信,OpenAI第一次做芯片,竟然把英伟达全系干趴下了?!
就在刚刚,OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」,交出了首批实测成绩单——
AI推理性能,全面反超英伟达GB200和GB300。
实测速度直接起飞!
Jalapeño一秒能狂吐1459个Token,英伟达GB200只有535个,连一半都不到。
「辣椒」跑完一个任务只要1.65秒,GB300却得花将近6秒,整整3.6倍的差距。
最狠的是,哪怕把GB300逼到它自己最快的解码速度,Jalapeño的吞吐也依然是它的104.3倍。
而Jalapeño的标称功耗只有700W,GB300是1400W,整整一半。
著名半导体分析师Dylan Patel更是直接放出狠话,「被掀翻的不只是Blackwell,就连英伟达Rubin芯片也被超越了」!
一时间,整个AI圈都炸了。网友们纷纷惊叹,OpenAI简直杀疯,英伟达也被击败了。
奥特曼的表态则是霸气又克制,「我们造了一颗芯片,快得离谱」!
一颗「辣椒」,干翻了英伟达旗舰
这可不是OpenAI自说自话。
SemiAnalysis钻进实验室实测了一趟,写下的结论是——
Jalapeño把他们此前测过的每一颗英伟达、AMD、谷歌的芯片,全干趴下了。
差距有多大?英伟达最新那颗Vera Rubin吃掉的电,够喂将近三颗Jalapeño。
测试中,OpenAI挑了三个公开模型来跑:GPT-OSS 120B,还有一款670B和1T的模型。
这一轮测试,覆盖了从中型到万亿参数的MoE架构。整体结果如下:
- 每瓦特AI工作负载提升1.5–1.9倍
- 端到端延迟降低1.7–3.6倍
- 在高度交互式工作负载上,性能提升2.1–4.1倍
前面提及的1459个Token/s,是在GPT-OSS 120B上测的。
换算成出词间隔,两个Token之间只隔0.69毫秒。
人正常朗读一秒钟大概吐五六个字,而它一秒甩出1459个,眼睛跟不上,屏幕也刷不过来。
绿色是Jalapeño,蓝色是现有最强。三个模型上分别快2.7倍、4.1倍和3.8倍
1.65秒对5.99秒的那四秒差距,放在聊天里还能忍,放到Agent身上就是另一回事,因为一个任务要连着走几十步,差值是要乘上去的。
然后说那个全网都在转的104.3倍。
它的准确意思是,把GB300推到自己最快的解码速度,也就是每秒169个Token,在那一个点上,Jalapeño的吞吐是它的104.3倍。
三个模型上都是这个走势,GPT-OSS到53.7倍,1T模型到56.1倍。
同一个模型,随着要求的出词速度往上抬,领先幅度从1.7倍一路涨到104.3倍
换句话说,对手跑到极限开始喘的地方,正是它还在从容巡航的地方。
如果按各自最好的工作点算峰值,差距会温和很多,三个模型上分别是1.9倍、1.7倍和1.5倍。
真正拉开距离的是高交互场景
左图横轴是出词速度,右图横轴是完整请求的延迟。绿色的Jalapeño在整条曲线上都压着蓝色的GB200
SemiAnalysis这边,则是把供电、散热、网络全算进去,然后再摊到每颗芯片头上。
结果,Jalapeño每颗1.125千瓦,GB200是1.87千瓦,而Vera Rubin是3.3千瓦。
在这个口径下跑GPT-OSS,Jalapeño每兆瓦每秒吐出约5300万个Token,GB200 NVL72只有约1000万。
紫色那条一骑绝尘的就是Jalapeño,横轴是交互速度,纵轴是每兆瓦每秒吐出的Token数
成本方面,每芯片每小时的总拥有成本,Jalapeño是1.56美元,跟H100的1.55美元几乎一样,而Vera Rubin是3.61美元。
绿色是Vera Rubin,紫色是Jalapeño。过了每秒200个Token,紫色一路走到绿色够不到的地方
最要命的是,这些成绩还不是Jalapeño的全部实力。
它连投机解码和Token预测都没开,也没做prefill和decode的分离部署,而图上其他每颗芯片跑的都是各自最优配置,该开的优化一个不落。
SemiAnalysis估算,光投机解码这一项就能把每Token成本再压掉2/3以上。
一颗Jalapeño,还能跑起「毁灭战士」
九个月,GPT‑Astra一路干到了流片室
这么一颗东西,从设计到流片OpenAI只用了九个月。相比之下,业内常见的时间是18-36个月。
做过ASIC的都知道,这个周期里最磨人的活是验证。仿真得一轮轮重跑,改一个地方就得从头再来。
OpenAI之所以能「开挂」,是因为它把自家最强的模型请进了流片室——
协助开发Jalapeño的模型叫GPT-Astra,也就是外界一直在传的GPT-6!
在整个过程里,GPT-Astra基本上成了团队的最强辅助。
它帮着探索实现方案,把「设计-测量-验证」这一整圈往死里压,还顺手微操了算术电路。
微操到什么程度呢?SemiAnalysis挖到的数字是,AI辅助设计让SIMD单元面积减少8%,矩阵引擎面积减少10%。
同时,这些模块在时序和功耗上都比初版更好。
计算die居中,两侧各三颗HBM4,上方那条是I/O小芯片
主计算die约840平方毫米,而EUV光刻机的掩模版极限是858平方毫米,这块硅离物理天花板只差18平方毫米。
可以说,基本上把光刻机能画的地方占满了,一点没留。
粉色那行是Jalapeño,最右边三列是每瓦HBM带宽、每瓦FLOPs和算力带宽比
每瓦HBM带宽这一项,Jalapeño是22,第二名Rubin是11.1,GB300只有5.71。它比第二名高出整整一倍。
而每瓦FLOPs它是19.1,Rubin是19.4,两者几乎打平,可Rubin要烧1800瓦以上,Jalapeño只要700瓦。
这还只是用A0步进跑的。B0已经在晶圆厂里了,每瓦性能比A0还要再高约25%。
就这样,靠着Codex加GPT-Astra这对王炸组合,OpenAI在短短两个月内,把三个原本压根没排进计划的开源模型,一路爆改到了高性能状态。
更吓人的是,在最吃性能的「注意力」和MoE模块上,AI手敲的代码跑起来,直接比人类顶尖专家快了1.5到1.8倍。
AI设计芯片,芯片跑AI,AI再回头优化芯片上的AI。
这个飞轮,OpenAI已经转起来了。
CUDA护城河,死了?
一直以来,英伟达最深的护城河一直是CUDA。
将近二十年攒下来的软件栈养出了全世界工程师的肌肉记忆,换一次硬件就得推倒重来。
而SemiAnalysis在文章里下了一句相当重的判断,说CUDA的护城河可能已经死了。
理由,就是速度。
他们还补了一个更扎心的对照,英伟达的Rubin其实比Jalapeño早一个月完成CoWoS流片。
可到现在为止,外界能看到的Rubin成绩只有CoreWeave工程样片那点数据,英伟达并没有像OpenAI这样把第三方放进实验室随便测。
所以问题出在软件起步的速度上,英伟达的硬件本身没毛病。
而从零开始甚至还让OpenAI占了便宜,不用背历史包袱,架构可以完全按白纸
SemiAnalysis最后那句写得很有画面感——
他们说GPT-5.6 Sol这类跑在英伟达GPU上的OpenAI模型,被用来设计了一颗真正威胁CUDA护城河的芯片,英伟达自己的GPU正在实时催生自己的「接班人」。
10吉瓦,这才刚开场
Jalapeño只是一条战线的第一枪。
去年10月,OpenAI和博通搞了个大动作,签了个10GW定制加速器的合作大单。
奥特曼和博通CEO陈福阳一起展示Jalapeño晶圆,铭牌上写着「Jalapeño Intelligence Processor」
10GW量级,差不多相当于十座核电机组满发。
左边CPU主机柜,右边ASIC柜,一柜128颗芯片,两柜合计约160千瓦
顺便说,装CPU的托盘叫Katsu日式炸猪排,装芯片的叫Vindaloo印度咖喱,交换机叫Chana鹰嘴豆,从日本菜一路辣到印度菜,这帮人是真想让你记住这套系统。
而Jalapeño只是路线图上的第一代,OpenAI在报告里写得明明白白——
Gen2已经在深度开发,Gen3也正在成形。
量产要到2027年才逐步爬坡,下一个里程碑是100兆瓦。
不过,就在今天,OpenAI还被爆出,数据中心大总管Chris Malone走了!
Malone可是负责「星际之门」(Stargate)的掌门人。
如今,IPO越来越近,在这个节骨眼上,失去算力基础设施的关键统帅,不禁让人对OpenAI背后的暗流涌动浮想联翩。
当然,一颗Jalapeño,还不足以掀翻英伟达。
但真正危险的信号在于,OpenAI已经把模型、芯片和软件拧成了一个加速飞轮。
今天的Jalapeño只是第一代,后面还有Gen2、Gen3,以及10GW的算力版图。哪怕核心高管离场,也挡不住这条路线继续向前。
英伟达依然坐在王座上。
只是这一次,替代者没有在门外排队,它已经跑进了机房。
英伟达的对手,终于开始自己造英伟达了。
参考资料:
https://openai.com/index/jalapeno-first-results/
https://openai.com/index/the-full-stack-behind-abundant-intelligence/
本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西 桃子,36氪经授权发布。















