2026-08-26 · 对账更新 · 续篇:《Jalapeño 拆解:当 AI 公司开始造自己的心脏》(2026-06-27)、《SemiAnalysis AgentX 实测拆解》(2026-08-25)
引子:Rubin 还在路上,OpenAI 先交了卷
昨天,AgentX 拆解文收尾时留了一张日程表:SemiAnalysis 明说 Rubin 八月内上 InferenceX 基准,NVIDIA 30×/35× 宣传数字的独立复核有了着落。那篇的话题是「基准即权力」:公开基准正在成为芯片成绩的发布场。
日程表还没等来 Rubin,先等来了更意外的入场者。8 月 25 日,Hot Chips 大会,OpenAI 发布 Jalapeño 首批实测成绩:三个公开模型上对比 NVIDIA 现役 Blackwell 系统,峰值吞吐下每瓦 AI 工作量 1.5 至 1.9 倍,端到端延迟低 1.7 至 3.6 倍。Jalapeño 额定 700W,实测持续功耗不超过 550W;对照组 GB200 额定 1200W,GB300 额定 1400W。
两个月前,我们在 Jalapeño 发布三天后写过拆解,留下一张推算表和五个成败硬指标。这篇文章做两件事:把成绩单逐层读透,再回六月对一次账。
一、成绩单:四层指标怎么读
先交代测试设置。基准是 InferenceX,SemiAnalysis 的公开推理基准,测完整服务过程(它的数据集怎么造、回放怎么防作弊,前文 AgentX 拆解有详述)。OpenAI 选了三个公开权重模型:GPT-OSS 120B、DeepSeek R1 670B(MXFP4 量化,块缩放的 4-bit 浮点格式)、Kimi K2.5 1T(同格式)。负载规格统一为 8k 输入 / 1k 输出,STP 模式(单 token 预测,即常规逐 token 解码,不带投机加速)。跨系统比较按各家公布的封装额定功耗归一。
成绩分四层,一层比一层惊人,也一层比一层需要解释。
第一层,峰值每瓦吞吐:1.5 至 1.9 倍。GPT-OSS 120B 上(对比 GB200),Jalapeño 每千瓦混合 token 吞吐(输入与输出合计的吞吐口径)85,448,GB200 是 44,960。DeepSeek R1 上(对比 GB300)是 19,641 对 11,781,Kimi K2.5 上是 18,195 对 11,862。模型越大倍数越小(对照也同时从 GB200 换到了 GB300,收窄里有对照组的成分),但都守住 1.5 倍。这层最扎实:口径清晰,差距真实。
第二层,端到端延迟:低 1.7 至 3.6 倍。同一批测试里,GPT-OSS 上单请求完整响应 1.03 秒对 1.80 秒;DeepSeek R1 上 1.65 秒对 5.99 秒。这层是交互产品能直接感知的差距。
第三层,最低 token 间隔(TBT,输出两个 token 之间的间隔):低 2.7 至 4.1 倍。Jalapeño 把 TBT 压到 0.69 至 1.44 毫秒,对应每用户 694 至 1,459 token/秒的输出速度;GB 系统的最佳点在 1.87 至 5.90 毫秒。这层是 agentic 负载的命门:代理要串行完成几十上百步,每一步的等待都会复利叠加。官方对「高交互负载」另给了 2.1 至 4.1 倍性能的区间,附录未列明细,存档即可。
第四层,同交互点吞吐:53.7 倍、104.3 倍、56.1 倍。这组数字最吓人,也最容易误读。口径是:把系统调到 GB 系统能达到的最佳交互质量(它自己的 previous-best TBT),在那个点上比吞吐。GB300 跑 DeepSeek R1 时若把每用户速度维持在 169 token/秒,每千瓦只能出 118 个混合 token;Jalapeño 在完全相同的用户体验点上每千瓦出 12,258 个。差距来自通用 GPU 在低延迟高并发区间难以维持吞吐,而 Jalapeño 的架构在这个区间还能继续压榨。这组倍数衡量的是「交互质量不妥协时还能服务多少人」,引用时必须带条件从句;简化成「快一百倍」是误读。

还有一个口径细节:OpenAI 按额定功耗归一(700W 对 1200/1400W),而 Jalapeño 实测持续不超过 550W。按实测功耗算,它的每瓦数字还会更好看;除非对照组也同比例低于额定,而对照组的持续功耗未披露,无从对称校验。归一方向对 Jalapeño 偏保守,这点可以记下。
成绩单之外,官方留了一句吊胃口的话:在内部前沿 OpenAI 模型上,优势进一步扩大。没有数字,公司自述,按下不表。
二、架构:胜负手在数据搬运
Hot Chips 的材料补上了六月文缺失的架构细节,三条主线。
矩阵引擎用 MXFP4 数值格式加权重驻留脉动阵列,与 Google TPU 同源。差别在灵活性:Jalapeño 支持更小的计算维度,怪形状的矩阵乘法不会掉进大尺寸脉动阵列的性能悬崖(SemiAnalysis 的分析)。这也解释了三个非 OpenAI 模型为什么能跑:这颗芯片面向现代 LLM 推理的公共结构,GPT 专属定制只是其中一层。
系统设计围绕推理的相位特征展开。Prefill(处理输入的阶段)吃算力,decode(逐 token 生成)吃内存带宽,通信会让计算单元空转等待。Jalapeño 的做法:模型状态(包括 KV Cache,推理中存放已处理上下文的中间数据)显式放置、保持本地;计算、内存、网络按相位组合调度。互连网络构成一个大域,整个负载留在同一套连接的系统内,跨系统搬数直接省掉。Register 给出的系统口径是 128 颗芯片、1.7 EFLOPS、27TB HBM。两个数字可以互相咬合。1.7 EFLOPS 除以 128 约 13.3 PFLOPs(1 EFLOPS = 1,000 PFLOPs),与 SemiAnalysis 披露的 B0 单芯片 13.4 PFLOPs MXFP4 吻合。27TB 除以 128 约 211GB,高于六月推算的上限;单芯片内存官方未单独披露,此为推回值。
芯片级对比藏着本轮最重要的技术信号。据 SemiAnalysis,B0 流片版本(A0 之后的优化版)的单计算 die 采用 TSMC N3P 工艺,13.4 PFLOPs MXFP4,面积接近 reticle 尺寸上限(光刻掩膜版面积的天花板)。对照组 Rubin 的计算 die 同工艺、近似尺寸,17.5 PFLOPs NVFP4(NVIDIA 的 4-bit 浮点格式)。折算下来,Jalapeño 的纸面峰值密度低约四分之一,实测每瓦吞吐反超。差距的来源在数据搬运与相位调度:算得慢一点,但搬运和空转少得多。这对六月文是一处修正——当时我们把能效优势主要归给制程红利和低功耗设计,实际立功的是架构对负载形状的贴合。

顺带一句竞品分野。Register 在报道里点名了 Taalas:把性能押在特定模型上、牺牲可编程性的路线已经被证伪。Jalapeño 用三个外部模型的成绩,把自己划到了另一边。
三、对账六月:推算表与五指标
六月推算表逐项对照八月实测:

功耗是唯一明确的错,错因值得记一笔:六月推算以风冷友好的 300-500W 为前提,OpenAI 把功耗墙推到了 700W,前提不成立。这个方向其实更有利:额定 700W 仍只有 GB300 的一半,实测 550W 更低,单机架能塞的算力密度反而上去了。另外六月还推过单卡纸面能效 ~29 TFLOPS/W 的「史上最高」,本轮实测口径是每瓦有效吞吐,两者不可直接对账,方向上算是自洽。
五个成败硬指标,两个月后的进度:
- 部署时间:进行中。官方口径维持 2026 年底开始部署,Richard Ho 补充「量会非常小」;SemiAnalysis 出货模型给的是 2027 年逐季爬坡、Q4'27 主力产出。
- 「成本降 50%」:口径升级。六月这还是 Hock Tan 的 TCO 承诺,现在有了每瓦 1.5-1.9 倍的公开基准数字支撑。营销话术变成了可复核的工程数字;每瓦吞吐不等于 TCO,真正的验证仍要等 2027 年财报口径。
- 软件生态:部分证据。三个计划外开源模型两个月内带到高性能,说明架构灵活性;PyTorch/Triton 日常流水线支持仍未验证。
- HBM 与产能:B0 在厂是积极信号,2027-28 供应待验。
- 代际节奏:Gen 2 deep in development、Gen 3 taking shape。B0 相对 A0 约 25% 的每瓦提升(SemiAnalysis 数据)是「每年一代」承诺的第一块物理证据。
六月文在软件适配一节问过:「硬件按时流片了,软件能不能在 2026 年底大规模部署前打磨好?」八月成绩单里最出人意料的,恰好是这题的答案线索——软件是 AI 写的。下一节。
四、独立验证:SemiAnalysis 的交叉分析
所有成绩目前是 OpenAI 自测自报。InferenceX 是公开基准,本轮测试的执行方仍是 OpenAI 自己(Register 的措辞:presumably unofficial)。独立验证来自 SemiAnalysis 当天发的分析信,两个结论值得摘录。
其一,Jalapeño 的 STP 每 MW 输出吞吐,超过 Vera Rubin 今年七月公布的 MTP 成绩(MTP:多 token 预测,一次生成多个 token 的投机解码技术)。翻译:Jalapeño 不带投机解码,赢了 Rubin 带投机解码的公开成绩;对 GB200 的 2025 年 MTP 成绩优势更大。SemiAnalysis 的比较方法是拿未成熟系统比未成熟系统,避免用成熟度差距冒充硬件差距。具体做法:Rubin 2026 年 7 月的成绩对 GB200 2025 年的成绩,对齐 bring-up(新系统首次调通)早期阶段,拉平软件成熟度。Jalapeño 流片晚于 Rubin,两边都未成熟,数字都还会涨。
其二,时间线。所有公开成绩取自 A0 版硅片,SemiAnalysis 的原话是「just 9 months into the program」,项目启动刚九个月;B0 已在厂。与 Rubin 的时间线相比,Jalapeño 走到今天的公开成绩用的时间短得多,SemiAnalysis 的形容是「shockingly quick」。
这两个结论让本轮成绩的可信度上了一个台阶,自测折扣仍然成立:模型选择、系统配置、测试执行都在 OpenAI 手里。等 Rubin 正式上 InferenceX,同一基准下的厂商同台数字才是终审。
五、AI 造芯:回路第一次有了数字
六月文判断「模型与芯片的耦合会越走越深」。八月成绩单把这个判断变成了带数字的证据链。
设计侧:OpenAI 的模型加速了设计探索、验证回路和算术电路优化,把设计到流片压到 9 个月。编程侧:用 Codex 搭 GPT-Astra,两个月把三个计划外开源模型带到高性能。分量最重的数字:GPT-OSS 的部分 attention 与 MoE 模块,AI 生成的实现比人类专家写的版本快 1.5 到 1.8 倍。官方自带限定:这是选定模块,非全模型。
架构层面还有一句容易被略过的话:Jalapeño 被设计成对人类和 AI 都清晰的编程目标——局部张量、显式通信、可预测的同步。并行编程这个经典难题,在这里被拆成了 AI 可解的映射、放置、调度问题。芯片为 AI 而设计,AI 为芯片写程序,写出来的效率反哺下一代芯片的设计。这个回路转起来的速度,六月的「隐性赌注」段落没有料到。

六、四个软肋与三个判断
按惯例,先把这篇文章可能被证伪的地方写清楚:
- 自测自报。本轮无第三方执行记录,模型与配置的选择权在 OpenAI。
- 对标代际。对照组是 Blackwell。Jalapeño 规模部署在 2027 年,同期 Rubin 与 AMD MI455X 预计都在 2027 年初量产爬坡。Ho 本人在媒体会上承认:到 Jalapeño 全面部署时,对手可能已经显著进步。
- 小量与规模之间隔着 2027。2026 年底 very small volumes,Q4'27 才是主力,良率、供应链、大规模运维的坑都在后面。
- 训练仍靠 NVIDIA。官方明确继续广泛部署 NVIDIA 与其他伙伴的加速器。这颗芯片改写的是推理成本结构;算力版图的另一半还押在 NVIDIA 阵营。
判断三条:
OpenAI 的经济学拿到了第一份实测证据。有用功除以电力,是推理成本最硬的口径。每瓦 1.5-1.9 倍意味着同一份电力预算多服务五到九成的量;700W 对 1400W 的功耗差另算一笔账:单机架能塞的算力更多,散热与配电的负担近乎减半。官方给的产品侧翻译更直白:ultra-fast 模式的推理效率,达到了过去只有 fast 模式才有的水平。operating leverage(经营杠杆:收入增速跑赢成本增速)的叙事第一次有基准数字托底。
NVIDIA 的时间窗有了刻度。训练侧安全垫完好,推理份额的侵蚀排进了日程:2027 年 Q4 起,客户名单上最能买的那家,开始用自己的芯片回答成本问题。对 NVIDIA 的估值叙事,这比任何云厂商的 ASIC 都更直接。
「基准即权力」得到一次 24 小时内的验证。OpenAI 把首份实测按 InferenceX 公开口径跑出来,连附录带明细发在自家博客上,SemiAnalysis 同日做了独立交叉分析。厂商首发成绩选择第三方基准当发布场,基准的中立性就成了基础设施。昨天那篇文章的论点,落地不到一天就有了第一个引用案例。
六月文把 Jalapeño 读作「模型 + 自研芯片」全栈范式的最新坐标点,宁可谨慎拒绝过度解读。八月成绩单给了这个坐标点第一份非营销证据:芯片真实存在、性能真实领先、路线图真实推进。也仅是第一份。B0 还在厂里,Rubin 的同台成绩还欠着,规模化的答案在 2027。OpenAI 交了卷,阅卷才刚开始。
