← 返回观点 思考

从独赌到共识:Groq 3 LPX 量产与低延迟推理的八个月

八个月前,收编一家推理芯片公司是 NVIDIA 一个人的赌注;八个月后,它成了六家公司的默认架构。本文拆解三组量产数字的成色,盘点量产与可用之间的四道依赖,对五月旧文做预测对账,并审视 SRAM 与 HBM 两种介质的赌注。

2026-08-25思考35 分钟阅读

2026-08-25 · CPX/LPU 系列第二篇 · 前作《CPX 之死与 LPU 之生》

2025 年 12 月 24 日,NVIDIA 宣布以约 200 亿美元现金获得 Groq 的技术授权与核心团队。黄仁勋当晚澄清:「我们不是在收购 Groq 这家公司。」2026 年 8 月 24 日,斯坦福纪念礼堂,Hot Chips 2026 会场,NVIDIA 宣布 Groq 3 LPX 推理加速器进入全面量产。从交易到量产,恰好八个月。

同一天,NVIDIA 放出三组数字:每秒 3400 个输出 token、每兆瓦吞吐提升 30 倍、每 token 成本下降 35 倍。也是同一天,据美股收盘报道,英伟达股价走完连续第七个交易日下跌,创 2022 年 9 月以来最长连跌纪录。

量产的利好和市场的疑虑出现在同一张日历上。这份巧合不必强行解释成因果。低延迟推理恰好站在两者中间:它是 NVIDIA 押注的高端 token 生意,也是市场衡量 AI 基础设施回报的一块试纸。

八个月前,把一家推理芯片公司收进平台是 NVIDIA 一个人的赌注。八个月后,这个赌注变成了全行业的默认架构。本文回答四个问题:数字到底有多硬,量产和可用之间隔着什么,我们五月的预测对了几成,以及六家竞争者为什么在半年内收敛到了同一个答案。

从 CPX 之死到 LPX 全面量产的八个月时间线
从 CPX 之死到 LPX 全面量产的八个月时间线

这条路压缩后就是:2025 年 9 月 Rubin CPX 以长上下文推理 GPU 的身份亮相;12 月 24 日 200 亿美元交易;2026 年 3 月 GTC 上 CPX 从路线图消失、LPX 登场;6 月试产、7 月首批交付;8 月 24 日全面量产。

一、三组数字的成色

先说结论:这三组数字的可信度不在一条水平线上,而且差距不小。

3400 token/秒是跑分环境的纪录。 这个数字来自 Artificial Analysis 的基准测试,运行 Gemma 4 31B(一个 310 亿参数的开源智能体模型),上下文长度 100K token,NVIDIA 称这是该模型有史以来的最快纪录。需要说明的是,跑分硬件由 NVIDIA 供货,尚无独立第三方的复测。作为参照:人类阅读速度约每秒 5 到 7 个 token;OpenAI 于 8 月 13 日开放限量预览的 Ultrafast 档位,在 GPT-5.6 Sol 全量模型上做到每秒 750 个输出 token;Cerebras 8 月 18 日发布的 CS-4 系统在 GPT-OSS-120B(1200 亿参数,规模约为 Gemma 4 31B 的四倍)上跑出每秒 4400 个 token,那组数字是 Artificial Analysis 在第三方环境实测的。NVIDIA 还宣称 LPX 在延迟敏感负载下的响应速度是「最近竞品平台」的 4 倍,但没有说明基线是谁。这些数字放在一起,分不出真正的高下:模型规模从 8B 到 120B 相差 15 倍,直接比 token 速度就是在比口径。

30 倍和 35 倍是厂商自测的进步。 每兆瓦吞吐最高提升 30 倍、每百万 token 成本最高下降 35 倍,对比对象是上一代 GB300 NVL72,负载是 SemiAnalysis 的 AgentX 智能体编码轨迹(保留了真实的上下文增长、工具调用和子代理生成),模型是 DeepSeek V4 Pro。这份测试有两个注脚,都写在 NVIDIA 官方博客原文里:其一,测试由 NVIDIA 自己完成,「目前等待 SemiAnalysis 复核」;其二,结果「尚未包含 Vera CPU 在工具调用上的增益」。也就是说,这是自测的早期数据,复核未完成,还有一部分增益没算进来。另外有一个安静的口径迁移:3 月 GTC 上公布的 35 倍指的是每兆瓦吞吐的预测值,8 月的 35 倍换成了成本口径,而同指标的吞吐数字是 30 倍。同一个品牌数字换了度量衡,实测替代投影是进步,但同口径缩水了约 15%,这个弯没必要绕着走。

15 倍是目前最扎实的数字。 OpenRouter 的数据显示,智能体任务的 token 消耗是简单聊天的 15 倍:一个研究任务里,代理查询数据库、检索文档、调用子代理、运行代码再验证结果,上下文在数百个步骤里持续累积。这个数字说明的是需求侧的总量增长,它本身并不直接证明「低延迟是刚需」。延迟的论证链是另一条:智能体的任务完成时间等于每步延迟乘以步数,步数以百计时,每步快慢被任务链线性放大。这条论证是定性的,但目前没有人拿出定量的反驳。

三组数字按可信度排序:15 倍(行业数据)> 30 倍/35 倍(厂商自测,待第三方复核)> 3400 t/s(跑分环境,待生产验证)。排序本身不影响方向判断,但它决定了我们对「量产」两个字应该保留多少敬意。

速度参照系:口径决定数字成色
速度参照系:口径决定数字成色

上图把这件事画成了机械的对照:每根柱子都挂着限定词,柱子越高,脚注越重。

二、量产与可用之间,隔着四道依赖

量产官宣只覆盖产能这一环。从产线到用户可调用,Groq 3 LPX 要走完四道依赖。

第一道是形态依赖。LPX 不是独立产品,它是 Vera Rubin 平台的扩展组件:一个机架 32 个计算托盘,每个托盘 8 颗 LP30 芯片,256 颗芯片通过超高带宽互联协同,与 NVL72 主机架搭配部署。NVL72 负责训练、prefill(推理中理解输入的阶段)和上下文处理,LPX 专攻 decode(逐 token 生成输出的阶段)。公开材料没有说明这是技术上的必须同部署,还是商务上的捆绑采购,两种定性的差别很大,这是目前的信息缺口。

异构分工:一次推理在两种机架间的旅程
异构分工:一次推理在两种机架间的旅程

第二道是供应链。LP30 由三星 4nm 代工,这反而是优点:NVIDIA 的 GPU 挤在台积电的 CoWoS 先进封装产能里,三星产线避开了这场挤兑。富士康独家负责计算托盘。风险在第三环:每个 LPX 机架需要 32 颗 FPGA 做结构扩展逻辑(链路调度、负载均衡、协议转换),这块我们五月就指出过是其架构的软肋,至今没有公开的实际开销数据。第四环在 GPU 那边:Rubin GPU 需要的 HBM4 供应仍然紧张,GPU 缺货,整条异构流水线就瘸腿。

第三道是客户落地。目前具名的首发客户只有一家:Nebius,部署到它的 Token Factory 生产推理平台,2026 年底上线。Nebius CTO Danila Shtan 的表态里藏着一句关键设计:「开发者在用的还是同一套 API,不需要迁移到新的栈。」低延迟作为 API 层的增值档位出售,客户无需改造应用,这是商业模式上最聪明的安排。但供应链报告说 2026 年要交付 6000 台 LPX 机架,具名客户只有一家,部署规模未公开,其余机架的去向(推测是与 NVL72 捆绑的超大规模客户)也没有披露。6000 台和一家具名客户之间的差额,是需求侧最大的未解之谜。

第四道最有意思,是交易结构的回声。NVIDIA 新闻稿的页脚写着:「Groq 和 LPU 商标经 Groq, Inc. 授权使用。」那笔 200 亿交易买下的是专利组合的永久非独占授权和核心团队,Groq 公司本身还在独立运营,而且新闻稿里提到,这家公司计划紧随 Nebius 之后成为 LPX 的早期采用者。被授权方回头购买授权方产品的量产版。这个细节比任何战略宣言都更精确地描述了交易的权力结构。顺带一提,Warren 和 Blumenthal 两位参议员已经就这笔「以授权和雇佣规避并购审查」的结构发出质询信,要求黄仁勋在 2026 年 4 月 3 日前答复。

按这个节奏,2026 年的故事只是开场。真正的分水岭在 2027 年的 LP40:那一代芯片原生支持 NVLink,GPU 和 LPU 的互联从「机架间的配合」升级为「架构级的整合」。买 LPX 的客户,多数是在为那一代投票。

三、对账:五月那篇说对了什么

5 月 20 日我们发布了《CPX 之死与 LPU 之生》,对 Groq 3 LPX 做了第一轮分析。现在到了交卷的时候。对账要有纪律:先说清判定事件是什么,再翻旧文,防止把当时转述的厂商计划记到自己的预测头上。

「真预测,兑现了。」第一条,时间表:当时我们判断 LPX 提前至 Q3 出货(原计划下半年),判定事件取「量产官宣」,8 月 24 日落在 Q3 内,比 Q3 末提前约五周。第二条,定位:当时判断 LPU 只做 decode 的副手,主力位置留给 GPU,这条被 NVIDIA 高级总监 Dion Harris 的原话逐字验证:「这不是要取代 GPU,而是为工作负载的不同部分匹配合适的处理器。」第三条,也是最值钱的一条:分工必然发生。五月时这还是单家公司的路线图,八个月后它成了行业共识。

「转述计划,不记功。」6000 台机架、富士康独家、三星代工,这些都是五月已经从供应链报告转述的厂商计划,8 月 24 日的官宣在这三条上没有新增信息量。把它们算作「预测命中」是自欺。

「观察项,仍未关闭。」FPGA 调度的实际开销、GPU-LPU 异构系统的故障切换逻辑、低延迟 token 的真实定价,三个问题五月提出,今天依然没有公开答案。尤其是定价:Harris 说云服务商可以为延迟敏感客户提供高价套餐,但套餐价格本身还是空白。这个数字不出来,低延迟生意的商业闭环就无法验证。

「没料到的。」竞争者收敛的速度超出了预期:Cerebras、AMD、OpenAI 在半年内全部转向相同模式的分工(下一节展开)。以及 SpaceXAI 宣布首代 Starmind 智能体卫星将基于「优化版」Vera Rubin NVL72,官方口径只到「计划」,原型测试时间表(社媒传 2027 年)未经官方确认,我们按计划口径记录,不做渲染。

这次对账最大的教训:架构判断比时间表判断可靠。时间表会滑(HBM4 验证、液冷工程都让它滑过),但「分工必然发生」这种结构性判断一旦立住,兑现只是时间问题。写预测时,把赌注押在结构上,不要押在日历上。

四、六家收敛:同一个答案的两种赌注

把镜头拉远,这半年低延迟推理领域最重要的事,是所有人给出了同一个答案:放弃单芯片通吃,prefill 和 decode 分开,各用最合适的硬件。

方案 路线 标志数据 状态
NVIDIA Groq 3 LPX LPU 芯片阵列 + 片上 SRAM(三星 4nm) 3400 t/s @31B(跑分环境) 全面量产,Nebius 首发,2026 年底上线
Cerebras CS-4 晶圆级 3×WSE-3T 集中 SRAM 4400 t/s @120B(AA 第三方实测) 2026 Q3 扩供,AWS/AMD 做 prefill 卸载
AMD × Taalas 模型权重硬连线进芯片(mask ROM) 16960 t/s @8B(厂商自测) 8 月 6 日宣布收购,整合 Instinct
OpenAI Ultrafast 采购 Cerebras 算力转售 750 t/s @GPT-5.6 Sol 8 月 13 日起限量预览,首批客户含 Jane Street、Rogo
华为昇腾 950DT HBM 高带宽路线(HiZQ 2.0,4TB/s) 待实测 8 月华为云上线
元川微 LPU+ 国内 LPU 直接对标 2027 上半年投片

三条片上存储路线的本质差异在灵活性、容量和速度的取舍上。Groq 用 256 颗小芯片组成分布式 SRAM 池,换灵活性;Cerebras 用餐盘大小的晶圆把 SRAM 集中在一颗芯片里,换容量和极低的片内延迟;Taalas 最激进,直接把训练好的模型权重硬连线进掩模 ROM,一个晶体管存一个 4 位权重并完成乘法,单芯片 200 瓦跑出近 1.7 万 token/秒,代价是芯片只为一个模型服务,模型一更新就要重新流片。AMD 收它的逻辑很清楚:Instinct GPU 做 prefill,Taalas 做 decode,拼出与 NVIDIA 相同的分工。

但分工收敛了,介质没有。华为昇腾 950DT 用自研 HBM(HiZQ 2.0,4TB/s 带宽)做 decode,不追 SRAM 的极致速度,换生态兼容和现有软件栈的延续。这是一条认真的替代路线:SRAM 路线赌「decode 对延迟的敏感值得一切」,HBM 路线赌「decode 对容量的需求终会压倒对延迟的敏感」。上下文越长、模型越大,后者越有说服力。哪个赌注正确,2027 年见分晓。

六家收敛格局:分工收敛,介质分两路
六家收敛格局:分工收敛,介质分两路

OpenAI 的位置和别家不同。它不造芯片,用采购权加入分工格局:既是 Cerebras 的最大客户(4 月签的多年期采购协议),又向它提供了约 10 亿美元的数据中心开发资金。客户即金主,股权还带着期货属性:Cerebras 的 S-1 披露,OpenAI 持有约 3345 万股近零行权价认股权证(全部行权成本约 334 美元),随采购规模分批归属,完全兑现对应至多约 10% 的股份,另有一笔 6% 利率的 10 亿美元贷款。行权近乎白送,前提是把采购做完。还有一个日历上的巧合:采购主协议和认股权证都签于 2025-12-24,与 NVIDIA-Groq 交易同一天,低延迟推理的两条生态路线在同一个圣诞前夜定了形。Ultrafast 档位 8 月 13 日起在 OpenAI API 限量预览,Jane Street 这样的高频交易客户说明了低延迟的真实买家画像:在金融场景,快慢直接就是钱。

需求侧最硬的公开证据来自六家中唯一以低延迟推理为主业的上市公司。Cerebras 五月上市,8 月 12 日的 Q2 财报显示:总营收 1.8 亿美元(同比 +74%,略低于预期),在手订单储备(RPO,剩余履约义务)254 亿美元,其中大头是 OpenAI 一家的多年期合同,而且公司在电话会里明说,这个数字还没有计入 AWS 等超大规模客户的潜在订单。订单是比宣传更硬的先行指标,订单的集中度也是风险本身。市场的焦虑集中在回报端。

最后是 NVIDIA 的护城河。单看公开跑分数字,LPX 并没有拿下绝对的速度纪录(3400 与 4400 口径不同,仅作参照)。LPX 的分量在别处:它是 Vera Rubin 平台协同设计的一部分(NVIDIA 官方口径:七颗芯片、五种专用机架),客户买到的是 AI 工厂里的一个车间。Cerebras 们在卖更快的引擎,NVIDIA 在卖整辆车。这个差别决定了竞争的层次。

五、2027 是验证年

把已知的落点排成时间线:2026 年底,Nebius Token Factory 上线,第一个生产环境的数据点;2026 年 Q3,Cerebras CS-4 扩大供货;2027 年上半年,LP40 发布,NVLink 原生整合;更远处,2028 年的 Feynman 架构计划把 LPU 单元 3D 堆叠进 GPU 主芯片,那是我们五月就指出的终局。

三个观察点值得写进日历。第一,Nebius 上线后的第三方实测和低延迟 token 的实际定价,它们一起决定这门生意是工程奇迹还是商业闭环。第二,Cerebras CS-4 扩供后的客户名单,254 亿美元订单储备的兑现节奏。第三,LP40 的规格官宣,看 NVLink 整合到什么深度。

至于那条阴线:七连跌反映的是 AI 资本开支的宏观情绪,摩根大通警示的表外信用风险和 2027 年起 15% 的服务器涨价都指向同一个问题,投入巨大,回报未证。低延迟推理恰好是回报端的第一个测试:如果延迟敏感的客户愿意为快速 token 付溢价,AI 基建就有了一层新的收入质量;如果不愿意,再快的芯片也只是更贵的库存。

八个月前,低延迟推理是 NVIDIA 一家的赌注。现在它是六家公司的路线图、一个 254 亿美元的订单储备和一条还没走完的落地曲线。赌注变成共识用了八个月,共识变成生意,需要的时间会更长。

延伸阅读:CPX 之死与 LPU 之生:AI 推理架构的范式转移(本系列前作)· NVIDIA Rubin 重新流片与 AMD MI450 · 下一篇《内存墙四路进攻》将回到这一切的病根:带宽、容量、成本不可能同时在一种存储介质上最优。