2026-08-25 · 报告拆解 · 续篇:Groq 3 LPX 量产分析(AgentX 正是那篇里 30×/35× 数字的负载来源)
300 万美元买来的数据,白送了。
8 月 24 日,Hot Chips 会期,SemiAnalysis 发布 InferenceX v3 与 AgentX 1.0 基准,顺手把语料库(8300 个会话、340 万次请求、6100 亿 token,全部来自真实工作)中抽出的 393 条匿名轨迹开源。1000 多颗芯片的成绩单、70 多个提交到上游的优化 PR,也都摆在了明处。唯独报告标题那个问题:《Agentic 推理时代,CUDA 护城河还守得住吗?》付费墙切在结论之前,免费正文里没有答案。报告原话:「社区有机会就当前真实推理性能得出自己的结论。」
数据是他们的,判断可以是我们的。本文前四节把 AgentX 1.0 当作工程对象逐层拆开:数据集怎么造、回放怎么防作弊、度量怎么定义、实测揭出什么;后三节给出格局、我们对护城河问题的回答,以及这套基准正在改写的权力结构。

一、数据集拆解:393 条轨迹的来历
一份基准的可信度上限,在数据采集的那一刻就定下了。AgentX 的答案是:只收真实工作。
采集层。 SemiAnalysis 团队自己重度使用编程代理,他们写了一个 HTTP 代理拦截自家 Claude Code 与 Codex 的流量:参与者把 base URL 一改,代理就记录请求与响应的时序、token 计数、会话 ID 和子代理 ID。语料库截至写稿时有 8300 个会话、340 万次请求、6100 亿 token,按 API 计价折合超过 300 万美元。这个采集方式决定了数据的纯度:全部来自真实工作,没有一条为基准而生。
清洗与入选。 开源子集的入选门槛写在 InferenceX 方法论页:会话至少 20 个请求、Claude Code 版本不低于 2.1.139、并发子代理不超过 10 个。清洗动作包括:剔除 Claude Code 的安全监控请求(auto 模式下的自动调用)和标题生成请求、去重(连接断开时代理可能收到重复请求)、丢弃重建后超过 99 万 token 的输入(贴着 1M 上限裁边)。393 条会话是三层过滤器后的产物。
分布形状。 清洗后的数据集:输入长度中位数 142k token,输出中位数 444 token,轮间时延(主要是工具执行时间)中位数 3.84 秒,只有约 10% 的轮间隔超过 1 分钟,那部分大概率是代理在等真人回复。三个分布都接近对数正态,393 条会话里 44% 含子代理。这个形状信息量很大:读得多写得少(输入是输出的 320 倍),工具调用节奏是秒级,毫秒级都不到,这意味着基准回放时的「等待窗口」本身就是负载的一部分,服务器的调度器必须在等待期保住会话的缓存。
一个诚实的警告。 报告特别注明:分布会随 harness 和模型变化:Pi 以注入上下文极少著称,Claude Code 恰好相反;不同模型的 tokenizer 产出 token 数也不同。换句话说,这份数据集刻画的是「Claude Code 一族的负载画像」,直接外推到所有 agentic 场景要打折。报告没有回避这一点。
匿名化的代价与修补。 轨迹匿名化把内容载荷替换为 64-token 哈希块,回放前必须合成重填:AIPerf 从一个合成编码/工具调用 token 池中确定性采样填入。请求长度、KV 复用模式、时间节奏全部保真,内容是假的。这带来一个技术上的连锁反应:投机解码的草稿模型没见过合成数据,接受率会失真。SemiAnalysis 的解法在下一节。
二、回放引擎拆解:闭环、反作弊标记与投机解码公平性
闭环回放。 AgentX 用 AIPerf(AIPerf 上游在 NVIDIA 的 ai-dynamo 仓库,SemiAnalysis 另持一个 fork,自述理由是「更厂商中立」)做闭环回放:并发的代理客户端各自推进会话,快的配置完成更多请求、遇到略不同的负载混合。每条数据点带完整日志、精度校验和 GitHub Actions 的 CI 出处。开环回放给定固定请求流,闭环回放让服务系统的调度决策影响后续负载:这是真实生产与压测的本质区别。
cache-bust 标记。 这是整个回放设计里最精巧的一笔。会话在回放中跑完后,回放道(replay lane)从采样器里取下一个会话接着跑。如果不同回放恰好复用同一批会话,缓存命中率会被人为抬高。解法:每次回放生成一个唯一的确定性标记,加在每条独立前缀链的头部:主代理链、全新上下文的子代理链、一次性链都加,分叉的子代理从父链继承标记。同一回放内标记不变(保住 KV 复用模式),跨回放必变(防止假命中)。这个设计同时解决了并发数超过 393 条会话的问题:同一个会话可以多道并行回放,标记保证它们互不送缓存。
投机解码的公平性。 前节留下的连锁反应在这里收口:合成数据会让投机解码的接受长度失真。SemiAnalysis 与社区合作,让多数开源推理引擎暴露了「强制接受长度」接口;然后对每个模型,用 NVIDIA 的 SPEED-Bench(专门的投机解码评测集)在真实数据上实测接受长度分布,回放时按该分布强制施加。投机解码强的引擎不再能靠合成数据的偶然性占便宜,投机解码弱的引擎也不会被冤枉。这一层公平性工程在公开基准里相当罕见。
配置纪律。 基准配置跟踪 recipes.vllm.ai 和 SGLang cookbook 的上游镜像:测客户真实在用的栈,绕开为跑分特调的镜像。厂商中立的姿态贯穿到工程细节。
三、度量体系:三轴、TCO 归一与一个诚实的实验指标
AgentX 的成绩挂在三个轴上:单用户交互性(每秒输出 token,即 TPOT 的倒数)、p90 首 token 延迟(TTFT)、系统吞吐。三者互相牵制,官方呈现是吞吐×交互性的 Pareto 曲线,TTFT 作为第三维度校验(高吞吐但 TTFT 爆炸的点会被点名)。跨硬件比较用 TCO 归一的性价比和每兆瓦吞吐两个口径,电力约束在 2026 年的算力经济学里已经和钱平起平坐。
报告还引入了一个实验性指标:端到端归一交互性,定义为 OSL/E2EL(输出长度除以端到端时延)。代入 E2EL = TTFT + OSL×TPOT 后,这个指标在数学上等于交互性本身再加一项正比于 TTFT 的惩罚:它试图把「快出第一个字」和「快出完所有字」压进一个数。报告自己对它的态度值得全文引用级别的诚实:「该指标是实验性的且并不完美,它重度惩罚高 TTFT,也无法捕捉 PD 分离等优化的全部细节。」
一个数字藏不住一场多轮会话的全部行为,所以可视化层也重做了:每个 Pareto 点背后是数千个跨会话请求、warmup 周期、缓存状态迁移和动态负载,全部可下钻。这套遥测本身就是 70 多个上游 PR 的孵化器:优化的第一步是让问题可见。
四、系统真相五课:KV 生命周期工程学
把 393 条真实轨迹灌进 1000 多颗芯片,测出的第一层结论与芯片无关,与状态管理有关。以下五课每一课都有硬数字。

同样的负载、同样的引擎、同样的解码路径,B300 的缓存命中 91%,B200 只有 73%。两代芯片跑出两副面孔,原因不在算力:B300 在 384 并发下的 KV 工作集约 4300 万 token,装得下所以命中(另有 1.36% 落在 DRAM);B200 的工作集约 2200 万 token,装不下的近 20% 只能走 DRAM 卸载,延迟曲线随之变形。DRAM 卸载还是穿透式写入(每个写进 HBM 的前缀同时写进 DRAM),只有 DRAM 容量达到 HBM KV 的 1.5 到 3 倍时才有正收益。这是第一课:缓存命中是第一生产力,容量决定命中的形状,「配多少内存」从此是一道缓存经济学题。
命中有了,下一个问题是请求往哪送。数据并行注意力下每个 rank 持有一份私有缓存,把一个 30 万 token 的会话派到不持有它前缀的 rank,代价是什么?全量重算。实测的 DP 注意力配置缓存命中只有 28.8%,理论值 96%,缺口就是路由税。缓存感知路由(会话粘滞、一致性哈希)从可选优化变成必选工程,vLLM router、llm-d、SGLang model gateway、ATOMesh 四家路由器全部为此打了补丁。这是第二课:路由必须知道状态住在哪。
路由能保住 KV,但新一代模型引入的另一种状态,路由保不住。Qwen3.5 的 GDN(MIT/NVIDIA 研究的门控 DeltaNet,状态占用恒定)、MiniMax 的稀疏注意力、Kimi 的卷积+SSM 层,都在 KV Cache 之外引入 recurrent 状态。两种状态的物理性质相反:滑动窗口尾部可以由邻近 token 重算回来,recurrent 状态丢了只能从头重放整段序列。两个引擎为此重造卸载层:SGLang 的 HiCache 用非对称策略(只卸载贵的全注意力缓存,窗口尾部回程时重算,重建比传输快);Kimi K3 的分离部署要把 conv+ssm 状态随 KV 一起经 MoRI-IO 传输,否则解码侧拿到的是未初始化的状态。这是第三课:混合架构引入不可重建的状态。
状态都安顿好了,每一轮的固定成本开始显形。每轮重发全部历史,朴素实现反复对同一 10 万 token 做分词。「只分词新增后缀」这个看似显然的优化是错的:BPE 合并可以跨边界发生,切点处少回滚一个完整 token 就会分叉。TensorRT-LLM 的边界感知方案在 Qwen3.5 轨迹上 1087 次转换全部与全文分词一致,均值 185.1ms 降到 11.3ms。同类税还有:每轮重发请求的载荷序列化(Dynamo 换 MessagePack 后吞吐 +8.1%、TTFT -9.7%,流式响应每 token 一帧的开销则由后继的零拷贝系列承担)、调度器里每步一次的设备到主机长度同步(删掉后消除一个解码气泡)。这是第四课:多轮负载藏着一次性负载测不出的税。
单点的成本都清完了,最后剩调度器做裁判,而裁判有一只看不见的手。DP 注意力下每个 rank 本地调度注意力、全局参加 MoE 集合通信,被喂了连续 prefill 的 rank 会一直赢「prefill 优先」决策,别的 rank 的解码批次干等。SGLang 加了可配置的解码间隔:每轮 prefill 后强制插入解码轮,DeepSeek V4 Pro 上输出吞吐 +141%,p99 轮间延迟 -97.3%。代价写在数字里:中位 TTFT 从 36.5 秒升到 59 秒。这是第五课:调度从此没有免费午餐,只有显式取舍。
五课走完这条因果链,指向同一个判断:agentic 推理的瓶颈已经从 kernel 层上移到状态管理层。70 多个上游 PR 里最大的一批,改的全是缓存生存、传输粒度、路由归属这类问题:原报告后半部分实际是一部「KV 生命周期工程学」的现场教材。
五、成绩单:三层结构

五个前沿开源模型全部来自中国厂商:DeepSeek V4 Pro、Kimi K3、GLM 5.3、MiniMax M3、Qwen3.5。
NVIDIA 统治区:GLM 5.3 上(SGLang 栈、150 tok/s/user 档)成本效率最高领先 5 倍,报告原话是「即便竞品芯片白送(托管、电力等运营成本照付),每 token 成本仍然 NVIDIA 更低」;Qwen3.5 上(90 tok/s/user 档)领先 20 倍以上、AMD 零提交,B300 FP4 对 H100 性价比 12 倍;MiniMax M3 的原话是「绝对性地摧毁所有竞争者」,王座由 B300 上的 TensorRT-LLM TP2 持有。
AMD 亮点区:Kimi K3 上 MI355X 的 ATOM 引擎在 40-60 秒端到端区间性价比胜 GB300 NVL72 的 vLLM;GLM 5.3 上 ATOM 部分区间胜 GB300 NVL72 的 SGLang 甚至 TensorRT-LLM;MiniMax M3 的 FP4 分离部署发布当天可用(R1 时代 AMD 追平用了数月)。边界同样明确:端到端延迟上 ATOM 胜 B200 的 vLLM,胜不过 B300 或 B200 的 SGLang。同一份报告里「白送也赢不回」与「部分区间反超」并存,分界线在引擎与档位。
系统级发现:MiniMax M3 上单机 B200/B300 的 TCO 归一吞吐反超机架级 GB200/GB300,Dynamo 路由开销随活跃前缀数量与长度增长,机架叙事需要重新论证;H200 老将在低并发仍有性价比;上下文并行零提交(尽管 MiniMax 轨迹 p90 输入 317k);AMD 少用 CPU 卸载的根因具体到荒诞:hipMemcpyBatchAsync 直到 ROCm 7.14 才存在。另有题外一条:ATOM 赢了基准区间却进不了生产,多数一线实验室因功能缺失不用它,阿里唯一的例外是一个广告业务单元,通义主力团队也不用。
六、我们的回答:护城河的四层真身

报告免费部分没有回答自己的标题问题。以下框架是我们的综合,材料来自报告。
报告明说的部分:上下文并行技术部分出自 Nvidia Research,AMD 实现未优化,vLLM 支持矩阵 AMD 后端全线 unsupported,原文直接说这「构成 CUDA 护城河的一部分」;开源栈上 AMD 长上下文多轮路径差距巨大;ATOM 改善显著但生产采用受阻。
我们在此基础上把护城河拆成四层。第一层是 CUDA 语法与语言生态:语法与工具链对两家都可用,历史上最著名的护城河叙事在这层已经变薄。第二层是并行策略的发明权:长上下文必需的 PCP/DCP 词汇表出自 Nvidia Research(GDN、LatentMoE 是同层的衍生优势),发明者先研究透新负载、工程再跟进,护城河长在论文与 PR 之间。第三层是引擎工程速度:边界感知分词、流水线 KV 传输、缓存感知路由在几个月内密集落地;NVIDIA 侧成果直进 TRT-LLM/Dynamo(生产栈),AMD 侧集中在 ATOM(基准栈):两边都在快跑,一边的成果进了生产。第四层最宽:上游开源生态本身。「白送论」成立的场景全部落在开源栈上,70 多个 PR 的分工图就是护城河地形图;这句话的另一面是开源协作也能把它填平,AMD 的追赶路径报告已经画好:把 ATOM 优化移植回 vLLM/SGLang 上游。
所以我们的答案:护城河是真的,但支撑它的主力已经换防,从 CUDA 语法换成「把新负载变成软件优先级的速度」。语法锁定自 CUDA 诞生起就存在,AgentX 测出的差距是最近几个月长出来的。护城河从静态资产变成动态行为,对追赶者是好消息(行为可以学习),也是坏消息(领先者的行为速度同样写在数据里)。
七、谁定义负载,谁定义市场(附证伪条款)
「结论留给社区」这个姿势本身就是 AgentX 与厂商基准的权力差异:数据全公开,结论不垄断。权力的另一面已经发生:一线实验室容量团队消费它的 API,芯片双雄的工程师以它为 north star 提交优化,其中四家模型厂的名字挂在支持名单上。哪些模型入选、哪些负载被回放、哪些指标上墙,每个选择都在影响数千亿美元资本开支的流向。对我们上一篇的悬念,这里有了制度化的下文:NVIDIA 30×/35× 的独立复核有了日程表:报告明说 Rubin 8 月内上 InferenceX。低延迟侧翼也在被收编,站内已有 TileRT 对比 Cerebras、Groq LPU、SambaNova 的专文。
这篇的判断站在以下反例面前:若 Rubin 独立实测明显低于 NVIDIA 自测口径,「自测是进步、待复核是诚实」要改写为「系统性口径美化」;若数周后的更新文章里 AMD 把 ATOM 优化移植进 SGLang/vLLM 上游,「白送论」开始失效计时;若 MI455X UALoE72 或 TPU 入场即反超,护城河公式要加上互联拓扑一项;若任何提交开始跑上下文并行,发明权层开始瓦解。把判断交给可证伪的日程,是这份报告教给行业的姿势。
延伸阅读:从独赌到共识:Groq 3 LPX 量产与低延迟推理的八个月(本系列前篇,30×/35× 的口径出处)· SubQ 三个月对账(第三方审计方法论的同型练习)
