1. 新技术宣称
过去十年,"数据中心网络"指的是跨服务器的 scale-out 网络——Clos 拓扑、BGP/ECMP、RDMA、拥塞控制,SIGCOMM 的主战场。2026 年,一个新的网络域正在同一批研究者手里成型:scale-up 域,GPU 到 GPU 的机架内互联,以及它向下延伸的 chiplet 网络和晶上网络。
证据是结构性的。本届 SIGCOMM 给了 Scale-Up Fabrics 一个专门的 session(RS8,四篇),而相关论文散布在 RS1(TurboBus)、RS15(Scale-up PIFO)、RS17(Harvest、Credit-Guided wafer-scale)、RS9(光子 fabric,其中 Opus 归篇4 光子线),合计九篇,本篇以其中八篇为主体,横跨测量、拓扑、数据面、调度、传输层五个层面。
把这个 session 分布与 scale-out 网络的研究史对齐,会看到一个几乎逐层复刻的模式:
| 研究阶段 | Scale-out(2015-2020) | Scale-up(2026 SIGCOMM) |
|---|---|---|
| 测量 | Pingmesh/Hostspot/测量系列 | FabricPerf(NVLink fabric)、PingPoint(chiplet 网络) |
| 拓扑 | F10/BCube/Jupiter/各种 Clos 变体 | Balanced Sparse Tree(华为)、Opus(光子) |
| 数据面 | SNP/SilkRoad/可编程转发 | Elastic QP(机架级细粒度数据面) |
| 调度/传输 | PIAS/PIFO/拥塞控制系列 | Scale-up PIFO、Credit-Guided(晶上)、Harvest(光调度) |
| 资源共享 | 多租户带宽管理 | TurboBus(PCIe 池化) |
测量先行、工具未定型——这是"2016 年的 scale-out"状态。差别在于节奏:scale-up 的这一轮压缩在更短的时间里完成,因为需求端(NVL72/576、CloudMatrix384、GB200 NVL576 的量产)比当年云计算的扩张更急。

为什么 scale-up 突然值得一个研究议程? 三个推动力:其一,PD 分离与 MoE(混合专家模型)训练把机架内流量推上新的量级,机架内互联从"系统总线"变成"真正的网络":有拓扑选择、有拥塞、有调度问题;其二,超节点的物理时延非均匀(UBEP 的"同步税"与拓扑盲调度问题),逻辑统一地址空间掩盖的物理异构性需要被显式管理;其三,PCIe/NVLink/UB 资源在多任务间的共享(TurboBus 显示 60%+ 的 PCIe 带宽闲置)——资源池化在机架内重新发明。
2. 逐篇深读:八篇论文
2.1 FabricPerf:没有网卡的网络怎么测
NVLink fabric 给测量出了一个悖论:它是一个真实的多跳网络,有拓扑、有拥塞、有微妙的路径行为,但里面没有一块网卡。传统网络测量的整套方法论——插探针、抓包、读网卡计数器——在这里全部失效。你想诊断一个 AllGather 为什么慢,手里连 ping 都没有。
FabricPerf(港大)的方法论转换是这篇论文真正的贡献:把网络遥测变成 GPU kernel profiling 问题。通信 kernel(SEND/RECV)在 GPU 上的执行足迹——启动延迟、吞吐波动、通道间的不平衡——本身就携带了 fabric 的行为信息;扩展 GPU instrumentation 工具,就能从软件侧反推网络状态。诊断的对象换了层,问题没变。
顺着这条思路的工程产出很实:用 work-stealing 机制重平衡通信通道,通道利用 +46%,AllGather 吞吐 +17.5GB/s;调 LLC 读命中率,带宽再 +16GB/s。对运维来说,这是今天就能用的调优手册——不需要交换机开放任何接口。
有效性边界也来自方法论本身:kernel 足迹是间接证据,fabric 内部的排队细节(哪一跳、哪个端口)反推不出来。权宜之计的价值是现在就能用,代价是分辨率有限——这正是"测量先行"阶段的典型状态。
2.2 PingPoint:再往下钻一层,chiplet 之间的网络
PingPoint(UW-Madison)把同一个问题再往下推一层:Accelerator Chiplet Network(ACN),compute chiplet、IO chiplet、内存 stack 之间的网络。chiplet 已成为加速器的主流形态,ACN 的行为越来越主导应用性能;但它比 NVLink fabric 更难测——连主机侧都没有,GPU 那套 kernel profiling 也够不着。
PingPoint 用探针注入加与计算共存的低开销分析做出首个工作(摘要口径,全文细节见其论文)。这篇的价值在占位:第一个把"chiplet 网络可观测性"立为问题的论文,后来的标准化讨论都要从它出发。
2.3 Balanced Sparse Tree:万卡时代的拓扑经济学
scale-up 域的第一篇拓扑设计论文来自华为九位作者 + 上交(对应 scale-out 的 Clos 变体时代)。它的问题很直接:字节跳动已建 12288 GPU 集群训 175B 模型(BST 论文引述的公开部署信息,引文),万卡规模下,拓扑成本本身成了第一变量。三层 Clos 的全互联在高基数交换芯片上要付出功耗和成本的双重代价,而 NVL72 级的机架互联向上扩展时,同样的钱怎么花值得重新算。
BST 的答案是稀疏树:保留 Clos 的分层结构但砍掉冗余链路,配合 Ranktable 编排把通信约束在组内、消掉组间拥塞。账算下来:同等规模成本减半(对比 3 层 Clos),对比 Zettafly 再扩 1.7×。
有效性成立,但它是华为生态内的设计:BST 的编排假设与 UB/超节点形态绑定,跨生态直接搬不动。它的意义在于把"拓扑成本"重新变成研究问题——scale-out 时代 2015 年前后也发生过同样的事。
2.4 Elastic QP:机架级数据面的软件路线
数据面层的问题:scale-up fabric 上的 queue pair 是粗粒度静态分配的,小消息场景的速率上不去,带宽利用率差。Elastic QP(UW + UW-Madison)把 QP 弹性化,做成机架级细粒度数据面;小消息速率最高 11.03× 于 RDMA 基线(论文摘要口径),测试床是 BlueField-3 DPA + ConnectX-8(2×400G)。
这篇延续了这个组在高效 RDMA 上的长期积累。值得记的位置关系:它与华为 BST 构成同一问题的两条路线——软件栈路线(改数据面、吃商用硬件)对硬件拓扑路线(改结构、要新基建)。哪条先规模化,取决于 NVLink 类 fabric 开放数据面接口的速度。
2.5 Scale-up PIFO:把可编程调度抽象搬进机架
P4 时代给交换机世界留下了 PIFO 抽象(可编程调度的理论模型);复旦的 Scale-up PIFO 把它搬进 scale-up 互连。问题:机架内互连的调度现在是固定的硬件逻辑,想改调度算法就要改芯片;PIFO 在交换机里解决的问题——让调度算法可编程——在机架内同样存在。
做法:并行多 PIFO 队列交错部署,代价是峰值调度误差。结果:误差降至 1/64(对照简单并行 PIFO 的 Errmax≈K/R=1562),硬件复杂度降 51%。P4 时代的编程抽象在机架内复刻,这本身就是"研究问题互相输出"的证据(见 §3 观察三)。
2.6 Credit-Guided:晶上网络的第一篇传输层论文
中科院计算所的这篇占了一个更远的位置:晶上网络(wafer-scale on-chip network)的第一篇传输层论文。晶上架构(Cerebras 类)把整个加速器做在一片晶圆上,片上网络第一次大到需要传输层语义——拥塞控制、尾延迟管理,这些主机网络的概念进了硅片。
它的动机量化值得记:分子动力学负载对尾延迟极其敏感,每跳尾延迟相对膨胀 10%,吞吐就掉到基线的 22-40%。这个敏感性数字把"片上也要传输层"从直觉变成了测量事实。解法是 credit 机制的片上版本——数据中心拥塞控制的经典工具,又一次跨域移植。
离生产最远的一篇,但作为首篇占位,五年维度的期权价值已经显现。
2.7 TurboBus:PCIe 池化,scale-up fabric 的第一个高价值应用
HKUST 的这篇讲了一个反直觉的故事。GPU 内存 offloading(KV cache 外卸、弹性训练)把瓶颈推到 GPU-CPU 传输:最高占端到端时间的 90%。直觉反应是"PCIe 带宽不够用"。但 TurboBus 的测量显示:全集群 60% 以上的 PCIe 带宽同时闲置。单链路瓶颈、整体欠载——每块 GPU 各自的 PCIe 独立工作,突发负载把各自的链路打满,别人的链路闲着。
错配的结构性解法是池化:TurboBus 让 GPU 经 scale-up fabric 借邻居 GPU 的 PCIe 链路中继数据。FlexGen 类负载(offload 率 f≈90%)借 4 条链路最高 3.0× 加速;按需模型加载的首 token 延迟最高 -40%(距解析最优 5% 以内);KV-cache-offload 推理吞吐最高 1.6×,训练迭代最高 +7%,对共址负载开销 <1%。
scale-up fabric 的第一个高价值应用不是集合通信,而是 PCIe 池化,这是机架内资源共享的新抽象。可落地性是八篇里最直接的:任何有 NVLink 机架的玩家都能复刻,特权 daemon 保证隔离。

2.8 Harvest:光子交叉
Purdue + MSR 的光子交换调度(详见篇4),此处作为 scale-up 域的物理层演进注脚:光电路交换进机架域后,拓扑本身成为可重配置资源,调度问题随之而来。
3. 路线分析
八篇论文构成的不是并列热点,而是一个网络研究域从零成型的标准路径:
观察一:测量缺口是这个领域最大的缺口。 scale-out 时代有 ping/traceroute/tcpdump/perfSONA 完整工具链;scale-up 域今天只有 FabricPerf/PingPoint 两篇论文。FabricPerf 的"kernel profiling 反推网络"是权宜之计。真正需要的是 fabric 原生遥测(NVLink/UB 的链路级计数器开放、chiplet NoC 的探针标准)。工具链成型之日,才是这个领域从"测量先行"进入"系统优化"阶段之时。
观察二:华为在 scale-up 域完成三点布局。 BST(拓扑)+ UBEP(通信库,篇2)+ UB 生态本身,从物理互联到拓扑到通信库的完整纵深。对照 NVIDIA:NVLink/NVSwitch 是事实标准但没有论文(Meta 的 100K+ GPU 论文替它做了部署侧背书)。华为路线是"把生态每一层都做成可发表的学术输出"。这既是学术话语权策略,也反映了国产栈必须自建每一层的现实。
观察三:scale-up 与 scale-out 的研究问题开始互相输出。 PIFO 抽象从交换机进 scale-up(Scale-up PIFO);credit 拥塞控制从数据中心进晶上(Credit-Guided);PCIe 池化从网络带宽管理复制到总线域(TurboBus)。反向输出也在发生:OptCCL 的拓扑建模已经把"host 内互联"作为一等约束。当两个域共享抽象层,融合(而不仅仅是并存)就开始了。
观察四:向下延伸的三个尺度同时被打开。 机架(NVL72 级 fabric)→ chiplet(ACN)→ 晶上(wafer-scale)。PingPoint 与 Credit-Guided 分别占领了后两个尺度的首篇位置。"首篇"的价值在学术议程设置,后来者必须引用它们。
4. 证据核对
| 主张 | 数字 | 出处 |
|---|---|---|
| offloading 转移占端到端 90%;PCIe 闲置 60%+ | GPU offload 负载实测 | TurboBus 摘要+§2 |
| TurboBus FlexGen 3.0×(借 4 链路);首 token -40%(距最优 5% 内);推理 1.6×/训练 +7%/共址 <1% | offload 率 f≈90% 场景 | TurboBus 摘要+§5 |
| BST 成本 -50% vs 3 层 Clos;1.7× vs Zettafly | 拓扑成本模型 | BST 摘要+§5 |
| FabricPerf 通道重平衡 +46%(吞吐 +17.5GB/s);LLC 调优 +16GB/s | AllGather | FabricPerf 摘要 |
| Elastic QP 小消息速率最高 11.03× vs RDMA 基线 | 摘要口径 | Elastic QP 摘要 |
| Scale-up PIFO 峰值误差降至 1/64、复杂度 -51% | vs 简单并行 PIFO(Errmax≈K/R=1562) | Scale-up PIFO 摘要 |
| Harvest vs BvN: RD 7.3×/Swing 10×/pA2A 5.3× | 光重配置调度 | Harvest §6 |
| wafer-scale 每跳尾延迟相对膨胀 +10% → 吞吐掉至基线 22-40% | MD 负载扰动实验 | Credit-Guided §2 敏感性 |
| 字节 12288 GPU 集群训 175B 模型 | BST 引言引用 | BST §1 引文 |
口径说明:PingPoint 的"8×" overhead 改善数字在已读部分未能锚定完整上下文,正文未使用;Elastic QP 的"1024×"缩放声称同样待锚定后再进正文——两处留待终稿前补核。
5. 技术评估与预测
一、scale-up 域会在 2-3 年内长出自己的"明星抽象"。 scale-out 时代给了世界 SDN/P4/eBPF;scale-up 的候选是:fabric 原生遥测接口、跨 PCIe/NVLink/UB 的统一编程层、机架内资源池化的隔离原语(TurboBus 的特权 daemon 是雏形)。哪一个胜出现在判断为时尚早,但日程表大致可推:2027 年测量与遥测、2028 年编程抽象。
二、PCIe 池化是 scale-up fabric 的近期商业落点。 TurboBus 的价值不在学术深度而在工程可译性:NVL72 机架里的 PCIe 带宽管理软件,可以是交换芯片厂、服务器厂、云厂任何一方的产品线。60% 闲置带宽的回收对 offloading 类负载(KV cache 外卸、弹性训练)是直接的成本下降。
三、chiplet 网络的标准之争是下一场。 PingPoint 打开 ACN 测量之后,UCIe 生态(chiplet 互连标准)之上的网络层标准化会被提上日程。谁定义 chiplet 间的遥测与 QoS 接口,谁就锁定了下一代的 chiplet 供应链话语权。中科院计算所同时出现在 wafer-scale(Credit-Guided)一线不是偶然。
四、可落地性:华为生态内立即可用(BST+UBEP 是成套的);以太网生态等 EPIC/盛科的芯片落地;PCIe 池化(TurboBus 思路)任何有 NVLink 机架的玩家都可复刻。 晶上网络离生产最远,但作为 Cerebras 类架构的配套研究,五年维度的期权价值已经显现。
五、对 locsic 前文的对账。 我们在超节点系列(waic/灵衢/kadc)中的判断"互联协议只是地基,通信库与拓扑是用户可感知层"被 BST+UBEP 的组合直接验证;"scale-up 正在复刻 scale-out 研究史"在 6 月的 nvidia-supernode-evolution 中已提出,本届论文分布给出了学术侧的完整佐证:研究史的复刻比产业史的复刻更整齐。
声明: 本文基于八篇论文(FabricPerf/PingPoint/BST/Elastic QP/TurboBus/Harvest/Scale-up PIFO/Credit-Guided,全文或摘要,正文逐处标注)+ 篇2 UBEP 交叉引用。BST 的 12288 GPU 为论文引述的公开部署信息(一手出处未核);PingPoint 的 8× 数字未能锚定完整上下文,正文未使用。文中数据截至 2026 年 8 月 22 日。
本篇为 SIGCOMM 2026 深读系列篇3。前篇:总览、KV Cache 网络公民、Collectives 运行时。下篇预告:《光网络的 P4 时刻还没到,但语言先来了》(篇4,λλ 与光子软件栈)。
