1. 新技术宣称
如果你在 2024 年问"集合通信(collectives)的研究还有多少空间",多数人的答案是:NCCL 已经成熟,Ring/Tree 算法已被研究到接近理论上界,剩下的是工程调优。SIGCOMM 2026 用整整三个 session(RS3 Collective Communication Algorithms 五篇、RS5 In-Network Aggregation for ML 五篇、RS11 Scheduling for ML Training Clusters 五篇)加上 ES1 的一篇,共 16 个位置回答了这个问题(其中 Turbo 已在篇1 深读,本篇覆盖其余 15 篇;ES1 四篇中仅 Balancing 计入,另三篇按主问题归 AI 数据中心网络线)。空间不仅存在,而且正在打开一个新纪元:集合通信库正在从"带一组预定义算法的库"演进为"有遥测、有决策、有热切换的运行时系统"。
这个转向的驱动力不是学术界自己发明的,而是三个生产现实:
一、MoE(混合专家模型)让通信模式爆炸。 稠密模型的 DP 数据并行训练只需要 AllReduce(梯度求和),模式规整可预测。MoE 的 expert parallelism(EP)引入 All-to-All:token 按门控函数动态路由到不同 GPU 上的 expert,通信量、目的地、偏斜度都随训练动态变化。Theseus 的动机测量显示:MoE 训练中 expert 负载偏斜随时间漂移,为均衡负载优化的 schedule 会在数小时后变次优。UBEP 直接把 CANN EP 库的 BSP(全局同步)执行模型列为改造对象。AlibabaCloud 的 Balancing and Beyond 用生产经验(Qwen3-Coder、DeepSeek-R1)佐证:EP 通信的 straggler 问题必须在通信层解,不能全推给负载均衡。
二、超节点与双平面网络让拓扑异构化。 NVL72/576、华为 CloudMatrix384 这类超节点把数百 die 用极高带宽互联成一个逻辑域,但其内部是多层级联(NVLink/UB 的 base/opt 两层),物理时延非均匀。UBEP 的三个动机瓶颈——BSP 串行化、同步税、拓扑盲调度——全部源于"逻辑统一地址空间 ≠ 物理同构"。而超节点之外还有 DCN(scale-out)平面,collectives 现在要在两个平面间分配工作(NCCL 已有跨 NVLink/IB 的多通道机制作为雏形)。
三、多租户让公平性成为一等公民。 LEVELLER 的观察:十种 LLM(GLM/Gemma/DeepSeek 系)共训一个集群时,流级公平调度(per-flow fairness)在同步语义下失效:慢任务的梯度同步会阻塞快任务。MonkeyTree 用任务迁移做去碎片化降拥塞。PReCCL 处理多租户争抢下的 VT(虚拓扑)负载重分配。公平性、故障容忍、负载再分配,这些操作系统的经典议题,正在逐字地进入通信库。
2. 逐篇深读:六篇论文
2.1 Theseus:schedule 的运行时准入与热切换
NCCL 时代有一笔隐性遗产:schedule 空间在初始化时固定。NCCL 内置 13 个预定义 schedule,用 α-β cost model 在启动时选一个,此后不再变。训练一旦跑起来,条件就开始漂移:MoE 的 expert 负载偏斜随时间变化,链路降速、节点故障随时发生。为启动时刻优化的 schedule,数小时后就成了次优甚至故障点。北大黄群组 + 阿里云的 Theseus 攻击的就是这个"初始化即过时"的结构。
它给通信库装了两个运行时机制。动态选择:用户用集群运行时属性定义 selection context,一套定制的 agreement 协议保证全 GPU 做出一致选择,摊销后近零开销。热切换:schedule 资源组织成树、跨 schedule 共享,切换时 delta migration 只建增量部分,不推倒重来。
fail-slow 场景最能说明这套机制值多少:一块 NIC 被限速到 10% 时,NCCL 的迭代时间从 1.75s 恶化到 3.76s;限速到 0%(等于链路死了)时,NCCL 训练直接停摆,而 Theseus 的调度适应把训练恢复到 2.03s——只比正常迭代慢 1.16×。数字总账:稳态通信最高 1.61×、动态环境 2.46×(vs NCCL),fail-slow 端到端 JCT(任务完成时间)1.84×;MoE EP32 训练效率 1.07×,十万迭代省 8 小时墙钟。
读 1.61× 要知道对照混合了框架与空间两重贡献(MSCCL++ 系 schedule 空间本身更先进);单数字不大,但这是在"已经高度优化的系统"上再挤出来的。原则清楚:schedule 必须成为运行时可替换的模块,而不是初始化时的常量。

2.2 OptCCL:合成问题的理论清场
算法合成器长期停在"三选二"困局里:最优性、可扩展性、通用性,只能取二。TE-CCL/SCCL 到 16-32 GPU 就要跑三小时,通用性好的质量差,质量好的不通用。Cornell 的 Shapley/Agarwal/Shmoys(Shmoys 是调度与近似算法的理论大家)用两个理论结果把困局拆了:时空解耦定理证明路径选择与链路调度可以解耦而保持最优;对称性收缩证明最优解可以在与硬件对称性一致的子空间内找到。搜索空间被数学压缩,三个"不可能同时"变成"可以同时"。多 collective 并发也第一次成为合成问题的一等输入。
数百 GPU 数十分钟内合成最优算法,对照 TE-CCL/SCCL 三小时只能到 16-32 GPU;vs TACCL 算法质量最高 18×(A100/DOE 拓扑)。
理论论文进 SIGCOMM 的意义在定锚:它证明了"最优+可扩展+通用"可以同时成立,把启发式军备竞赛拉回最优化框架。它与 Theseus 的关系是接力:OptCCL 离线合成最优 schedule,Theseus 运行时准入并热切换。接力棒中间还缺一环(见 §3 观察一)。
2.3 UBEP:为超节点重造 EP 通信库
超节点的账本上有三笔隐性税。数百 die 互联成统一逻辑域,内部却是多层级联(base/opt 两层),物理时延非均匀;而 CANN EP 的 BSP(全局同步)执行模型照单全收:串行化税(独立的通信阶段无法重叠执行)、显式同步税(flag/barrier 走独立通路,在低时延 fabric 上开销全部暴露)、拓扑盲调度税(按 token 数调度,不看物理时延)。链路带宽指数级提升之后,μs 级的固定开销成了主导项——当传输趋近免费,协议税就是新瓶颈。这与 RDMA 发展史上 kernel bypass 的动机同构,尺度更细。
南大 + 华为(作者列表里华为占 11 人)重造 EP 库,三个机制各消一笔税:依赖驱动执行,All-to-All 拆成细粒度任务,数据可用即调度,消灭全局 barrier;Data-as-Flag,同步信号嵌入数据载荷的原子指令,近零开销的隐式同步替代显式 flag;拓扑感知调度,把多层 fabric 的物理时延非均匀性放进决策变量。
从一台生产 CM384 超节点分配的最多 256 NPU die 上验证("up to 256 dies allocated from a production CM384"为原文口径):All-to-All 延迟最高 -52.4%,端到端 TPOT(每 token 输出间隔)-11.1%。
有效,但基线口径要先摆清楚:对照组是同硬件的 CANN EP。CM384 上跑不了 NVLink 版 DeepEP,跨生态对照不存在——这是国产超节点生态论文的固有边界,不是论文缺陷。

2.4 EPIC:以太网开放生态的 INC 标准化行动
NVIDIA SHARP 的在网聚合(in-network aggregation)是 InfiniBand 生态的私有武器,以太网世界没有对等物。这不只是技术缺口,是产业结构的洞:开放生态每次想用 INC,都要等芯片厂或设备厂自己实现一套私有协议。
北大吴文斐通讯 + 盛科 + 联想 + 阿里 + Infrawaves + NUDT,30 余人署名——这是一篇工作组形态的论文。28 页篇幅做一件事:为以太网定义 INC 的协议规范。统一抽象(参与者角色、功能边界、互操作接口)打底;多态实现按硬件能力分层,厂商可以从最简多态模式一路增量迭代到完整的网内聚合;每一种模式都过形式化验证;从 Tofino/NP 测试床到 FPGA/RTL 五类硬件形态全栈验证。
技术内容是扎实的,但产业信号大于技术信号:国产交换芯片厂(盛科)+ 服务器厂(联想)+ 头部云厂(阿里)+ 高校,对"以太网 INC 标准化"的联合行动第一次以 SIGCOMM 主会论文的形式出现。它的成败不在论文而在采纳——但出现在主会本身,就是生态攻势启动的信号。
2.5 PReCCL:通信库内建遥测
NCCL 把 collectives 分解到多个虚拓扑(VT)上,静态均分工作。多租户争抢之下,最慢的 VT 决定完成时间,健康的 VT 在旁边闲着——资源错配,且库内没有纠错机制。
清华 + 中关村实验室 + 阿里云的 PReCCL 在 CCL 内建软件在带遥测:测各 VT 的 stall count,遥测元数据搭现有 collective 流量便车,不需要 P4 交换机;再在 collective 边界上用确定性协议跨 VT 重分配工作。CCT 最高 2.1×,训练端到端 1.21×。
数字之外,更重要的是它的验证规模:1024-GPU 生产集群。这是本系列 15 篇里唯一的生产千卡级数据点。可落地性也是全场最高档:不需要新硬件,NCCL 补丁级别就能上。
2.6 DynamiQ:量化要为拓扑而设计
梯度压缩方案大多默认单跳参数服务器架构:量化、发送、聚合,一步到位。多跳聚合(ring/butterfly)里,部分和的量化误差逐跳累积,压缩省下的带宽,可能被精度的累积损失抵消。
UCL + Broadcom + Harvard(Mitzenmacher)为拓扑设计量化:两阶段量化按坐标量级分配位数,decompress-accumulate-recompress 融合核在中途重整误差,不让它滚雪球。在所有评测中,它是唯一保持 99.9% BF16 基线精度的方法,对比最强基线(OmniReduce/THC/MXFP4)再提速 34.2%。
有效性扎实,而 Broadcom 的署名是更值得记的产业信号:网络芯片厂直接参与通信库的算法层。与 EPIC 的盛科、UBEP 的华为合起来看,交换芯片阵营在通信软件栈上全面落子。
3. 路线分析:五条路线的地图
15 篇论文放在一张图上,五条路线清晰可见:

三条结构性观察:
观察一:离线合成与运行时自适应正在形成接力结构。 OptCCL 解决"什么是最优"(离线、理论),Theseus/PReCCL 解决"如何在漂移中保持最优"(在线、系统)。今天的缺口在中间:运行时触发的增量再合成(Theseus 的 schedule 来自预定义空间,PReCCL 的重分配不改变算法本身)。谁把 ILP 合成压到秒级在线化,谁就拿到下一代 NCCL 的位置。
观察二:压缩从应用层下沉到通信库层。 ZipCCL(无损、利用 LLM 张量的近高斯分布)与 DynamiQ(有损、多跳安全)同 session 出现不是巧合:当通信库成为运行时,压缩就是它的数据面。这复制了视频编码的历史:编解码从应用代码进入传输栈(WebRTC 的 JSEP 时刻对 collectives 还没有等价物)。
观察三:三条硬件路线在 INC 上汇合。 Turbo(可编程交换机 LUT)、EPIC(以太网协议规范)、HyNA(交换芯片 <3% 硅面积定制聚合),同一目标(网内聚合)的三种硬件承载。UBEP 反向而行(同步进数据载荷,不需要网络支持)。RMT(可重构 match-action 交换架构)可编程性、ASIC 定制、协议标准化三条路线的成本/灵活性三角,未来两年会给出答案。
4. 证据核对
头条数字锚定(§2 各篇细节数字见事实卡,不在此重复):
| 主张 | 数字 | 出处 |
|---|---|---|
| NCCL 内置 13 个预定义 schedule | 13 个预定义 schedule(PDF 原文) | Theseus §2.2 |
| Theseus 稳态 1.61×/动态 2.46×/fail-slow JCT 1.84× | vs NCCL | Theseus 摘要 |
| OptCCL 数百 GPU 数十分钟合成 | vs TE-CCL/SCCL 3h@16-32GPU | OptCCL 摘要+§7.1 |
| OptCCL 算法质量 vs TACCL 最高 18× | A100/DOE 拓扑实验(AllGather) | OptCCL §7.1 |
| UBEP All-to-All -52.4%、TPOT -11.1% | 生产 CM384 分配 256 die、vs CANN EP | UBEP 摘要 |
| EPIC 28 页、5 类验证 | Tofino/NP/FPGA/RTL | EPIC 全文结构 |
| PReCCL CCT 2.1×、训练 1.21× | 32-GPU 测试床 + 1024-GPU 生产集群 | PReCCL 摘要+§6 |
| DynamiQ 99.9% 精度 + 34.2% 提升 | vs OmniReduce/THC/MXFP4 | DynamiQ 摘要 |
| ZipCCL 无损 1.35× 通信/1.18× 端到端 | 64-GPU | ZipCCL 摘要 |
| HyNA 7.35× over BytePS、<3% 硅面积 | 100Gbps FPGA 原型 + 7nm ASIC 综合分析 | HyNA 摘要 |
| LEVELLER 最低速率提升 28%-120× | 10 LLM 共训 | LEVELLER 摘要 |
口径说明:UBEP 的基线 CANN EP 是同生态工程适配版(CM384 上跑不了 NVLink 版 DeepEP,跨生态对照不存在)。这是国产超节点生态论文的固有边界,非论文缺陷。PReCCL 的 1024-GPU 数据点来自阿里生产集群的部署测量。
5. 技术评估与预测
一、NCCL 的护城河会被从两端蚕食,但不会立刻决堤。 库兼容性(PyTorch 集成)+ CUDA 生态绑定仍是现实壁垒;Theseus/PReCCL 都以 NCCL drop-in 替换为目标恰好说明了这点。但 MoE/EP 负载是 NCCL 设计时没有的场景。UBEP 在华为生态内已经绕开 NCCL(CANN EP 是自家的),NVIDIA 生态外的新算法库(UCCL 等)在补。两到三年内,通信库市场会从单一事实标准变成"负载感知的多库共存",运行时(Theseus 类)做调度入口。
二、EP 通信是国产超节点栈的关键战场。 UBEP 证明华为在 UB 生态内已经把 EP 库做到生产级;EPIC 工作组在尝试由中国产业联盟主导以太网 INC 标准的制定。对照我们在灵衢分析中的判断:互联协议只是地基,上面的通信库才是用户可感知的性能面。SIGCOMM 2026 的论文分布正在兑现这个判断。
三、公平性调度会成为 2027 年的爆发点。 本届五篇(MonkeyTree/LEVELLER/Aegis/GeoOrchestra/Disaggregated RL)还是分散试探;当推理集群与训练集群混部成为常态(PD 分离 + 弹性调度),通信公平性就是资源利用率的第一约束。中国电信云(LEVELLER)的出现说明运营商背景的 AI 云已经在真实多租户里遇到这个问题。
四、可落地性三档。 立即可用:PReCCL 的软件遥测思路(不需要新硬件,NCCL 补丁级别)、ZipCCL/DynamiQ 的压缩核(库层插入);中期(跟随硬件更新):EPIC 的多态 INC(等盛科/联想的芯片与整机落地)、HyNA 的 ASIC 聚合(下代交换芯片流片窗口);生态绑定:UBEP(UB 原子语义,NVLink 生态不可移植。这既是华为的护城河也是 UBEP 的天花板)。
五、一个反向判断:RS3/RS5 的论文密度本身预示这两条线的投稿峰值已近。 算法合成与网内聚合的"理论清场"(OptCCL)出现通常标志一个方向的成熟期。下一个窗口在运行时层。遥测、决策、热切换的闭环 Theseus 已经齐了,缺口在运行时触发的增量再合成:Theseus 的 schedule 空间仍是预定义的,OptCCL 的合成还停在离线侧,两者之间没人打通。
声明: 本文基于 15 篇论文:深读 6(Theseus/OptCCL/UBEP/EPIC/PReCCL/DynamiQ,全文)、中读 4(Trivance/ZipCCL/HyNA/Balancing and Beyond,摘要+关键节)、略读 5(MonkeyTree/LEVELLER/Aegis/GeoOrchestra/Disaggregated RL,摘要口径,正文仅定性引用)。UBEP 基线为同硬件 CANN EP(华为生态内对照,跨生态对照不存在)。文中数据截至 2026 年 8 月 22 日。
本篇为 SIGCOMM 2026 深读系列篇2。前篇:总览(篇0)、KV Cache 网络公民(篇1)。下篇预告:《Scale-Up 是新的数据中心网络》。
