← 返回观点 思考

MetaRoCE 深度拆解:按丢包设计的 RDMA,按百万卡组网的开放标准

MetaRoCE 是 Meta 为通用以太网上的 AI 负载从零设计的 RDMA 传输协议,与内置网卡的 MTIA 300 训练芯片同日发布,规范、参考实现与一致性套件经 OCP 开放。本文按六个问题拆解:它为什么出现、是什么、为什么开源、怎么工作、值多少,以及与字节 MegaScale、阿里 HPN、腾讯星脉、AWS SRD、Google Falcon 与 UEC/MRC 联盟的同行对照。

2026-09-01思考59 分钟阅读

MetaRoCE 深度拆解:按丢包设计的 RDMA,按百万卡组网的开放标准

MetaRoCE 是 Meta 为通用以太网上的 AI 负载从零设计的 RDMA 传输协议,与内置网卡的 MTIA 300 训练芯片同日发布,规范、参考实现与一致性套件经 OCP 开放。本文按六个问题拆解:它为什么出现、是什么、为什么开源、怎么工作、值多少,以及与字节 MegaScale、阿里 HPN、腾讯星脉、AWS SRD、Google Falcon 与 UEC/MRC 联盟的同行对照。

2026 年 8 月 24 日,Meta 工程博客发出两篇文章:MetaRoCE,一个为通用以太网上的 AI 负载从零设计的 RDMA 传输协议,规范、参考实现与一致性测试套件经 OCP 于 10 月峰会开放;MTIA 300,首款内置网卡与通信卸载引擎的训练芯片。MetaRoCE 的设计哲学只有一句:网络结构看到的是数据包,网卡看到的是意图。两篇文章出自同一人之手:Rajiv Krishnamurthy 既是 MetaRoCE 的四位署名作者之一,也是 MTIA 300 文的第一作者。

一家不卖网络设备的公司,为什么把自研传输协议连规范带实现全部交给开放社区?这件事本身就需要解释。

一、为什么有 MetaRoCE:三个前提的由来与十年演化

RDMA 的本义是绕过内核协议栈,让网卡直接读写应用内存,把延迟压进微秒级。它出生在 InfiniBand 里。那是一张为高性能计算定制的专用网络,天然有序、几乎不丢包,RDMA 的简单,正是以网络的完美为前提。要用便宜得多的商品以太网跑 RDMA,就得让一张会丢包的尽力而为网络去扮演 InfiniBand。RoCE 的三个前提,就是这场模仿工程的代价。

其一,无损前提。RDMA 丢一个包的代价远高于普通以太网流量:网卡的重传计时器以毫秒计,而数据在 fabric 内部的传输只花微秒,一次超时等待就能把尾延迟打穿。于是 RoCE 用优先级流控(PFC)保证不丢:交换机缓冲区将满时,向上游发暂停帧,让对方停发,以此换来一个「无损」网络。这笔交换的代价写在机制里。暂停帧逐跳向上游传播,一条慢链路的反压能扩散到整张网络;反压所到之处,同一条队列里与肇事故障毫无关系的流量被一起冻结,队头阻塞以毫秒级出现;而要让这套机制尽量不误伤,每台交换机的缓冲水位都要逐台精调。无损网络因此成了最难运维的网络。

其二,按序前提。传输层假设包按序到达,网卡的硬件实现才能足够简单,代价是把每条流绑定到单一路径。其三,单路径前提。ECMP 按五元组哈希,同一条流的包从建立到结束落在同一条路径上。有序假设正好需要这种绑定,两者互为因果。数千卡的集群里,这套精调工程运转良好:训练流量以周期性大流为主,并发流数少,哈希碰撞的代价尚可吸收。

规模上去之后,三个前提逐条站不住,而且每一处裂缝都有 Meta 自己的第一手记录。Meta 的 SIGCOMM 2024 论文《RDMA over Ethernet for Distributed AI Training at Meta Scale》复盘了这套工程的极限。路由上,默认 ECMP 的分布不够均匀,路由方案迭代多轮才逼近理想。拥塞控制上,最初沿用的 DCQCN 在网络升到 400G 时撞上厂商实现的缺陷,Meta 干脆停用 DCQCN,只留 PFC 运行了 18 个月。这 18 个月里拥塞靠什么管?答案已经离开网络层:拥塞管理上移到集合通信库,每次传输由接收端先发一个允许发送的握手,接收端没准备好就不注入数据。发送端视角下原本互不核算的两个控制回路并成了一个,系统行为反而更可预测。连按序前提也做了放宽,论文把放宽排序与调整网卡 PCIe 信用一起列入增强项。

生产侧的数字来自 Meta 的 Llama 3 论文:405B 在 16,384 张 H100 上 54 天训练里的 419 次意外中断,那套 RoCE 集群由 Arista 7800 与 Minipack2 交换机组成、400G 互联。值得注意的是方向:在无损框架内,Meta 把控制点一路从网络层上移到软件库。这已经是把智能搬回端点的第一步,只是还留在软件里、还留着 PFC。两年后 Meta 交出的答案,是不再修补这三个前提,直接推翻它们。

换掉这三个前提的路线,行业走了十年,分两支。一支修网络,让前提继续成立:更好的拥塞控制、重构拓扑、调优 ECMP,字节、阿里、腾讯在这条路上把工程做到极致。另一支换前提,把传输责任从网络搬回端点。这条路要解四道题,每道题行业里都已经有了各自的答案:多路径利用,靠逐包喷洒;乱序,靠接收端重排,或者干脆设计成免重排;容损,靠选择性确认位向量;多打一汇聚,靠接收端速率分配。这四个答案合起来,就是 MetaRoCE 的机制清单。

端点路线的先行者都不是纸上方案。AWS 的 SRD 最早证明这条路走得通,端点自己处理乱序与重传,PFC 可以整个消失。Google 的 Falcon 在自家集群私有落地,NVIDIA 的 Spectrum-X 走交换机与网卡协同的中间路线,UEC 1.0 与 MRC(Multipath Reliable Connection)把端点路线写成开放标准。私有阵营验证了可行性,联盟标准铺开了规范,缺的是一份由最大买家亲自下场、带生产验证的完整实现。

Meta 的铺垫有迹可循。从 2024 年 8 月的 RoCEv2 生产复盘,到 2025 年 10 月的 ESUN 网络架构倡议,再到 2026 年 2 月与 AMD 的 RCCLX 合作、8 月的协议加芯片同日双发,这条线铺了两年,AMD 是贯穿后半程的搭档。Meta 的集群规模,原文自述为数十万 GPU,媒体口径为 H100 等效超百万卡,下一代 Prometheus(2026 年底,1GW)已在路上。RoCEv2 的裂缝、十年端智能源流、自家两年铺垫,三线在 2026 年 8 月汇合。

端智能六线谱系与开放化进程
端智能六线谱系与开放化进程

二、MetaRoCE 是什么:定义、构成与形态

一句话定义:MetaRoCE 是运行在通用以太网 UDP 之上的 RDMA 传输协议,为 AI 训练与推理负载从零设计,保留 RDMA Verbs 编程接口。它同时是三样东西:一个传输协议,一个 OCP 开放项目,以及 Meta 自己生产网络的下一代传输底座。第三重身份是我们的路径判断,公告未作此承诺。

它通过 OCP 交付四件东西。完整协议规范,任何厂商都可以据此实现可互操作的硬件。软件参考实现 libsoftmetaroce,一个完整功能的传输栈,运行在通用 Linux 的标准 UDP 套接字上,不需要任何专用硬件,定位是芯片开发的权威行为模型与统一一致性框架的基础。生产级一致性测试套件,给硬件厂商证明实现与规范一致的工具。DPDK 优化版参考实现,随 10 月峰会发布,是参考实现走向性能路径的版本。四件套合在一起才是可采购的开放标准:规范定义对错,参考实现给出可执行的行为基准,一致性套件提供验收标尺。三件缺一,开放就停在纸面上。

网卡要接住的清单:路径管理与逐路径遥测、逐包喷洒与熵值调整、位向量处理与精确重传、双端拥塞控制、流-路径-连接三级状态管理。落地形态覆盖三类载体。软件栈形态即 libsoftmetaroce,任何 Linux 服务器可跑,用于开发验证与行为对照。可编程网卡形态以 AMD Pensando 为已验证路径:Meta 与 AMD 合作在其可编程处理器上实现了完整协议,64 节点 AMD GPU 集群跑 RCCL 集合通信库完成了与 RoCEv2 的直接对比;按 AMD 口径,协议实现于 Pollara 400 网卡,走向 Vulcano 800(800G)部署。固定功能网卡形态在设计目标内:协议被设计为可编程与固定功能网卡皆可实现,其他厂商的实现正在进行中。

Meta 自己怎么用,已经公开的部分落在验证与芯片两侧。验证侧即上述 64 节点集群;芯片侧是同日发布的 MTIA 300。这颗芯片瞄准的训练负载本身就吃通信:推荐与排序模型的嵌入表能占掉模型 99% 以上的参数,训练要靠混合并行,把 AllReduce、AllToAll、AllGather 一类集合操作铺满数百颗加速器,通信与计算在同一份硬件上互相争抢。

MTIA 300 的答案是让通信成为芯片里的一等公民。按 Meta 工程博客的原文,这颗芯片带两颗网络芯粒,每个含 6 个自研 800Gbps RDMA 网卡、合计 1.2TB/s。通信引擎不走 PCIe,直接坐在计算旁边,数据搬运省去了主机总线这一跳,同一组网卡可以在 scale-up(16 节点、1TB/s)与 scale-out(200GB/s)之间动态切换。计算阵列是 12×6 的处理单元网格,通信另有 16 个专用消息引擎,每个引擎由一颗 RISC-V 核负责编排、一块近存计算块以每周期 128 字节的速率做归约,合计归约吞吐 2.8TB/s,超过 I/O 带宽的两倍。大 GEMM 与集合通信并发时,计算吞吐的降级不到 0.5%;传统 GPU 集群在同一场景下降级超过 20%。

配套的通信库叫 HCCL,与芯片从零联合设计(与华为昇腾生态的 HCCL 同名,两者无关)。它的做法是编译式通信:每个集合操作被编译成一套完整的子图,交给消息引擎自治执行,数据一旦到卡,主机不再参与。为压低单次操作的延迟,另有快速信令路径:工作请求本身充当门铃,省掉一次内存读,每个操作省约 800 纳秒。成绩单:HCCL 在机架内最高做到 940GB/s;一个跨 40 颗加速器的 150B 参数生产推荐模型,总通信时间比同等 GPU 集群快 3.9 倍。这些数字出自 ISCA'26 的芯片论文与 SC26 的 HCCL 论文,后者预印本编号 arXiv 2608.00358。需要两处限定:原文没有说这组网卡运行的就是 MetaRoCE;这颗芯片瞄准的是训练推荐与排序模型负载,未覆盖 LLM。「协议落进自研硅」是我们的路径判断,公告里没有这句承诺。

MTIA 300 的网络芯粒与双模切换
MTIA 300 的网络芯粒与双模切换

三、为什么开源:给了什么、留住了什么

开放的是三件套:规范全文、参考实现源码、一致性套件。任何网卡厂商可以按规范实现并销售兼容硬件,任何买家可以拿一致性套件验收,任何研究者可以拿 libsoftmetaroce 当行为模型。开放的不只是协议文本,还有验收手段。

Meta 留住的东西同样清楚。规范的演进主导权在 Meta 团队手里,四位署名作者就是路线的守门人。生产部署的调优与运维经验不在规范里,那是跑过 16,384 卡 RoCEv2 集群的团队才有的资产。与自研芯片的集成细节不在 OCP 包里,Pensando 实现的工程细节也在 AMD 侧。换句话说,业界拿到的是可实现的协议与可验收的工具,Meta 自留的是让它跑得最好的知识。

业界各取所需。网卡厂商多了一条新赛道:传统 RDMA 网卡市场之外,出现了一个规格公开、验收标准清晰的产品类别,AMD 抢了先手,博通、Intel 与白牌厂商在同一起跑线上。云与集群买家多了一条采购路径:从买整套方案变成按规范竞价,一致性套件提供了跨厂商比价的标尺,标书可以写成三行:按 OCP 规范实现、通过一致性套件、报单价。研究者拿到了可公开对照的行为模型,传输层研究第一次有了与 hyperscaler 生产环境同构的参照。

贡献与适配的分工已经成形。治理挂靠 OCP 的 ESUN 倡议:ESUN 把开放、多供应商理念确立在网络结构层,MetaRoCE 把它延伸到传输层。网卡侧 AMD 已实现,其他厂商进行中。交换机侧基本无动作可做,ECMP 与 ECN(显式拥塞通知)是既有功能。集合通信库侧 RCCL 已随验证适配,NVIDIA 的 NCCL 等主流栈要等规范落地与需求出现。

开放不是慈善,是采购策略。Meta 不卖网络,传输协议做成公共品没有收入损失;换回的是 AMD、博通、Intel 与白牌网卡厂都可以按 OCP 规范与一致性套件实现 MetaRoCE,采购从买整套方案变成按规范竞价。买方定义协议的模式,OpenAI 用 MRC 演示过一遍,MetaRoCE 是第二次,区别是 Meta 同时拥有自研训练芯片、超大规模自建集群与全球屈指可数的网络采购盘,协议、芯片、采购三张牌落在同一个买家手里。

四、深度拆解:机制、流程、验证与部署

三对机制,逐条推翻三个前提。

第一对:乱序交付与多路径。MetaRoCE 把每条连接拆成许多条逻辑路径,逐包喷洒,乱序到达是设计常态。喷洒的实现不惊动网络的任何一个角落:交换机的 ECMP 哈希输入包含 UDP 五元组,其中源端口是网卡可以自由改写的字段。传统栈里五元组在流的生命周期内不变,一条流终身一条路;MetaRoCE 的网卡逐包调整源端口,等于逐包换路,交换机照常哈希转发,毫无感知。这就是熵值调整的含义:路径选择权从网络的哈希表挪回网卡。

到达端,每个数据包自带目的地,直接写入最终内存位置,无重排序缓冲区,也就没有队头阻塞。读写两种语义分开处理:Write 逐包携带目的地地址;Send 自带与已发布接收缓冲区的匹配信息,消息无需先花一轮往返学习数据去向,先到的先落地。这个细节保住了双边消息传递:集合通信库不必把一切通信降级成写操作。

每条路径独立维护往返时间、ECN 标记与利用率的实时遥测,这让拥塞与故障可以被区分:拥塞表现为往返时间上升加 ECN 标记增多,链路故障表现为利用率塌陷加传输停滞。传输层据此显式重平衡,把劣化路径上的流量挪开。因为每条路径独立维护窗口与往返预估,坏链路只减慢一条路径,整条连接继续由其余路径承载。在多平面网络上,平面选择完全归网卡,网络被利用的好坏只取决于网卡喷洒的好坏,网络侧不保存任何传输状态。

第二对:容损与双向拥塞控制。MetaRoCE 视以太网为有损网络,不要求它变成无损:不用 PFC,不用暂停帧。丢包判定建立在每路径独立序列号上,这是设计里最关键的一步:传统传输只有一个全局序列空间,确认间隙可能只是乱序未到,不能立刻判丢,只能等超时兜底;MetaRoCE 每条路径有自己的序列空间,间隙不再与乱序混淆,256 位选择性确认位向量中的间隙就是丢包的直接证据。

这里的语义与传统协议相反:传统 SACK 的主要作用是避免重发已经到达的数据;MetaRoCE 的位向量间隙直接触发精确重传——只重传丢失的那个包,且在丢包的那条路径上,间隙一出现立即执行。

拥塞控制由两端共同完成。发送端跑 ECN 驱动的 AIMD,收到标记就加性增乘性减。接收端做另一半:它知道自己入站链路的容量与活跃发送端的数量,把带宽份额的分配结果放进每个确认包返回,发送端直接逼近正确速率,不必反复试探。多打一的汇聚流量(incast)因此在一到两个往返内收敛:探测式算法要在发送端之间反复试探,花掉多得多的往返才能稳定,直接分配份额把这个过程省掉了。AMD 侧的描述补齐了发送端拿到速率之后的动作:封住传输窗口,并在可用路径之间调度流量。窗口按路径与按连接分别维护:一个拥塞标记只裁剪看到拥塞的那条路径,并把后续包导向空闲路径。公平性与尾延迟同时改善,代价是网卡要维护的状态从每连接一份变成每路径一份,这是用网卡状态换网络简单性的整笔交易的一部分。

双端拥塞控制与 incast 收敛
双端拥塞控制与 incast 收敛

第三对:拓扑无关与连接结构。协议对网络的全部要求,是每台交换机都已具备的两项功能:ECN 标记与 ECMP。它不要求包修剪、网络内遥测、基于信用的流控或交换机侧喷洒,交换机提供这些功能也不冲突。胖树、多平面、深缓冲、浅缓冲、不受自己控制的供应商云,同一套协议通吃,网络得以纯粹按成本与布线优化。与调优路线对照,这一条的经济含义才显出来:字节与阿里为均匀分流重构了整张拓扑,Meta 自己为路由均匀迭代了多轮;MetaRoCE 把均匀性变成喷洒的副产品,交换机买最便宜的即可。

连接结构解决的是状态爆炸。传统 RDMA 的队列对(QP)同时承载消息流与带宽:单条 QP 是一条有序流、一个拥塞窗口、一条 ECMP 路径,单条 QP 吃不满带宽,要更多并行就开更多 QP,每节点对开到数十个,每个 QP 自带拥塞窗口、互相不可见,窗口之间既难公平也难协同爬坡,状态在网卡上随并行度膨胀。MetaRoCE 把两者拆开:单条连接在上层承载多个独立有序流(每个通信器或集合操作一个),下层承载多条路径,由一个拥塞控制器统一管理。连接状态不再随负载并行度增长。应用层基本无需改动,现有 RDMA Verbs API 与软件栈照常工作,多平面等增强走扩展 API。

单连接三层结构与 QP 堆叠对照
单连接三层结构与 QP 堆叠对照
三对设计对 RoCEv2 三个前提的逐条推翻
三对设计对 RoCEv2 三个前提的逐条推翻

一次集合操作的完整传输路径。 应用通过现有 Verbs 接口建立连接,通信库在每个通信器或集合操作开始时,在连接内分配一个独立有序流。集合操作的数据进入所属流后,传输层拆包、按实时遥测逐包选择路径喷洒,UDP 源端口即 ECMP 熵值,交换机按标准哈希转发,无需任何特殊状态。包在标准以太网里乱序到达,接收端网卡按每个包自带的信息处理:Write 直接写入最终内存位置,Send 按匹配信息落进已发布的接收缓冲区,先到的数据先可用。

每条路径的确认包各带 256 位位向量与带宽份额,发送端据此完成全部异常处理。丢包:位向量出现间隙,立即在丢包的那条路径上精确重传缺失的包。路径拥塞:ECN 标记只触发该路径的窗口裁剪,后续包导向空闲路径。链路或平面故障:往返时间与利用率的变化模式区分拥塞与故障,传输层显式把流量挪开,实测中模拟平面故障期间流量自主重分布,无需应用参与,也无需运维干预。incast:接收端按份额直接告知每个发送端的可用速率,一到两个往返收敛。这条路径走完,交换机全程只做了两件事:ECN 标记与 ECMP 转发,传输智能全部落在两端网卡上。

一次集合操作的传输路径与四种异常处理
一次集合操作的传输路径与四种异常处理

验证结果与边界。 硬件验证落在 AMD Pensando 网卡上,测试环境是 64 节点的 AMD GPU 集群,集合通信库用 RCCL,与 RoCEv2 直接对比。四组结果:全归约与全到全操作持续取得更高吞吐与更低的流完成时间。1% 丢包率下维持约 86% 吞吐,原文未注明基准口径,此处字面引用。这个数字的读法在前提上:RoCEv2 的设计里本就不存在 1% 丢包的网络,PFC 的职责就是阻止这种网络出现;MetaRoCE 把同一张网络当作正常工况,仍交出接近九成的吞吐。10% 极端丢包下仍提供有效带宽并优雅收敛。4 平面与 8 平面拓扑、最高 4000 条并发连接,吞吐随平面数线性增长。模拟平面故障期间流量自主重新分布。边界同样要写清楚:64 节点距离百万卡的设计目标差三个数量级以上,每节点 GPU 数未披露,对比基线 RoCEv2 运行在何种网卡上原文也未披露。软件参考实现只作为行为模型,目前交出性能数据的网卡只有 AMD Pensando 一家,DPDK 优化版本要到 10 月峰会才发布。接收端速率提示在数千发送端并发下的公平性、跨地域毫秒级往返、机架内纳秒级短消息,都还停在路线图方向,尚无实测数字。

64 节点验证的四组结果与边界
64 节点验证的四组结果与边界

三种距离尺度与部署要求。 机架内(scale-up),加速器交换小消息,每纳秒都关键,MetaRoCE 已消掉两个延迟源(重排序缓冲区与 PFC),正在推进短内存操作的快速信令路径,从一个处理单元直接发往另一个。数据中心内(多平面),平面选择完全归网卡,网络只需标准 ECMP 与 ECN,部署清单极短:交换机基本无需改动,PFC 可以退场,多平面增强按需走扩展 API。跨楼(scale-across),单作业横跨数千公里外的多栋建筑,往返毫秒级,路径间的微小差异逐渐累积。路径作为一等公民是适应的基础:传输层偏好无拥塞路径,并在每一层寻求公平。长距链路公平共享仍是未解的官方路线图项。存储与 KV 缓存场景,分布式存储天然带来 incast:一次读扇出到大量服务器,回复同时涌回。接收端速率提示让收侧(无论是收写请求的存储服务器,还是收读结果的客户端)直接调节入站速率,无论请求发往十台还是一千台服务器。新的难点是在速率各异、请求大小不同的网络里保持速率提示的准确性。一句话总结部署:应用层与交换机都基本无需改动,变化集中在网卡侧。10 月规范落地后,采用支持该协议的网卡即可部署,一致性套件是验收依据。存量可编程网卡能否经固件跟进尚待厂商给出路径,这是我们的路径判断。

五、多角度评估

技术价值集中在两处设计进步。SACK 位向量从「避免重发」反转为「触发精确重传」,配合每路径独立序列,把容损从补丁变成传输层的第一原则;单连接承载多流多路径、单一拥塞控制器,终结了 QP 堆叠的状态爆炸。对网络零新增要求同样重要:ECMP 与 ECN 是每台交换机的既有功能,这意味着部署不与任何交换机厂商的路线图绑定。验证边界的披露方式值得肯定:64 节点与百万卡的差距、未披露的基线口径、路线图项与实测数字的区分,都写明了,这在新协议发布里不常见。

市场价值在于模式的确立。买方定义协议从 OpenAI 的单例变成可复制模式,最大买家们发现可以绕开厂商联盟直接按自己的集群形状定规格。网卡一侧出现规格公开、验收标准清晰的新产品类别;交换机侧的差异化空间被进一步压缩。对 NVIDIA 形成两面夹击:InfiniBand 的无损叙事被正面竞争,Spectrum-X 的私有配对叙事被开放规范对照。

实用价值要分人群看。现在就能用的,是 AMD GPU 集群加 RCCL 的组合,这是唯一验证过的硬件路径,且按 AMD 口径已在向 800G 部署推进。要等的:NVIDIA 集群用户(NCCL 适配与网卡支持都未发生)、10 月规范与 DPDK 版落地、以及网卡厂商的产品化节奏。适合谁:CSP 与大集群买家最值得跟进,即使不采用协议本身,买方定义加一致性验收的开放模式也可直接借鉴。网卡厂商面对新赛道宜早不宜迟,企业级集群等生态成熟再用不迟,研究者现在就有可公开对照的行为模型。国产算力生态是特别受益方:一份直接可用的规范,商用交换机加实现该规范的国产网卡即可组网,传输层不依赖任何单一供应商。

六、同行对照:其他 CSP 的传输层答卷

把同行放到同一张桌上,能看到两条清晰的路线。

RoCE 框架内调优,代表是字节、阿里与腾讯。字节的 MegaScale 系统(NSDI'24 论文)披露了其万卡集群的完整工程:12,288 张 GPU,网络用 Broadcom Tomahawk 4 交换芯片(单芯片 25.6Tbps、64 个 400Gbps 端口)搭三层类 CLOS 拓扑,上下行带宽 1:1。传输层仍是 RoCE,优化集中在四件事:定制拓扑、降低 ECMP 哈希冲突、定制拥塞控制、调重传超时参数,配合一整套深入协议栈的可观测与诊断工具维持长训稳定性。

阿里的 HPN(SIGCOMM'24 论文)走得更远一步但仍在 RoCE 上:为单个 Pod 互联 15K GPU,用 51.2Tbps 单芯片交换机搭双层双平面架构,双 ToR 主备消除单点故障,双平面直接化解大流量下的 ECMP 哈希极化:LLM 训练每主机只有少数几条周期性大流,传统 ECMP 的负载不均在万卡尺度被急剧放大。生产口径在此之上再进一层:HPN 7.0 架构配自研 Solar-RDMA 与 ACCL 集合通信库,论文自述 2023 年 9 月起大规模部署,通义千问 2.5 即在其上训练。

腾讯的星脉网络 2023 年 6 月完整披露:自研白盒交换机与网络操作系统,互联带宽 3.2Tbps,目标支撑 10 万卡组网,传输层自研端网协同的 TiTa 协议,实时监测并调节网络拥塞,官方口径带宽负载提升 40%、高负载下 0 丢包。集合通信库 TCCL 官方口径通信时延降低 40%。系统整体官方口径 GPU 利用率提升 40%。TiTa 的端网协同与 MetaRoCE 的端智能在方向上相邻,分野在框架:星脉仍以无损网络为目标,MetaRoCE 放弃了无损这个前提。

微软没有公开的对等自研传输层披露,Azure 的 AI 集群网络以商用方案为主。三家都把无损这个前提留在原地——协议层创新(定制拥塞控制、Solar-RDMA、TiTa)全部服务于无损框架;MetaRoCE 动的是无损这个前提本身。这条路线的运维成本,Meta 的 SIGCOMM 论文自己记录过一遍:路由多轮迭代、拥塞控制上收、按序放宽,全部在无损框架内完成,框架本身没有被触碰。

重造传输层,代表是 SRD、Falcon 与 MetaRoCE。三家解的是同一组题,答案的差别集中在两件事:乱序在哪里被吸收,丢包证据用什么粒度确认。

AWS 的 SRD 是这条路上最早的规模化样本,2019 年起随 Elastic Fabric Adapter 私有运行:可靠数据报语义,允许乱序交付,重传与拥塞控制由 Nitro 硬件完成,以太网保持会丢包的本来面目,PFC 不再需要。AWS 驱动文档把动机写得很直白:可靠的连接型传输限制了在途消息数量,全互联要堆大量队列对,SRD 把这两条一起去掉。后来 ENA Express 把它带进普通实例网络,官方口径单条 TCP 流带宽最高 25Gbps,P99.9 尾延迟最多降低 85%。

Google 的 Falcon 服务自家集群,私有运行,设计经 OCP 披露(2023 年 10 月):一条连接拆成多条子流,发送网卡改写 IPv6 流标签为每个包选子流,交换机照常哈希,路径粒度比逐包喷洒粗一档。接收网卡用一片一到两平方毫米的片上缓冲把乱序包重排回顺序,确认位图 128 位,拥塞控制走延迟信号。RDMA 与 NVMe 作为上层协议映射到统一的推拉事务接口。

UEC 1.0(2025 年 6 月)与 MRC 把端点路线写进联盟标准:UEC 推倒重来、更换 API 栈、硬件生态 2026 到 2027 年起量;MRC 由 OpenAI 领衔,用 SRv6 源路由把路径控制收进端点,交换机需支持相应转发,而 UEC 与 MetaRoCE 的最小交换机要求一致,都是 ECMP 加基本 ECN。Meta 同时是 UEC 的发起成员与 MetaRoCE 的主导者。

两条路线各有代价:调优路线赢在确定性与零迁移,生态照旧、风险已知;重造路线上限更高,赌的是无损运维成本随规模超线性上升。

方案 开放性 传输层改动 乱序吸收位置 验证或生产规模
AWS SRD 私有 从零重造 端点,交上层处理 生产多年
Google Falcon 私有(设计经 OCP 披露) 从零重造 网卡内重排缓冲 TPU 集群生产
字节 MegaScale 网络 论文公开、协议私有 不动协议,调拓扑/ECMP/拥塞/超时参数 不吸收(按序前提) 12,288 GPU 生产
阿里 HPN / Solar-RDMA 论文公开、协议私有 自研传输栈,保留无损框架 不吸收(双平面均衡分流) 15K GPU 生产,通义千问训练
腾讯星脉 / TiTa 体系公开披露、协议私有 端网协同协议,无损框架内 不吸收(无损加端网协同) 3.2Tbps,10 万卡组网目标
UEC 1.0 / MRC 开放规范 从零重造 规范定义接收端处理 硬件生态 2026-27 起量
MetaRoCE 规范+参考实现+验收套件全开放 从零重造 直写内存,取消重排 64 节点验证,走向 800G 部署,10 月规范落地

MetaRoCE 在这张表里的独特位置:唯一把「重造传输」与「全开放加验收套件」合在一起,且由百万卡级买家亲自定义的实现。机制层面它与 Falcon 的分野最有代表性:Falcon 在网卡内重排,代价是一片片上缓冲加 128 位确认位图;MetaRoCE 用直写内存取消重排这个步骤,确认位图 256 位且每路径独立维护。它与 SRD 的分野在开放性:同样的端点智能,一个锁在 Nitro 硬件里,一个连规范带验收工具全部交出。它对 Meta 自己是桥与对冲:UEC 硬件起量之前,先承接 Prometheus 这一代集群的需求。

风险也在此:三条开放线工程力量重叠,阵营先碎片化的可能真实存在。Meta 的优先级不难读,先赢 InfiniBand,再分内部胜负。被迫回应的名单很长。AMD 已经多线并押,同一条可编程网卡路线同时服务 MRC、UEC 与 MetaRoCE。NVIDIA 本身就是 MRC 参与方,两边押注,是否开放 Spectrum-X 的对等能力成为悬案。博通与 Intel 在 MRC 与 MetaRoCE 两条线上都要表态。

七、总结与判断

MetaRoCE 用三对机制推翻 RoCEv2 的三个前提,在 64 节点与多平面拓扑上验证了方向,10 月 OCP 峰会开放规范、参考实现与一致性套件。规模是真的,开放是真的,验证的边界也是真的。

判断一:端智能路线完成行业合流。SRD、Falcon、Spectrum-X、UEC、MRC、MetaRoCE 六线同向,PFC 在新增部署中的倒计时开始。过去是网络迁就协议,现在是协议迁就网络。

判断二:买方定义协议成为新模式。MetaRoCE 的胜负手是生态时间差:UEC 硬件成熟前的窗口期内,能不能吸纳足够多的网卡实现。MTIA 300 同日发布给出了协议落进自研硅的路径,但协议的端点不限于 Meta 自己的芯片。

判断三:传输层开放的最大受益者是所有用商用交换机组 AI 集群的人。网络的差异化价值进一步压回网卡与芯片,交换机产业加速大宗商品化,网卡成为新的竞争高地。

后继关注四件事:10 月 OCP 全球峰会的首发与跟进厂商名单;Prometheus 集群的生产数据,2027 年起可查;NVIDIA 的对策;MRC、UEC、MetaRoCE 三条开放线合流或分叉的第一个信号。


相关阅读