← 返回观点 思考

华为的一张网:HC 2026 网络全景

华为全联接大会 2026 的网络发布,按本站在 Hot Chips 2026 立下的五张网坐标逐张归位:五张里交出了四张的答案,且全部跑在同一套灵衢协议栈上。本文拆解 scale-up 的总线域如何从机架搬到楼层、scale-out 的两层多平面如何同时降成本降时延、华为为何没有 DPU、AI context 平面如何成为新主战场,以及光的四条线与一家厂商的注册表。三个判断收束:四张网一套协议栈、context 平面成 2027 决胜点、治理模式决定天花板。

2026-09-21思考43 分钟阅读
华为的一张网:HC 2026 网络全景

三周前,我们在 Hot Chips 2026 的报道里给 NVIDIA 的 AI 工厂立过一套坐标:五类流量,五张专用网。芯片间的张量并行交给 NVLink,机架间的训练同步交给 Spectrum-X,跨园区的数据流动交给 Spectrum-XGS,节点进出工厂的 IO 交给 BlueField-4 DPU,agent 的上下文与 KV 访问单独成面。五张网的逻辑是把调度器的仲裁换成拓扑,每类流量有自己的平面、自己的硬件、自己的故障域。

华为全联接大会 2026(HC 2026)9 月 17 日至 19 日在上海举行。把这三天发布的网络产品逐件放回这套坐标系,结果比任何单点产品都更有信息量:五张网里,华为交出了四张的答案,而且四张全部跑在同一套灵衢协议栈(UnifiedBus,华为 2025 年 9 月开放的计算互联协议)上。NVIDIA 用五张物理独立的专用网分而治之,华为用一条总线把它们收回到同一套内存语义里。唯一缺位的是 scale-across(跨园区),而且这格在本届只补上了半个:星河 AI WAN 的算网一体机开始让广域网参与模型部署。星络算法支撑千公里远端算力承载,官方披露远端算效超过 95%(「算效」的具体定义未随发布公布);执行方式是模型按层切分,首尾段留在本地,中间层放到远端,网络只传高维向量、原始数据不出域。但园区到园区的数据中心互联 fabric 仍无对应产品,F5G-A 依旧只是接入网。

这场发布的需求侧定调来自华为 ICT BG CEO 杨超斌:传统架构下,十万卡集群的实际模型算力利用率只有约 20%,大量算力在等待通信;10 万亿参数训练的中间数据,单卡 HBM 装不下;agent 与模型每小时交互数百次,KV Cache 远超内存。星河网络发布稿补了一组当期数字:过去一年全球 Token 日均消耗量增长 260 倍,今年企业 Agent 规模化应用率预计接近 50%。会前一天(9 月 16 日)发布的《智能世界 2035》报告把第三条压力拉到十年尺度:2035 年全球将有约 9000 亿个 AI agent,网络流量中智能体占比超过 90%。下面按五平面坐标逐张归位,先从最重的一张开始。

fig1 · 五平面归位矩阵
fig1 · 五平面归位矩阵

一、Scale-up:总线域从机架搬到楼层

柜内是灵衢互联刀片:零电缆、零电路损耗,一个 4096 卡超节点节省 196 公里铜缆。跨柜是灵衢互联设备:176 端口、每端口 1.6T,单机 280T 全光互联,往返时延(RTT)低至 2μs,华为称业界带宽最大、端口数最多的高速总线协议互联设备。光引擎是 Hi-ONE:单引擎 7.2T 的近封装光学(NPO,Near-Packaged Optics)产品,华为称业界首个量产 NPO、唯一内置光源。每套 960 超节点用 5500 颗替代 4.8 万颗 800G 可插拔光模块,省电超 550kW,系统可用度 99.8%。

产品端的承接是 Atlas 960 超节点:4096 卡、8 EFLOPS FP8、1PB HBM、RTT 2μs,官方标称支撑 10 万亿参数模型的训练与推理,对比 950 世代超节点训练 2.3 倍、推理 2.5 倍(SCMP 转述)。协议侧的基础是杨超斌特征一「协议归一,内存语义」:十余种互联协议统一为灵衢一种,RTT 从 7μs 压到 2μs,超节点内全局内存统一编址。

对位很直观。NVIDIA 的 NVLink 域停在单机架:NVL72 由 spine 与 switch trays 构成 72 GPU 的单一域,NVLink Fusion 向第三方 XPU 开放、每颗 3.6Tb/s。华为的总线域跨柜全光、200 米,4096 卡一个编址域。域的物理边界从机架搬到了楼层,这是两家在超节点尺度上的真实差距。2μs 的意义要放在 MoE 上看:专家并行的 all-to-all 流量对往返时延敏感,通信圈进总线域内,利用率提升才有支撑。华为给出的仿真数字(出自其马尔科夫实验室):同样 10 万卡,4096 卡超节点组织相比 8 卡服务器组织,MFU 提升 2.75 倍,参照系是传统架构通信要吃掉四成以上训练时间。

fig2 · Scale-up 数据条
fig2 · Scale-up 数据条

二、Scale-out:两层多平面,一个降成本一个降时延

CloudEngine SF9300 是这张网的主角,UBG 灵衢网络交换机,全球首发。官方数字有三个:Radix 扇出高达 1024,支撑百万卡集群,对应杨超斌「模型参数向几十万亿演进」的表述。两层多平面架构把建网成本降 30%。UB 极简转发把端到端时延从 20μs 降到 11μs。可靠性设计是 LLR 链路层重传,误码与链路闪断场景微秒级重传、零丢包;官方折算,集群每年因此少损失约 100 小时业务时间。这张网同时承载灵衢语义与 RoCE 双路组网,灵衢的集群侧推荐路径是 UBoE(灵衢承载在以太网上)。边界要说清:华为没有强推灵衢一统集群域,而是让它与成熟以太网生态并行。灵衢的价值在超节点边界内兑现,集群边界暂时共存。集群尺度从 950 世代的 51.2 万卡扩到 960 世代的 100 万卡。

方案层是星河 AI 数据中心网络的整套升级:NPLB 逐包负载均衡、磐石高可靠架构 2.0、星翼数字地图 2.0、星域超融合架构。逐包均衡把调度粒度从流缩到包,代价是接收端要处理路径乱序;它解决「走哪条路」,与「网络能承受多少注入」的拥塞控制是两件事,验收要同时看吞吐、尾时延与数据正确性。NetMaster 网络智能体做到 95% 故障自动研判、分钟级定位根因。样板在中科院高能物理研究所落地,全网负载均衡带来算力效率 10% 以上的提升。标准侧,北京金融科技产业联盟联合华为等 17 家单位发布《金融数据中心网络高可用性技术规范》团体标准。

对位 NVIDIA,两张网在「多平面」上同向不同路。Spectrum-X 在 512K GPU 尺度用 8 平面×4 条 rail 换故障隔离,单平面失效时其余平面保 90% 带宽。SF9300 用两层多平面换 30% 建网成本。一个把冗余做进平面数,一个把成本做进层级数,规模与成本的两端各有取舍。

fig3 · Scale-out 成本与时延
fig3 · Scale-out 成本与时延

三、Scale-in:华为没有 DPU

五张网框架里,scale-in 是节点侧平面:节点如何进入工厂、主机的第一跳。NVIDIA 的载体是 BlueField-4 DPU,节点内的 IO 编排、安全与遥测都由这颗芯片承担,官方量化位置是 18 倍 AI 工厂服务带宽、10 倍包处理率、3 倍低延迟(引自《AI 工厂五张网》),发布名直接写明「BlueField-4 Spectrum-X scale-in 网络」。它是 Vera Rubin 七芯片系统的一员,聚合吞吐 7Tb/s。

华为在同一个位置给出了结构不同的答案:没有 DPU 中介。杨超斌特征二「多样算力,异构协同」的表述是 CPU、NPU、内存、SSD 经灵衢直接互联、去中心化平等访问。IO 编排、安全与遥测这些节点内职能被压进总线语义与 OS 组件(ubfi/ubus 等内核模块已开源进 openEuler),守门芯片的位置被整个绕开。协议级入口也已定义:灵衢 2.1 新增两档代际速率,其中 256G 档的目标是 PCIe 设备平滑接入超节点(积跬步深读文转述)。节点侧外设进入总线域,入口写在协议里。

这个平面在华为侧有两个泛化形态。鲲鹏 TaiShan 950 通算超节点用灵衢全光组网,最大 4096 个通算节点、256TB 统一内存池(4096 是通算节点数,不是 4096 颗 NPU),通算节点成建制上总线,服务 agent 高密沙箱与向量检索。Atlas 650E 风冷服务器走另一端:双机灵衢直连、16 NPU 免交换互联,官方称「两台机器像一台运行」,把万亿参数推理送到中小企业本地,是节点直连的最小形态。

两条路线的成本结构不同:NVIDIA 的节点平面每节点多一颗芯片,华为的节点平面要求所有设备都说总线语言。哪个更便宜没有公开数字,但方向分歧已经清楚:一边把节点平面做成产品,一边把节点平面做进协议。

四、AI context:agent 负载进网络拓扑,两家同季度落子

第五张网是 HC 2026 与 Hot Chips 2026 之间最有意思的互相印证。NVIDIA 那边,Vera BlueField-4 存储处理器让 agent 的上下文与 KV 访问独立成面,官方标称 2 倍存储加速,我们当时的记录是「agent 负载第一次被写进了网络拓扑的命名」。华为这边,OceanStor M900「AI 记忆存储」:经 UnifiedBus 一跳直连超节点,L3.5 层提供 PB 级 KV 缓存,单集群 64PB、聚合带宽 40TB/s(华为称业界 1.5 倍),访问时延从毫秒级降到 60μs;三芯合一(CPU、网络、盘控)绕开协议转换与 CPU 转发,单 NPU 可用的 KV 容量从 GB 级升到 TB 级,SSD 寿命提升 16 倍。

fig6 · OceanStor M900 实物(图源:华为官方新闻图,裁剪保留设备)
fig6 · OceanStor M900 实物(图源:华为官方新闻图,裁剪保留设备)

OceanStor M900 关键指标:单集群 64PB · 聚合带宽 40TB/s(华为称业界 1.5 倍)· 访问时延毫秒级→60μs · CPU·网络·盘控三芯合一 · SSD 寿命提升 16 倍

需求定调两家几乎同源。杨超斌:agent 与模型每小时交互数百次,KV Cache 远超内存、必须跨系统跨层级存储。NVIDIA 的表述是 KV 体积大、读密集、跨节点共享、与存储系统天然耦合。同一个负载特征,两种网络答案:NVIDIA 让存储侧的 DPU 就近服务这类流量、独立成面。华为让存储直接说总线语言,一跳直连、统一编址,再往上是杨超斌特征三「分级存储,全局池化」:DDR 作 NPU 的第二内存,混合介质资源池化承接激活值缓存,千亿级数千维向量检索性能翻番。代价也写在介质上:HBM、DDR、SSD 越往下一层,带宽越低、时延越高,层间差距以量级计。分层存储的全部意义,就是让每类数据落在与其访问频率匹配的介质层。

杨超斌主题演讲里的 Agentic AI 超节点集群把这四件拼在一起:鲲鹏 950、昇腾 960 超节点、OceanStor M900、星河 UBG 交换机。context 平面正在从存储系统的附属升格为网络的独立平面,两家在同一季度分别给出产品,这在一年前的产品名录里都不存在。

fig4 · AI context 分层存储
fig4 · AI context 分层存储

五、光的四条线:NPO 对 CPO,OCS 把连接变成可重构

光在这套体系里的位置高于单独一层网络:它贯穿四个平面、是它们共同的物理层基础,在华为侧分成四条线。计算侧 Hi-ONE,7.2T 单引擎。交换侧 CloudEngine XH9300,全自研 100T/51.2T NPO 交换机:3.2T OE 光引擎加光源集约化,互联部分功耗从 1000W 降到 600W(降的是互联部分,不是整机,更不能外推到整个数据中心),官方折算集群每年省下超 1000 万元电费。近封装光学省去 oDSP,光电转换时延省 180ns,单节点时延优化 26%。OE 引擎可插拔卡扣,故障修复从天级缩到小时级(官方称维护效率 10 倍);可现场更换、可热插拔、业务不中断是三个等级,目前公布的是第一级。光路侧 OptiXtrans OCS800 系列:OCS800X256 配 256 个主光端口,用 MEMS 做全光交叉连接,支持毫秒级光路重构。SF9300 决定「怎么通信」,XH9300 的 NPO 决定「高速信号怎么出芯片」,OCS 决定「哪些光端口彼此连接」,三层各管一段,OCS 把连接从固定走向可重构。两条边界要写清:毫秒级说的是改变光路所需的时间;数据包经过交换机的时延是另一回事。光路接通也不等于业务无缝继续,拥塞控制、可靠传输与任务调度仍在分组网络侧。接入侧 F5G-A,「光智共融」,全光网被定位为 AI 基础设施核心要素。

fig7 · CloudEngine XH9300 系列实物(图源:华为官方新闻图,裁剪保留设备)
fig7 · CloudEngine XH9300 系列实物(图源:华为官方新闻图,裁剪保留设备)

CloudEngine XH9300 系列关键指标:100T/51.2T NPO 交换机 · 3.2T OE 光引擎 · 互联部分功耗 1000W→600W(官方折算集群年省电费超 1000 万元)· 光电转换时延省 180ns、单节点时延优化 26% · 可插拔卡扣(官方称维护效率 10 倍)

fig8 · OptiXtrans OCS800 实物(图源:华为产品页,裁剪保留设备)
fig8 · OptiXtrans OCS800 实物(图源:华为产品页,裁剪保留设备)

OptiXtrans OCS800 关键指标:OCS800X256 · 256 主光端口 · MEMS 全光交叉连接 · 毫秒级光路重构

对位 NVIDIA 的 CPO 路线(微环调制器量产、激光器数量减 4 倍、功耗降 5 倍),华为在计算与交换两个位置都选了 NPO。分歧点是维护性:CPO 把光学部分和昂贵的 ASIC 封在一起,坏了换不起。NPO 的光引擎独立封装、可插拔。XH9300 的「可插拔卡扣、维护效率 10 倍」就是冲着这条命门给的工程答案。产业链侧,华为 7 月牵头 OPEN NPO 多源协议,OIF 的 NPO 标准已立项,这条路线之争正在进入标准组织层面。

协议与光路同节奏。灵衢 2.1 官方公布的速率代际是 224G 与 256G 两档;另有对齐以太网 200G 生态的 212.5G 兼容档,出自积跬步深读文转述。两档速率是给光路铺的协议基础。Hi-ONE 单引擎 7.2T,规范 9 月 16 日上线、产品 9 月 17 日随主题演讲亮相,前后脚。

fig5 · 光的四条线与速率三档
fig5 · 光的四条线与速率三档

六、开放边界:一家厂商的注册表

治理模式是另一张对位表。NVLink 封闭自用(Fusion 定向开放),UALink 与超以太联盟多方共治。灵衢是第三种:单方开放。规范许可免费、附专利不诉承诺,但许可协议 4.2 条禁止修改、禁止衍生作品、禁止摘录用于开发其他标准:伙伴可以照规范做兼容产品,不能 fork 它。生态设施是真投入:ubfi/ubus 内核模块开源进 openEuler,openFuyao 支持 K8s 经 UB CNI/CSI/Device Plugin 接入,UBoE 作为推荐路径之一与 RoCE 并列,拓维等整机厂已按灵衢 2.0 自建超节点(积跬步深读文转述),本次大会还发布了兼容性测试规范 2.0(物理层、数据链路层、网络层测试用例)。

生态的真实刻度在灵衢社区官网的标识库里:截至 9 月 18 日,厂商注册表只有华为一家,52 条设备标识全部是昇腾 950 PR,模组标识为零。灵衢 2.0 开放一年后,注册表诚实地写着「这是一个人的联盟」;第二个出现在标识库里的厂商,就是这条开放路线通过市场检验的那一天。商用节奏落在华为云 CEO 周跃峰大会第二天公告的数字上:灵衢昇腾 950 智算集群服务 9 月 30 日国内商用、11 月 30 日海外商用。

版本线也值得记一笔:UB 1.0 随 Atlas 900 超节点在 2025 年 3 月交付、商用 300 多套。2.0 在 2025 年 9 月的 HC 2025 开放。2.1 在本届大会前一天上线,架构大版本 3.0 时间未公布。一年一个版本号,规范与产品进入同节奏演进。

七、总结与判断

本届 HC 2026 的网络发布,放进五张网坐标后呈现的完整判断如下。

判断一:华为交了四张网的答案,且用同一套协议栈。 「网络即计算架构」在华为侧不是修辞:scale-up 是总线,scale-out 是灵衢网络,scale-in 是协议入口,context 是存储直连,四个平面共享一套内存语义。NVIDIA 把仲裁换成拓扑,华为把拓扑收回到总线,两条路线解决的是同一个问题,即通用 fabric 的调度成本随规模发散。分歧在代价:五张网的代价是五套运维与采购,一张总线的代价是单方主导。

判断二:AI context 平面正在成为网络竞争的新主战场。 20% 利用率与 agent KV 压力是同源需求,NVIDIA 与华为同季度在存储侧出手,Vera BlueField-4 对 M900。2027 年网络竞争的决胜点,更可能落在存储与内存的协议化程度上,交换侧反而退居其次。

判断三:治理模式决定天花板。 灵衢「开放但禁 fork」能聚集国内整机厂,注册表只有一家厂商的当下是诚实的起点。它更像 CUDA 式引力场,离行业标准还有距离,海外扩散难度高于国内聚集难度。scale-across 半缺位(算网一体机让 WAN 参与模型执行,DCI fabric 仍空着)说明华为当下的资源投在厂内尺度,跨园区互联是留给对手的窗口。

后续关注点:灵衢昇腾 950 智算集群服务 9 月 30 日国内商用的实际落地;UB 3.0 的时间窗与架构方向;XH9300 代际与第三方采用;SF9300 是否向非灵衢客户开放销售;OPEN NPO 在 OIF 的立项进展;OCS 光路重构与任务放置能否联合调度(控制面是否真知道工作负载的通信需求);scale-across 的补位动作,是把 DCI 产品补进空着的那一格,还是把园区间留给 UBoE over 以太网。

(相关阅读:《AI 工厂五张网》《昇腾 960:制程不动,算力翻倍》《灵衢 2.1 规范解析》)