← 返回观点 思考

HC 2026 全景:竞争单位从芯片变成系统

华为全联接大会 2026 三天发布的全景深读:把智算超节点、通算超节点、记忆存储、互联网络、云服务与行业组合六个部件叠成一张系统图读。先划商用状态线,哪些已可买、哪些在部署、哪些只是日历,再逐层拆解计算的两条腿、集群的四个数字与一条验证链、M900 如何把存储写进执行路径、云与行业的组合交付。结论:华为交付的不是产品目录,是一套系统,竞争单位正在从单产品切换到整系统。

2026-09-22思考66 分钟阅读
HC 2026 全景:竞争单位从芯片变成系统(主图)

华为全联接大会 2026(HC 2026)9 月 17 日至 19 日在上海举行。三天的头条是昇腾 960E 超节点与百万卡集群,定调人是轮值董事长汪涛,主题演讲题为「智启新未来,打造智能世界的硅基黑土地」。

把三天的发布连起来看,头条只覆盖了故事的一部分。华为在同步推进六个部件:智算超节点(昇腾 960E)、通算超节点(TaiShan 950)、记忆存储(M900)、互联网络(星河与 OCS800)、云服务(华为云与 Stack),以及行业组合。六个部件共享同一套互联协议——灵衢 UnifiedBus,一套覆盖 NPU、CPU、内存与存储的统一内存语义规范;也共享同一张交付日历。会前一天发布的《智能世界 2035》给了一条十年尺度的需求斜率:2035 年全球将有约 9000 亿个 AI 智能体,网络流量中智能体占比超过 90%。

本站已有三块拼图:单机拆解(《昇腾 960:制程不动,算力翻倍》)、网络五平面归位(《华为的一张网:HC 2026 网络全景》)、灵衢协议分层(《灵衢是什么》)。本篇把剩下的部件补齐,把整场发布当作一套系统来读:超节点提高紧密协作效率,集群扩大算力供给,通算与记忆支撑智能体执行,云与行业方案把这些能力变成可持续运行的业务系统。竞争单位,正在从单产品切换到整系统。

fig1 · 系统全景:六个部件,一套协议,一张日历
fig1 · 系统全景:六个部件,一套协议,一张日历

一、状态线:哪些已商用,哪些是日历

对象 截至 9 月 19 日的状态 容易误读的边界
昇腾 910C 超节点 已部署超 1000 套 上一代,存量基数
昇腾 950 超节点 已规模商用 不等于 950 云服务全面可购
25.6 万卡 Atlas 950 集群 正在部署(官方 LinkedIn 表述) 部署中不是验收完成,无单作业效率公开
昇腾 960E 超节点 已发布,官方称业界首个 NPO(近封装光学)超节点,同时披露 NPO 系统正在测试 发布、测试、批量交付是不同阶段
昇腾 960DT / 960PR 2027 年第一 / 第三季度就绪 芯片节奏,不等于整机与云服务同期
昇腾 970 / 980 2028 / 2029 年,一年一代 路线图,规格未披露
950 智算集群云服务 9 月 30 日国内商用,11 月 30 日海外 「全球上线」是排期说法,当日未必可购
智果 AgentArts 海外 12 月 30 日商用 平台已有客户与未来商用不矛盾

表中的状态分四层:能买的、部署中的、已发布待验证的、路线图上的。当下能讨论的真实产业落地,是 950 与存量平台、云服务与行业方案;960E 要同时谈架构价值与工程验证进度,两者不能互相冒领。能买的部分对应采购判断,其余每一项都带着可跟踪的日期或验证节点。全文数字除特别说明外均为华为披露口径,非独立第三方测试结果。

fig2 · 商用状态阶梯
fig2 · 商用状态阶梯

二、计算:两条腿,与一个新架构

先看节奏。汪涛给出的表述是一年一代:960DT 比原计划提前三个季度,2027 年第一季度就绪;960PR 提前一个季度,2027 年第三季度就绪;2028、2029 年推出 970、980,沿「算力翻倍」(韬定律)的节奏演进,访存带宽、访存容量与互联带宽同步抬升。围绕灵衢构建的芯片系列覆盖计算、互联、存储与管理,视野不止一颗 NPU。对 960E 这代产品,要看的仍是三个能力是否同步增长:计算吞吐、数据供给、跨芯片协作。单芯片矩阵算力提高之后,模型性能能否同步提高,取决于 HBM 访问、非矩阵算子、通信与同步能否跟上。完整量产配置的微架构、单卡 TDP、最终 HBM 组合与价格均未披露,一张确定的采购规格表目前拼不出来,这部分应保留为验证项,不宜由路线图推测补齐;系统总算力除以卡数,也推不出制程、功耗、良率或成本。

与昇腾 960E 并行的另一条产品线,这次被明显加重:TaiShan 950 通算超节点。它用灵衢全光组网,支持最多 4096 个通算节点与 256TB 统一内存池,面向智能体沙箱、启动效率与向量检索(4096 是通算节点口径,不是 4096 颗 NPU)。这层产品的意义,是把「超节点」从大模型加速器的互联,泛化到 CPU 资源的组织。从智能体工作流推演:模型生成只是其中一段,代码执行、工具调用、浏览器操作、检索解析与任务编排都是通算负载,占用模式与长时间占用加速器的模型计算不同。所以它的目标不是让 CPU 看起来像 GPU,而是让大量短生命周期、状态各异的执行环境快速启动、共享资源、隔离故障,并与模型推理高效配合。基础设施的配比方法也随之改变:从「多少张 NPU 配多少台 CPU 服务器」的静态配置,转向按模型执行、工具执行、检索与数据处理的实际需求分配。边界同样要写清:统一内存池不等于统一访问性能,资源解耦不等于访问位置不再重要。比最大节点数更重要的,是四项工程验证:沙箱并发密度、启动尾时延、跨节点访问代价、故障隔离。

大会主议程之外,华为官方 LinkedIn 账号披露了 Peerium 计算架构(待正式新闻稿确认)。关键词是嵌套式 BSP(Bulk Synchronous Parallel,整体同步并行:计算分轮次推进,每轮末全局同步一次)、统一内存编址与对等互联,底层由灵衢连接 CPU、NPU、内存、SSD、网卡与交换设备。它的重点不是「百万卡像一台机器」,而是嵌套并行:把节点、超节点、集群的不同通信层次映射进同一套并行执行模型:能在局部完成的同步,不扩大到全局;通信密集的任务,留在紧密互联域内。这会牵动的不只是网络,还有编译器、运行时、集合通信、内存分配与任务放置。验证问题只有一个:它能否让应用更容易利用硬件层次,减少不必要的跨层同步。统一编址不会自动带来均匀的访问性能,也不能被读成新计算范式已经成立。

软件生态也在换挡。CANN 进入常态化开源社区运营:外部开发者占比首次达到 61%,月活开发者突破 5200 名;基于昇腾与 CANN 原生训练的模型超过 40 个,覆盖 PyTorch、Triton、vLLM、veRL 等 90 多个社区,并成为 PyTorch 官方支持的技术路线(以上均为华为披露数字)。框架数量本身说明不了什么。要看的是一组组合能否持续维护:目标模型、精度、并行方式、通信库与软件版本,以及出故障后能否正确恢复。对后训练基础设施,尤其要验证训练与 rollout 之间的权重同步、轨迹传输、版本一致性与恢复路径。框架能启动只是起点;持续迭代、故障后正确恢复,才是系统产品能力。

三、集群:四个数字与一条验证链

先看旗舰。昇腾 960E 的技术参数已经具体到系统的物理实现:单系统 4096 颗 NPU,FP8 峰值 8 EFLOPS、FP4 峰值 16 EFLOPS;正交架构、全液冷,光互联采用 Hi-ONE 近封装光引擎,单引擎传输容量 7.2 Tb/s。相比此前只有路线图的口径,这组信息把「要做什么」推进到了「准备怎么做」。

但规格不等于成熟。评价 960E 要拆成两问:架构是否合理,看互联距离、带宽组织、资源访问与软件配合;工程是否成熟,看装配、光学连接、散热、维修、备件、故障恢复与批量一致性。前者可以从设计里分析,后者只能等完整系统验证。NPO 光引擎具备量产条件,不等于 4096 卡系统完成了规模交付验证。

公开信息里的四个规模数字经常被拼成一个故事,要拆开:4096 是 960E 单系统的 NPU 数;25.6 万是正在部署的 Atlas 950 超节点集群(官方 LinkedIn 表述);51.2 万是二层 CLOS 四平面组网的扩展数字;100 万是再叠加多轨道拓扑的扩展目标。四个数字分属单系统、在建集群、组网层级、拓扑目标,拼不成「百万卡已落地」。

每向上一层,验证要求都在提高:能连接,能被管理,能运行作业,单作业有效扩展,长期稳定运行,具备经济性。发布里被引用最多的 2.75 倍 MFU 提升(4K 超节点组成的十万卡集群,对比 8 卡服务器组成的十万卡集群),标注出处是华为马尔科夫实验室仿真,并非公开的十万卡实机对比测试。它支撑架构研究,不构成选型证据。实际选型仍需要目标模型、拓扑、并行配置与故障条件下的实测。厂商叙事的可信度,取决于它提供了多少可按时点核对的证据;本站对 GLM 推理基建的拆解(《模型优化系统,系统运行模型》)用的是同一条标准。

fig3 · 集群四层与验证链
fig3 · 集群四层与验证链

四、存储:从 PB 级 KV 池,到具体的架构与介质

M900 是本轮技术含量最高的发布之一,它把「PB 级 KV 缓存」从方向落成了架构与介质设计。公开材料给出的数字分三层:单机柜 7PB 容量、10TB/s 带宽;单集群 64PB 容量、40TB/s 聚合访问带宽(华为称业界 1.5 倍);访问时延从毫秒级降至 60 微秒。三个数字分属机柜、集群、访问路径,不同配置不能按机柜数量线性外推。60 微秒也未给出消息大小、并发与尾时延条件,不能等同于应用首 Token 时延。单 NPU 可用 KV Cache 从 GB 级抬到 TB 级,典型 AI 编程场景 Token 吞吐率翻倍、首 Token 时延减半。

比容量更重要的是架构与介质。业界首创 CPU、网络、盘控三芯合一,原生 KV 语义,NPU 一跳直通 SSD,省掉协议转换与 CPU 转发。它不只是把 SSD 做得更大,而是在缩短推理引擎与缓存介质之间的数据路径。一跳不等于完全不需要 CPU 控制面,也不等于 SSD 已经变成与 HBM 等价的内存。介质侧,KV-Aware 自适应存储按 KV 数据的价值与生命周期做多模介质排布,耐久最高 24 DWPD(每日整盘写入次数,SSD 耐久指标),SSD 寿命提升 16 倍,支撑三年稳定运行。最高耐久指标还要结合介质模式、有效容量、保留条件与质保条款一起读。真正的变化在于:KV 缓存不再完全沿用长期持久数据的介质管理逻辑,而是按保留时间、复用价值与写入强度设计。

收益成立有一个前提:缓存命中后取回状态的代价,小于重新计算这些状态的代价。命中率低、复用距离短,或者取回流量挤占推理通信,再大的缓存池也带不来预期收益。

「AI 记忆」至少分三层,不能统称。执行状态层是 M900 与云侧 CMS(华为披露:PB 级记忆空间,容量较业界同类提升 1 倍,TB 级读取性能提升 50%),后者属云侧服务形态,不能未经确认就认定与 M900 完全同构;语义知识层是金融方案里的 OceanStor A800;企业数据资产层是 AI DataLake 与 DataArts。三层各有侧重:执行状态强调模型版本与可复用性,语义知识强调检索、来源与权限,企业数据资产强调治理与生命周期。三层可以共享部分基础设施,但接口定义、版本与责任边界要各自清晰,不能共用一套含混的接口。

fig4 · M900 三面板
fig4 · M900 三面板

五、光与网络:三层分工,各管一段

网络是这轮发布的另一条主线,本站已有专题拆解(《华为的一张网:HC 2026 网络全景》)。放回整张系统图,它要回答的是四层问题:超节点内部,多颗加速器与内存、存储如何紧密协同。集群层,多个超节点如何组成更大的计算系统。广域层,相距很远的算力与数据如何协同。光电工程层,高速信号如何从芯片走向链路。落到产品,三件各管一段:CloudEngine SF9300 管「怎么通信」,XH9300-EN 的近封装光学管「高速信号怎么出芯片」,OptiXtrans OCS800 管「哪些光端口彼此连接」。三者可以组合,不能互相替代。

第一件是 SF9300。华为把它定义为 100T UBG+RoCE 双模交换机,价值在于给演进留出空间:客户不必一次性替换全部网络,产品也能同时服务灵衢计算系统与现有 RoCE 环境。但要把三种能力分开:设备支持两种模式、两种模式可以同时运行、两种协议之间透明互通,是三件不同的事。不能仅凭「双模」就认定任意 RoCE 网卡能获得灵衢的全部能力、两类终端之间无需额外适配、原有应用不改就能用上统一内存语义。要追问的是:模式切换发生在整机、板卡还是端口级?混合组网的功能与性能边界在哪里?这决定它是生态产品,还是整套方案里的配套设备。

正式发布给出的关键设计是两层多平面、建网成本降低 30%、端到端时延由 20 微秒降至 11 微秒,以及应对链路闪断的链路层重传(LLR)。减少一个交换层级,有机会省下交换设备、部分光模块和转发跳数,多个平面承担并行带宽与冗余。但删掉核心层之后,其余部分不能保持不变,至少需要重新平衡四件事:交换机端口数量、服务器侧网卡数量、平面间的业务分配,以及故障后的剩余带宽。正常状态下多平面合起来达标,不等于某个平面退出后仍满足业务时延。所以评价问题不是「两层是不是比三层先进」,而是:在相同计算规模、相同无阻塞要求、相同故障冗余条件下,两层多平面减少了多少总成本?时延改善也不能直接换算成吞吐。做一个简化算例:假设无法被计算掩盖的通信占总时间 30%,即使这部分耗时下降 45%,总时间也只下降 13.5%,对应吞吐约提升 15.6%(忽略其他瓶颈的理想化计算)。实际还要看消息大小、并发、端点处理与拥塞。SF9300 应该展示的不是孤立时延数字,而是它在 MoE 专家通信、集合通信、PD 分离等场景里,减少了多少暴露在关键路径上的通信时间。LLR 的价值在把部分传输异常限制在局部修复,避免每次问题都升级为端到端超时。评估时要分别测试四类问题:瞬时异常如何重传、持续拥塞如何控制、永久断链如何改道、作业状态如何恢复,并看重传缓存、重试窗口与尾时延。

第二件是 NPO。XH9300-EN 采用自研 3.2T 光引擎,这是光引擎速率口径,不能与整机 100T 容量混在一起。NPO 的分析重点不是「用光代替电」,而是:高速电信号需要在板上走多远、经过哪些器件、在哪里转换成光。把光学转换挪到交换芯片附近,可以缩短部分高速电通道,为降低损耗、提高接口密度创造条件。最终收益取决于电接口、光引擎、封装与散热的实现,不能因为标注 NPO 就认定功耗与时延必然优于所有可插拔方案。功耗与性能数据也要看清口径:互联部分由 1000W 降至 600W,单节点时延优化 26%,覆盖的是互联部分与单节点,不能套到整台交换机,更不能套到整个数据中心。按假设测算,1000 台设备每台持续省下 400W,全年约 350 万度电,属数量级参考,非承诺。更易被低估的是维护:光学集成度提高后,维修边界可能扩大,原来换一个模块能解决的问题,可能变成换整块板卡。所以「支持现场更换」只是起点,还要继续问:更换是否需要停板、影响多少端口、光源是否共享、是否需要校准、备件成本如何。现场可更换、可热插拔、业务不中断,是三个不同等级。对 NPO 路线的评价,应落在系统总成本与可维护性上,而不是光学技术路线图上的代际排序。

第三件是 OCS800,这轮在光层的新增重点。OCS800X256 用 MEMS 做全光交叉,256 个主光口,支持毫秒级光路重构;核心是光路交叉连接,而不是逐包解析后再决定转发。长时间保持相对固定通信关系的任务,有机会通过重构光路获得更直接的连接;OCS 也可能在不同任务阶段之间调整带宽连接关系。这里有两条边界:毫秒级重构描述的是改变一条光路的时间,不是数据包经过交换机的时延。光路接通也不等于业务可以无缝继续,拥塞控制、可靠传输、端点状态与任务调度仍在分组网络侧。要验证的是:重构之后是否需要链路重新训练、通信组是否需要重建、切换窗口是否影响在线业务、控制软件是否真正知道工作负载的通信需求。由此看,OCS 的潜在差异化不在光交换盒子,而在「光路控制+任务放置+网络状态」的联合调度。

广域一侧的变化更接近「网络与模型运行时共同设计」。算网一体机的执行方式是:模型初始与最终部分在本地运行,中间部分放到远端执行,本质是把模型按层切开、跨域部署。它比普通 API 调用复杂得多:中间状态的格式、分层位置的选择、模型版本同步、远端排队与故障恢复,都要解决。三个核算提醒:本地卡数减少,不代表总成本同比例减少,只有中心通过多分支共享、批处理与更高利用率,抵消远程网络与协调成本,总体经济性才成立。通信与计算重叠执行可以隐藏等待时间,但不会自动减少需要传送的字节数。「千公里算效超过 95%」也要先问清定义(是整体吞吐、设备利用率,还是单请求时延)。做一个简化假设:光纤中光的传播速度约每秒 20 万公里,1000 公里光纤的单程传播时间约 5 毫秒、往返约 10 毫秒,这是传播本身的数量级,还没有计入绕行、设备处理、排队与重传。跨域高吞吐可以通过并发与流水线争取,单请求时延却很难接近本地。还有一条隐私边界:按层切分避免了把原始输入直接交给远端,但中间激活仍承载输入信息,「不传原文」不等于隐私已被证明。园区侧同步强调了 100 毫秒 Telemetry、DCP 与 iFlow 2.0 等观测、分析与验证能力,方向是从告警汇总走向受控修复。与之配套的,是权限限制、变更审计与回滚机制。

六、云与机电:从建成集群,到可运营的算力服务

950 智算集群云服务是日历上最近的交付(9 月 30 日国内商用,11 月 30 日海外)。它的新增价值在恢复与运营能力,不在卡型更新:全链路可观测、五级快速恢复机制,云上训练 40 天稳定运行、故障恢复 10 分钟以内,Token 吞吐提升 20%。这些信息比只公布峰值算力更接近运营实际,但要正确解释:40 天稳定运行不等于 40 天没有部件故障,恢复时间也要区分设备、进程与训练作业三层。从运营角度,有效性应拆成三项:故障后损失多少计算进度、恢复占用多少额外资源、恢复后结果是否正确。三项合在一起,才是长期有效产出。

华为云 Stack 的升级围绕面向智能体的 Next 架构展开:通智一体基础设施、AI 能力中枢、Agent 平台与全生命周期运营。落到具体技术点,主要是 NPU 池化与显存快照(适配 A5 超节点),华为披露的利用率数字由 30% 提升至 70%。分配率、设备运行时间占比、计算单元活跃率、模型浮点算力利用率是四个不同指标,70% 利用率不自动等于 70% MFU。池化与快照是否有价值,看四件事:模型启动与切换开销、碎片率、资源共享时的性能干扰、恢复后状态一致性。对多模型、多租户推理,这些可能比增加少量峰值算力更有实际价值。

Agentic Cloud 一侧,交付对象正在从虚拟机、容器、加速卡,扩展为模型服务、智能体运行环境与行业资产:智果 AgentArts 已服务 100 多家企业,海外 12 月 30 日商用。openJiuwen 开源社区 Star 超 5 万、下载超 329 万;行业 AI 梦工厂沉淀上千行业资产、落地项目超 1000 个,新增政务智能专区与 AI 硬件专区。但这并不意味着基础设施要替业务承担全部语义,更合理的分工是:基础设施保证资源与运行状态,模型平台管理执行与版本,行业应用承担业务规则和授权。

机电配套(源网荷储 AIDC)应纳入系统视野,但不能全部列为本次首发硬件:FusionPower9000 预制化供电单元、FusionCol600-L450MA 热管理单元(冗余、模块化维护、持续供冷)。AI 集群的能源与散热设计,最终不应只交付 PUE,还应交付功率受限与局部故障下的有效计算能力。验收直接连作业表现:供电切换时是否降频,冷却异常影响多大资源域,维护一个回路是否要停掉整个任务组。

七、行业:不是所有项目都要从 4096 卡起步

不是所有行业 AI 项目,都需要从 960E 和 4096 卡超节点起步。海外方案 Fintelligent AI 明确提出智能体工厂、Token 工厂、数据与知识工厂,并引入 TokeNexus 与 Financial Agentic Data。本地部署组合是三件套:Atlas 850E 承担模型推理,TaiShan 950 承担沙箱执行,OceanStor A800 承担长期记忆,分别落在推理、通算、数据三个资源位。华为披露已服务 7100 家金融客户,Top 100 银行中 54 家采用。国内「金融启元」围绕 openJiuwen 展开,新增 FAB 2.0、工程化增强、智慧金融专区与金融元枢 Token 全生命周期运营,交付覆盖平台、智能体、资产、知识、安全治理与算力。两线合看,看点在工程资产与运营机制:任务如何可靠执行,知识如何更新,调用如何计量,权限与审计如何贯穿流程。行业场景需要的是正确配比的推理、通算、数据与运行平台:高端大集群解决规模问题,行业组合解决「如何用起来并持续运行」。

医疗是 HAIC(医疗人工智能助手,Healthcare AI Copilot)联合方案与南方医院全球样板:以 HAIP 平台组织算力、数据与模型,支撑医、教、研、管四域。这里应区分承载平台、行业应用与样板发布三个层次,不宜统称。价值在于把院内数据、权限、模型与业务流程放进一套可运行环境。验收则应围绕数据可追溯、输出可核验、权限隔离与人工复核,通用问答成绩代表不了实际可用性。

制造分三条线:智慧药研(药物发现、临床研究资料与报告生成、知识组织与过程追溯)、研发工具链(从产品定义、系统、机械、软件、电路到仿真的全环节)、生产数字平台(生产、质量、设备、能源等管理对象)。大会官方索引公布了制造与大企业「七大方案、两项计划」,目前能核到具体组成的是这三条方向,其中的底层产品不全是本次首发。智慧药研的基础设施组合包含 Atlas、DCS 与存储等,并不是只能建立在下一代超大超节点上。难点在于模型能否进入已有工程工具链与生产流程,同时保留版本、审批、质量与追溯约束。这会带来大量不同于大模型训练的基础设施需求:图形与仿真任务、CPU 计算、时序数据、文档与知识检索、边缘推理,以及长期稳定的系统集成。

电力六个全球样板(巴西 CEMIG、广州白云配微协同、湖南韶山配电网、江西供用电、浙江绍兴数字换流站、辽宁电力通信网)是不同业务与部署环境下的验证资产,不是六款新硬件。从方案复制看,要分清哪些部分可以标准化(数据接入、诊断、通信管理、数字化运维),哪些仍依赖现场工程与既有系统。涉及实时控制的部分,需要独立的安全与确定性边界,不能简单让通用智能体直接接管。面向规模化行业市场,华为还随 SCALE 伙伴体系发布了企业算力引擎与 DCS AI。对广泛客户来说,这个方向可能比旗舰超节点更直接影响采购。要紧的是把明确适用场景的配置、经过验证的软件组合、性能基线、升级回滚方式、故障责任与服务边界一起交付;没有这些,同一套硬件在不同项目里仍要反复集成,方案成不了可复制产品。

八、判断

竞争单位从芯片变成系统。计算系统的组织方式正在从固定服务器扩展为多类资源协作:昇腾超节点、鲲鹏通算超节点、M900 与云平台的组合,说明华为在同时处理模型计算、工具执行与状态存储,而不是仅仅增加加速器数量。未来重要的优化对象,是完整任务链路上的资源比例与放置方式:NPU、CPU、缓存与持久数据都可能成为瓶颈,只优化一个环节不够。系统化路线的约束同样明确:六个部件缺一不可,任何一环落后都会拖累整体。

存储与网络正在进入模型执行过程。M900 提供原生 KV 访问,OCS 提供可重构光路,算网一体机让广域网参与模型分层部署。越深入执行过程,越需要清晰的接口、版本与责任划分。基础设施不能仅凭「联合优化」就把业务与设备深度绑定,而不提供升级、替换与故障恢复机制。

行业竞争正在转向可重复交付能力。平台之外,还要提供工程资产、参考架构、验证环境与服务机制。差异化不体现在选配单上,而体现在同样的业务能否以更少的集成工作、更可控的性能、更明确的故障责任交付。

对这轮发布涉及的这些能力,验收应该用同一种方式:在指定模型、数据、并发、时延与故障条件下,验证完整任务的结果,而不是分别验收各产品的最佳指标。KV 存储不只验带宽,要验减少了多少重计算;OCS 不只验切换时间,要验重构是否提高任务产出;NPU 池化不只验分配率,要验共享后的性能与隔离;行业方案不只验演示,要验升级后能否持续复现。

如果要挑本轮新增、最值得继续深研的技术点,本站选四个:鲲鹏通算超节点、Peerium 嵌套并行、OCS 光路重构、M900 原生 KV 与耐久设计。要挑近期最值得跟踪的产业落地点,也选四个:950 云服务 9 月 30 日国内正式商用、Stack 的池化与恢复能力、金融的算力—沙箱—记忆组合、企业算力引擎与 DCS AI 的标准化交付。公开发布已给出较完整的方向,但最大卡数、峰值算力、仿真收益、部署进度与正式商用结果,必须始终分开。这条路线是否成立,最终由实际工作负载证明。


信源