AI4S 的真正分水岭,不是有没有科学智能体,而是智能体能否持续获得低成本、可追溯、可复现的真实反馈。
本文依据截至北京时间 2026 年 6 月 25 日公开的 ISC 2026 议程、演讲摘要、六月 TOP500 榜单及同期论文和机构信息撰写。ISC 2026 于 6 月 22—26 日举行,因此不包含此后可能发布的工作坊成果。
一、ISC 2026 改写的不是榜单,而是 HPC 的价值单位
ISC 2026 官方对 HPC 的判断已经相当明确:只围绕最大机器和峰值 FLOPS 展开竞争的时代正在过去。今天的主流负载同时混合大规模模拟、AI 和数据处理,并受到能源、带宽与成本的约束;衡量价值的单位不再是某个孤立的基准测试,而是能否完成一条端到端科研工作流。
Jack Dongarra 在大会演讲摘要中进一步把这种转变概括为:HPC 的重心正从 FP64、单节点和单机系统,转向加速器、机架级系统和工作流;未来更有意义的评价维度是"时间—能耗—可信度",而所谓"有效 ZettaScale"将更多来自经过验证的混合精度算法、通信规避方法、AI 降阶模型,以及带有误差控制和不确定性量化的 AI—模拟混合工作流(ISC 2026 程序页)。
这意味着,ISC 2026 的核心议题并不是"GPU 会不会取代 CPU",而是:科学计算的最小单元,正在从一次浮点计算,变成一条生成假设、数值计算、筛选候选、实验验证和更新模型的证据流水线。
三个容易被误读的数据
首先,2026 年 6 月 TOP500 中有 276 台系统采用加速器或协处理器,占 55.2%,不是 55.4%。而且这并非"首次过半":上一期已有 255 台,占 51%(TOP500 2026 年 6 月榜单)。
其次,"81% 的 TOP500 采用 NVIDIA 技术、约 90% 的新上榜系统采用 NVIDIA 技术",不能直接理解为"81% 都使用 NVIDIA GPU"。NVIDIA 自己披露的细分数字是:238 台系统使用其 GPU,376 台使用其网络,26 台采用 Grace CPU;81% 是 GPU、网络和 CPU 等全栈技术的合并口径(NVIDIA 官方博客)。
第三,灵晟 LineShine 以 2.198 EFLOPS 的 HPL 成绩登顶,确实是首个依靠 CPU 达到持续双精度 2 EFLOPS 以上的 TOP500 系统。但所谓"纯 CPU"指它没有独立 GPU 或外挂协处理器,并不意味着它仍是传统意义上的通用 CPU。LX2 支持 SVE、SME 矩阵扩展,矩阵计算能力被集成到芯片乃至 CPU 核内部,同时配合 HBM 和针对 HPC、AI 统一优化的软件环境(TOP500 报道)。
灵晟在混合精度 HPL-MxP 上达到 7.92 EFLOPS、排名第四,低于 El Capitan 的 16.7 EFLOPS、Aurora 的 11.6 EFLOPS 和 Frontier 的 11.4 EFLOPS。这也说明,独立加速器在低精度和混合精度负载上仍有明显优势。
所以,灵晟既不是"GPU 路线失效"的证据,也不是 AI 与 HPC 可以重新分家的证据。它更像一个强烈的佐证:可以没有独立 GPU,但很难再设计一台完全不考虑矩阵计算、AI 工作负载、混合精度和数据移动的顶级超算。
从这个意义上说,HPC 在单项技术上未必"离不开 AI",但在芯片设计、软件生态、投资方向、人才结构和科研需求上,AI 已经成为无法绕开的系统变量。国内 CCF HPC China 2026 采用"超智深融"作为主题,也与这一全球趋势同频。

二、AI4S 并不是一种范式,而是三种深度完全不同的范式
Jim Gray 所提出的第四范式,是建立在理论、实验和数值模拟之后的数据密集型科学。其核心是借助数据库、工作流和计算设施,从海量科学数据中提取知识。
今天人们把 AI4S 称为"第五范式",但它并没有一个严格统一的定义。更准确地说,AI 为前四种范式增加了三种新能力:
- 学习:从数据和高精度计算中学习近似规律;
- 生成:从预测已知对象转向生成未知候选;
- 行动:调用工具、安排计算或实验,并依据反馈调整下一步。
这三种能力对应的成熟度差异极大。把 DeePMD、MatterGen、Co-Scientist 和自驱动实验室都笼统称为 AI4S,会掩盖它们面临的完全不同的验证难题。
AI4S 的发展线索可以大致概括为:AlphaFold 于 2018 年在 CASP13 中取得第一,2020 年的 AlphaFold2 被认为解决了长期蛋白质结构预测难题,2021 年方法和代码公开;Deep Potential 团队在 2020 年凭借具有第一性原理精度的亿原子分子动力学获得戈登·贝尔奖;盘古气象于 2023 年展示数据驱动天气预测的速度与精度潜力;2024 年诺贝尔化学奖把计算蛋白设计和蛋白结构预测推向科学主流;MatterGen 于 2025 年正式发表于《Nature》;到 2026 年,Co-Scientist、Robin 和 AI Scientist 开始尝试把 AI 从单一模型扩展为科研工作流中的多智能体。
需要纠正一个时间点:MatterGen 的预印本出现在 2023 年,但正式《Nature》论文发表于 2025 年。这一区别很重要,因为正式发表后的实验验证和随后出现的同行质疑,恰好构成了理解 AI4S 成熟度的一个完整案例。
三、从探索到应用:AI4S 的五个介入位置
可以用五级尺度粗略描述成熟度:
- M1:概念验证;
- M2:受限场景试点;
- M3:可重复的专业工作流;
- M4:有监控、有边界条件的生产部署;
- M5:可以跨问题、跨环境进行自主科学发现。
| 科研阶段 | AI 当前主要作用 | 2026 年成熟度 | 最大瓶颈 |
|---|---|---|---|
| 探索阶段 | 文献检索、知识整理、假设生成、实验方案草拟 | M2 | 真正的新颖性、专业推理、引用与因果错误 |
| 计算阶段 | 势函数、代理模型、降阶模型、求解器加速、天气预测 | M3—M4 | 分布外泛化、物理一致性、不确定性量化 |
| 设计阶段 | 分子、材料、蛋白和工艺参数的逆向生成 | M2—M3 | 可合成性、稳定性、多目标约束、虚假新颖性 |
| 实验阶段 | 贝叶斯优化、机器人实验、在线表征、闭环控制 | M2 | 仪器误差、隐变量、故障恢复、跨实验室复现 |
| 应用阶段 | 临床试验辅助、制造优化、监管文档和运营决策 | 工具型 M3,端到端 M1—M2 | 安全、规模化、监管、真实世界迁移 |
其中最重要的规律是:环境越数字化、反馈越快、评价指标越客观,Agent 的自主度越高;环境越物理化、反馈越慢、噪声越大、评价标准越开放,自主度越低。

四、第一层:AI 替代昂贵计算——最成熟,但不是"计算消失"
这一层的代表是机器学习势函数、代理模型、神经算子和 AI 天气预测。AI 的角色接近一种新的数值方法:用大量高精度计算或观测数据训练模型,再以远低于原始求解器的成本进行推断。
DeePMD 是典型案例。2020 年戈登·贝尔奖工作使用机器学习势函数,将具有第一性原理精度的分子动力学扩展到超过一亿个原子、一天内模拟超过 1 纳秒轨迹。其突破不是抛弃 HPC,而是先用高精度计算生成可信数据,再利用 AI 把高精度规律压缩成可大规模调用的近似模型,最后仍在 Summit 超算上完成大规模并行运行。
盘古气象也是相似逻辑。论文使用 39 年全球数据训练,在所测试变量和再分析数据上取得了优于当时 ECMWF IFS 确定性预报的结果,并显著降低推断时间。
但气象领域的后续发展并不是"纯 AI 最终取代数值天气预报"。2026 年一项混合框架工作明确指出,纯数据驱动模型可能牺牲物理一致性,因此把低分辨率动力核心与神经算子结合,以较低成本提升物理一致性和长时稳定性。
这揭示了第一层 AI4S 的真实终局:不是 AI 与传统模型二选一,而是形成分工:
- 传统方程和高精度计算提供物理约束、训练数据和校准基准;
- AI 提供速度、尺度和参数空间覆盖;
- HPC 负责训练、系综计算、高精度回算和不确定性量化。
这一层验证争议相对最小,因为通常存在 DFT、PDE 求解器、观测数据或实验结果作为比较基准。真正的瓶颈是:当 AI 给出数百万个结果时,高精度回算和实验验证能力是否跟得上。
五、第二层:AI 直接设计——候选生成已经成熟,"发现"仍未成熟
当 AI 从预测属性转向"给定目标,直接生成结构",问题的性质发生了变化。
传统高通量筛选是在已知数据库或枚举空间中寻找对象;生成式模型则试图建立从目标属性到候选结构的逆映射。这显著扩大了搜索空间,也放大了新颖性、可合成性和验证方面的风险。
MatterGen:一条完整的验证漏斗
MatterGen 针对每个目标体积模量生成了 8192 个候选,经过新颖性、稳定性、声子和元素条件等多轮过滤,缩减到 75 个;专家再从中选择 4 个进行实验,最终成功合成 1 个候选。论文报告其实验估计属性与目标值相差不超过约 20%。
这个结果既值得肯定,也必须准确解读:
- 它证明生成模型可以进入真实材料实验;
- 但它并不等于生成结构可以直接变成材料发现;
- 整个漏斗仍高度依赖 DFT、其他机器学习模型、专家检查和实体实验;
- 从大量生成候选到成功合成,损耗非常明显。
2026 年发表在《Materials Horizons》的一篇同行评议文章进一步提出,MatterGen 用于实验验证的 TaCr₂O₆ 可能对应一个早在 1971 年就已报道、并存在于训练数据中的无序相,因此不应被视为真正的新化合物。
这项质疑不是对 MatterGen 整体能力的最终否定,却暴露出一个极有价值的问题:"模型生成了未见过的有序结构""实验合成了某个相"和"发现了真正的新材料",是三个不同的科学命题。
验证不能只回答"性质是否接近目标",还要分别回答结构是否新颖、无序相是否已知、实验产物是否与预测结构一致,以及结论能否被独立重复。
CuspAI:300 万亿不是结果,20 个也不是结果
CuspAI 与 Kemira 在 2026 年公布的项目,从大约 300 万亿种潜在结构中生成超过 5000 个设计,再缩减到约 20 个优先候选,历时约六个月。但官方措辞是这些候选"进入进一步开发和测试",并非已有 20 个材料完成实验验证或达到工业应用。
因此,评价生成式 AI4S 项目时,不能只看搜索空间有多大、生成多少结构,而应看候选漏斗:有效发现率 ≈ 生成吞吐 × 真阳性率 × 验证吞吐 × 转化成功率。AI 已经大幅提升第一个因子,但第二、第三和第四个因子仍受实验能力、物理模型和工程条件支配。
六、第三层:AI 自己跑科研闭环——已进入"半自主",尚未成为通用发现引擎
这一层的目标不再是提供一个预测模型或一组候选,而是让 Agent 自己执行:检索文献 → 提出假设 → 安排计算或实验 → 分析结果 → 修改假设。
在边界清晰的实验中,闭环已经能够工作
芝加哥大学的自驱动物理气相沉积系统,在银薄膜目标实验中平均约 2.3 次尝试即可达到目标,整个原型系统成本低于 10 万美元。研究团队也明确把它称为原型,下一步才是扩展到更复杂材料。
这里能够取得较高自主度,是因为实验具有几个有利条件:控制参数相对有限,表征速度较快,目标函数可计算,实验失败成本也相对可控。
在生命科学中,当前主流仍是"Agent+人类湿实验"
Google Co-Scientist 使用多智能体生成、批评和改进假设,并在药物再利用、靶点发现和抗生素耐药机制等三个生物医学方向进行验证,其中部分白血病药物组合经过了体外实验。
FutureHouse 的 Robin 可以联合文献检索和数据分析智能体,生成假设、提出实验、解释结果并更新假设;但论文将其准确称为"半自主"系统。其关于年龄相关性黄斑变性的候选药物仍通过人类执行的体外实验进行确认。
这类系统真正的新意,不是让大模型取代实验员,而是让 AI 开始跨越过去相互割裂的几个环节。Agent 负责组织流程,但物理实验仍是不可替代的现实接口。
纯数字科研可以更自主,但"能写论文"不等于"会做科学"
Sakana AI Scientist 的 2026 年《Nature》论文显示,三篇自动生成论文中有一篇达到 ICLR 工作坊的接受门槛。不过,研究团队在各阶段人工筛选了最有希望的输出;没有一篇达到 ICLR 主会标准,论文也报告了想法浅薄、实现错误、实验错误和虚假引用等失效模式。
另一项 2026 年工作 ERA 在可自动评分的科研和工程任务上表现突出,其关键前提正是任务具有明确的质量指标,可以把代码执行结果直接反馈给树搜索。
两者共同说明:当前 Agent 的上限往往不是由"语言能力"决定,而是由有没有一个可靠的反馈裁判决定。代码能否运行,可以自动判断;Kaggle 分数是否提高,可以自动判断;DFT 能量是否下降,可以自动计算;但一个生物学假设是否真正新颖、一个材料是否具有工业价值、一个临床结果是否具有因果意义,很难由单一函数评分。
上海人工智能实验室在其自建评测中,由 10 个领域的 100 位科学家出题,前沿模型在通用科学推理上约得 50 分,而在专项文献检索和具体实验设计等专业任务上约为 15—30 分。该数字不能视为全行业统一基准,但可以作为当前"通用表达能力远高于稳定专业推理能力"的一个信号。
所以,2026 年较准确的判断是:科学 Agent 已经是科研效率放大器和工作流协调器,但还不是可以独立承担科学真实性责任的通用发现引擎。
七、真正的瓶颈正在从算力缺口转向"验证缺口"
AI4S 的基本矛盾是:生成成本下降的速度,远快于验证成本下降的速度。
过去科学家可能只能提出几十个候选,验证能力尚可匹配。生成模型可以在很短时间内提出数十万、数百万甚至更多候选,但高精度模拟、合成实验、动物实验、临床试验和跨机构复现,并不会以同样速度扩张。
这会形成一种"验证债务":系统产生的待验证主张越来越多,而有能力把主张转化为可靠知识的资源增长缓慢。
第一层:数值真实性
对于势函数、天气模型和代理求解器,可以用 DFT、传统数值求解器或历史观测进行比较。问题主要是高精度基准昂贵、分布外情况难覆盖,以及误差是否得到正确校准。
第二层:物理真实性
对于材料、分子和工艺设计,需要回答"能不能做出来""做出来的是否是预测对象""性质是否稳定""不同设备和实验室能否重复"。MatterGen 的后续争议表明,属性验证、结构识别和新颖性审计必须分别完成。
第三层:转化真实性
一个分子能结合靶点,不代表它可以成为药;一个材料有理想模拟性质,不代表它可以低成本量产;一次实验成功,也不代表在真实环境中可长期运行。
制药领域尤其能够说明这一点。FDA 表示,2016—2023 年间已处理超过 500 份包含 AI 组件的申报材料;2026 年发布的良好 AI 实践原则强调风险分级、明确使用情境、数据治理、性能评估和全生命周期管理。
2025 年发表的 rentosertib 研究完成了生成式 AI 所发现靶点和小分子的首个多中心、双盲、随机、安慰剂对照二期临床试验,这是重要进展,但仍不等于完成药物全程获批。
FDA 于 2025 年 12 月资格认定首个 AI 药物开发工具 AIM-NASH,应用于临床试验中的肝脏组织学评分;但它是开发工具,不是 AI 发现的新药,而且最终判读仍由病理学家负责。
因此,"AI 已经进入 FDA 监管流程""AI 工具获得资格认定""AI 发现的药物进入二期临床"和"AI 端到端发现的新药获批"是四个不同的里程碑。

八、HPC 的新角色:不是答案生成器,而是证据引擎
在传统范式里,HPC 主要负责求解一个给定的问题;在 AI4S 范式里,HPC 将承担至少五种角色。
第一,生产高质量真值。 第一性原理计算、高分辨率模拟和大规模数字孪生,为 AI 提供训练标签,也负责检查 AI 在未知区域的输出。
第二,训练和运行专业模型。 AI4S 不只需要大语言模型,还需要势函数、神经算子、图模型、多模态科学模型和领域基础模型。
第三,执行搜索、系综和不确定性量化。 一个 AI 给出的最优候选通常并不足够。科研需要大量扰动、敏感性分析、多模型交叉验证和置信区间。
第四,连接 Agent 与实验设施。 未来 HPC 中心不只是作业队列,而会同时调度模拟、数据库、AI 推理、实验仪器、边缘设备和机器人实验室。
第五,维护可追溯性。 记录模型版本、数据来源、参数、随机种子、计算环境、失败实验和人工修改,是验证 AI 科研结果的基础。
因此,AI4S 技术栈中更合理的分工是:Agent 是控制平面,HPC 是证据平面,实验室是现实平面,人类与独立复现是责任平面。
HPC 未来仍需要 TOP500、HPL、HPCG 等硬件指标,但科研机构还应增加新的工作流指标。获得一项可信证据所需的时间、每项可信证据的能耗、每个独立验证成功结果的成本、AI 置信度与真实错误率是否匹配、跨实验室复现率——这些才是衡量 AI4S 时代 HPC 价值的标准。
九、国内外不是两条互斥路径,而是四种不同起点
美国与英国:从重大问题和前沿模型出发
AlphaFold、Co-Scientist、Robin、AI Scientist 和 CuspAI 更接近"问题驱动"路径:围绕一个高价值问题集中特定资源。其优势是容易产生高度可见的标志性成果;弱点是一个问题上的成功未必能直接迁移到另一个问题。
不过,美国也正在明显平台化。美国能源部 Genesis Mission 的目标,就是把超级计算机、实验设施、AI 系统和独特数据集连接成统一科学与安全平台。
中国:从平台、全栈工具和工程规模出发
中国 AI4S 路径较早强调平台化。鄂维南将其描述为科研从"小作坊"走向"安卓模式":在共同平台上建设物理模型与算法、高效实验表征、数据库与知识库、便捷异构算力,再由垂直团队开发具体应用。
中国路线的优势在于工程组织、平台复制、国产算力适配以及跨团队共享;潜在天花板则是平台能否持续产生类似 AlphaFold 那样被全球同行独立验证、并引发后续科学连锁反应的单点突破。
但把中美简单概括为"中国平台驱动、美国问题驱动"也不再准确。中国已有 DeePMD、盘古气象等问题级成果,美国则在建设 Genesis 这样的国家平台。双方正在向同一个终局收敛:共享平台+重大科学任务+自动化设施+可追溯验证体系。
欧洲:公共算力、协同与可信治理
EuroHPC 的 AI for Science 访问计划强调将基础模型、生成式 AI 和机器学习纳入科研工作流,同时突出伦理、公共基础设施和跨国协作。其优势不一定是最快推出一个封闭的前沿系统,而可能是建立可共享、可审计、符合公共科研规则的算力和模型环境。
日本:硬件—软件—应用共同设计
FugakuNEXT 明确定位为 AI 与模拟无缝融合的平台,并把 AI、传统模拟、自动化实验和实时数据纳入统一设计。其建设由 RIKEN、富士通和 NVIDIA 协作,并把应用协同设计和开源软件生态作为系统目标。日本路径体现的是传统 HPC 的强项:不是先买一台 AI 机器再寻找任务,而是从科学应用、体系结构、软件和能源约束同时反推系统设计。
十、四种商业模式,以及完全不同的验证压力
1. 平台型:出售"科学操作系统"
代表形态包括科学计算平台、工作流系统、模型库和工具市场。其护城河不应只是论文数量、模型数量或注册用户数,而是科研流程是否真正沉淀在平台内、数据模型和实验是否具有完整来源记录、是否能连接高精度计算和真实仪器、每次实验反馈能否反哺模型。
2. 重大问题型:用一个突破证明范式
AlphaFold 是这一模式的顶级样本。其优势是科学价值和品牌价值极高。但从商业和组织经济学看,蛋白结构预测的成功并不自动复制到催化、药物毒性或新材料。迁移到新问题时,往往需要重新获得数据、科学先验、评价函数和实验合作体系。这一模式的护城河不是通用大模型本身,而是极高密度的跨学科人才,以及对某个科学问题长期、集中的组织能力。
3. 垂直闭环型:材料、制药、化学和生物工程
这一模式把计算设计、自动化实验和产业开发连接起来。它的真正护城河通常是看上去"不够 AI"的部分:专有湿实验数据、失败实验和负结果、自动化实验设施、工艺经验、患者或真实世界数据、临床与监管执行能力。它面临最高的资本和时间压力,却也最有可能形成难以复制的"数据—实验—模型"闭环。
4. 验证基础设施型:可能被低估的新市场
随着候选生成能力过剩,独立验证本身会成为稀缺资源。未来可能出现专门提供高精度模拟、机器人实验、跨实验室复现、模型审计和监管级证据管理的基础设施。在 AI4S 中,最有价值的平台未必是生成候选最多的平台,而可能是能最快、最便宜地判断哪些候选是错的平台。
十一、未来两年最值得跟踪的四个信号
信号一:首个可清晰归因于 AI 的新药完成全程批准
2027—2028 年可以作为观察窗口。判定标准不能只是"研发过程中使用了 AI",而应至少包括:AI 对新靶点或新分子具有可追溯的关键贡献,完成关键临床试验,并获得完整上市批准。
信号二:中国出现 AlphaFold 级问题突破
判定标准不是平台有多少模型、多少工具或多少用户,而是解决一个明确而重要的科学问题,由严格同行评议发表,获得国内外独立验证,被其他研究团队广泛采用,并引发新的实验、论文和产业研究链。
信号三:自驱动实验室从原型变成可复制设施
"低于 10 万美元"是重要信号,但还不是产业成熟。更严格的标准应是同一套系统和协议在至少三个独立实验室运行,公开设备在线率、故障率、人工干预次数、单次验证成本和跨实验室结果偏差。
信号四:科学 Agent 跨过专业推理与可验证执行门槛
真正的判定标准应包括:面对分布外问题仍能正确调用工具;引用、数据和计算过程完整可追溯;知道何时拒答或请求更高精度计算;能校准自己的不确定性;实验方案经独立专家评审后具有稳定可执行性;多次运行得到一致或可解释的差异;最终结果可以被独立团队重复。
结论:AI4S 的终局不是"AI 取代科学家",而是重新划分科学劳动
截至 2026 年,最有效、也最可信的 AI4S 实践既不是单纯"传统计算+一个聊天 Agent",也不是把发现、设计和实验全部交给通用智能体。它是一套分层混合系统:
- 专业模型负责学习特定规律;
- Agent 负责规划、检索、调度和组织流程;
- HPC 负责高精度计算、训练、搜索和不确定性量化;
- 自动化实验负责提供真实世界反馈;
- 科学家负责问题定义、异常判断和责任承担;
- 独立复现负责把一次结果转化为科学知识。
在数字化、可自动评分的科研环境中,Agent 可以逐渐成为主要执行者;在材料、生命科学、临床和复杂工程中,未来相当长时间内的主流仍会是人类、HPC、领域 AI、Agent 和实验设施的协同闭环。
因此,从 ISC 2026 回看 AI4S,最重要的变化不是算力被 AI"吞并",而是 HPC 的任务发生了升级:AI 负责提出更多可能,HPC 负责把可能压成可计算证据,实验负责把证据压成物理现实,独立复现负责把现实压成科学知识。
声明: 本文依据截至北京时间 2026 年 6 月 25 日公开的 ISC 2026 议程、演讲摘要、六月 TOP500 榜单、NVIDIA 官方博客、Nature 及同行评议期刊论文、FDA 公开文件等来源撰写。不构成投资建议。文中数据截至 2026 年 6 月 25 日。
主要资料来源: ISC 2026 Conference Highlights (isc-hpc.com)、TOP500 June 2026 榜单及报道 (top500.org)、NVIDIA Blog (blogs.nvidia.com)、Nature 系列期刊(盘古气象 2023/2025;MatterGen 2025;Co-Scientist/Robin/AI Scientist 2026)、Materials Horizons (RSC Publishing 2026)、Kemira/CuspAI 合作公告、University of Chicago PME 自驱动物理气相沉积系统、FDA AI for Drug Development 指南及资格认定公告、上海人工智能实验室周伯文 AAAI 2026 演讲、EuroHPC AI for Science 访问计划、RIKEN FugakuNEXT 公开资料、CCF HPC China 2026 公开信息。
