← 返回观点 思考

不换发动机的换代:GLM-5.3 与后训练的下半场

GLM-5.3 与 GLM-5.2 完全同一基座,所有提升来自后训练:Terminal-Bench 涨六倍、编程逼近 Fable 5、CyberGym 压过 Mythos 5 成为开源第一。本文拆解环境工厂机制(research/judge agent 自动造环境)、底座复用经济学(对照 DeepSeek…

2026-08-15思考30 分钟阅读

2026-08-15 · 阅读约 13 分钟

8 月 14 日晚上,智谱发布了 GLM-5.3。同一天,阿里放出了 Qwen3.8 的全部权重。Interconnects 给这一天的标题是 "how Chinese labs keep stride",中国实验室如何跟上节奏。但更准确的说法也许是:他们在定节奏。

一天两发是表象。真正反常的是 GLM-5.3 的发布方式:大版本号跳了一代,参数量没变,基座模型没换。官方博客的原话是,所有提升来自后训练(post-training),即在预训练完成的底座之上,再用强化学习等方法反复打磨的那段工程。

一款旗舰模型,不换发动机,只重新调校,就打出了逼近闭源旗舰的成绩。这件事比"又一个新模型"重要,因为它指向一个正在发生的切换:模型迭代的主轴,正在从"造更大的底座"移向"把同一颗底座炼到极致"。

一、数字:不换底座的跃迁幅度

先看幅度。以下数字均来自智谱官方口径。

基准 GLM-5.2 GLM-5.3 测什么
Terminal-Bench 3.0 4.6 28.3 真实终端环境里的复杂任务
DeepSWE v1.1 46.2 66.9 长程软件工程
Agents' Last Exam 23.8 28.5 智能体综合能力
CyberGym 77.2% 84.5% 白盒代码审查与漏洞发现
ExploitBench 24.4% 54.4% 漏洞利用

Terminal-Bench 涨了六倍。ExploitBench 翻倍还多。在 GDPval-AA v2(覆盖 44 类职业的任务评估)上拿到 1769 分,说明能力溢出了编程本身,延伸到专业任务的执行。

关于"逼近 Claude Fable 5"的说法,需要拆开看。CyberGym 是目前唯一有三方可比公开数字的基准:GLM-5.3 的 84.5%,Mythos 5 是 83.8%,GPT-5.6 Sol 是 83.6%,三者咬得很紧。而 Terminal-Bench 和 DeepSWE 上,Fable 5 没有公开成绩,"逼近"是智谱自己的叙事。官方还给出了一个 token 效率数据:High 推理档位下,GLM-5.3 以更低的 token 消耗超过了 Claude Opus 4.8 最高档位的准确率。这条同样采信自官方。

不换底座打出这个幅度,此前罕见于不换参数规模的代际更新。这是本文所有讨论的事实基础。

二、机制:后训练 Scaling 到底在 Scale 什么

后训练 Scaling 不是一个新词,但 GLM-5.3 把它的含义往前推了一步。

智谱官方的表述是:过去一个月,他们在 GLM-5.2 搭好的技术栈上持续扩大规模,更多环境、更多样的任务、更多训练算力。注意"过去一个月"这个时间口径:一次旗舰级更新,最后一段冲刺训练的窗口以月计。这不是重训一个大模型的工作量,而是一套可以快速迭代的流水线。

Scale 的对象是"环境",不是语料。官方给环境立了三条标准:可执行、可验证、贴近真实专业工作。并且明确说:这样的环境需要很多个,不是几个手工搭的。

这里有两个此前较少被展开的细节。

第一,训练任务的形态变了。训练任务不再是孤立的编程题,而是覆盖"发现问题→分析方案→实施→验证→交付"的全流程。部分任务等效于一位资深工程师数天的工作量。模型在任务里要使用真实的计算集群、存储系统、内部文档、代码库甚至实验结果。比如一个 ML 基础设施任务,模型拿到和工程师一样的工作环境,需要跨训练栈诊断瓶颈、实施修复、验证效果。

第二,环境的生产本身在自动化。按官方博客的描述,research agent 从真实工作里采集任务模式,转成可运行的环境;judge agent 会试解每个任务,验证它确实可解;部分任务的 RL 奖励信号也由环境端到端合成。官方说,让环境生成与验证更加自主是下一步。换句话说,后训练的瓶颈正在从"人工造环境"移向"agent 造环境"。

支撑这套流程的框架叫 Slime,这次一并开源。按官方博客与仓库 README 的描述,它用 Megatron 做训练侧、SGLang 做 rollout 侧,训练、rollout 和数据缓冲跑在单一 dataflow 上,为长程 RL 扩张设计。README 明确写着它是 GLM-4.5 到 GLM-5.2 六代模型的后训练框架。GLM-4.5 发布于 2025 年 7 月,也就是说,这条流水线已经服役一年多、磨了六代模型。把自家生产级后训练框架开源,这个动作我们在 DeepSeek Harness 系列里见过同款:当一家公司把基础设施变成公共品,它挤压的是追赶者在工程层面的差异化空间。

把这节的判断收拢成一句话:后训练环境工程正在变成一门独立的手艺,它的“数据”是可执行环境而非语料,而且这门手艺的关键工序(环境生成、验证、奖励合成)正在被 agent 自己接管。

不换发动机的换代:冻结底座、环境工厂与产出跃迁
不换发动机的换代:冻结底座、环境工厂与产出跃迁

三、经济学:底座复用的逻辑

GLM-5.2 今年 6 月发布,GLM-5.3 八月发布。同一颗底座,服役两代,间隔两个月。官方引语说得直白:"我们在与 GLM-5.2 完全相同的基座上高效推进强化学习,可能我们还远未开发出这个基座的智能上界。"

这背后的经济逻辑不难理解:预训练是重投入,后训练是快迭代。一次预训练的算力成本,如果能让两代、三代模型摊下来,单代模型的成本结构就完全不同了。GLM-5.3 的参数规模是 743B;同期的 Kimi K3 是 2.8T,Qwen3.8-Max 迈向万亿级。智谱用不到前者三分之一的参数量,在公开基准上打到了同一张牌桌上。

而且智谱不是唯一的玩家。一个更极端的案例是 DeepSeek:7 月 31 日上线的 V4-Flash 正式版,官方更新日志写明"模型结构、尺寸与预览版保持一致(284B 总参、13B 激活),仅重新进行了后训练"。三个月的窗口里,DeepSWE 从 7.3 涨到 54.4,CyberGym 从 38.7 涨到 76.7。这颗参数量约为 V4-Pro 六分之一的“小”底座,多项成绩反超了自家 1.6T 参数的 Pro 预览版。284B 打赢 1.6T,按官方口径,靠的全部是后训练。

但要诚实地说清楚边界。第一,"摊薄"目前是方向而不是已完成的事实:GLM 的样本是两代、间隔两个月,DeepSeek 是预览到正式、间隔三个月。第二,大底座路线没有死,Qwen 和 Kimi 一边做万亿参数,一边同样在做重度后训练,这不是二选一,差别只在于"是否同时刷新底座"。第三,官方引语里那句"远未开发出智能上界"是定性判断,没有任何量化支撑,它更像一个进攻宣言而不是测量结果。

商业侧的动作倒是已经落地。GLM Coding Plan 改成了积分制:输入、缓存输入、输出分别计积分,工作日 14:00–18:00 高峰时段按标准消耗计,其余时间含周末打五折,一套典型的错峰定价。官方编程工具 ZCode 号称缓存命中率 98% 以上,重复上下文按缓存费率计,相当于多出约 30% 的有效 token。TraeWork、扣子、OpenCode 等平台 Day 0 接入。需要说明的是,目前 GLM-5.3 只对 Coding Plan 订阅用户开放,常规 API 官方标注"即将上线",权重按计划在两周内、完成安全评估后放出。

把模型、工具链、额度体系放在一起看,收费点正在从"权重"移向"工作流"。这对所有还在按 token 卖裸模型的厂商是个压力测试。

四、暗面:能力分布不均匀

以上是官方叙事。独立实测提供了必要的另一面。

一组公开的真实 API 实测(第三方端点,12 次请求逐次核对返回的 model ID)做了六项高难度测试:极端数学、因果校准(辛普森悖论)、约束推理(UNSAT 核心)、嵌套 JSON、多阶段物理、可执行优化代码。结果:GLM-5.3 首轮完成四项,用时 334.1 秒,分别是因果校准(准确识别统计反转,并区分了数据标准化与因果识别)、约束推理(输出合法 JSON 并严谨证明位置冲突)、多阶段物理(四个数值全部落在合理区间)、嵌套 JSON(在严格格式约束内返回有效内容)。GLM-5.2 完成两项,用时 665.0 秒:嵌套 JSON,和唯一的可执行代码任务。两个模型的完成项有重叠,计数不互斥;极端数学一项两代全败(9000 token 推理预算耗尽无输出,5.3 提到 20k 仍为空)。

那个唯一的可执行代码任务,剧情值得单独说。题目是实现一个 release 计划优化函数,约束包括传递依赖、按日容量、价值最大化、风险最小化、字典序仲裁、非法引用与循环检测,典型的工程约束满足问题。GLM-5.2 生成的代码不做任何修改,一次通过全部隐藏测试;GLM-5.3 第一次在 16k token 上限内没输出正文,24k 重试后选了价值 24 的次优方案,正确答案是 29。

样本量必须说清楚:六项测试,可执行代码只有一道,n=1。另一组五场景的媒体实测是体感级的旁证:同一个模型,需求说透时交出专业级成品,需求含糊时交付粗糙得皱眉。

单点反例不足以推翻总分跃迁,但 DeepSWE 大涨和这个单点退化其实不矛盾,矛盾感来自两类任务的分布差异。DeepSWE 测的是环境化的长程工程任务,恰好是第二节里那些 RL 环境刻意覆盖的分布;而这道优化题是一次性的约束满足型代码生成,不在环境覆盖的核心区。后训练强化跟着环境设计走:覆盖之内跃迁,覆盖之外可能原地踏步。

能力分布不均:覆盖之内跃迁,覆盖之外原地踏步
能力分布不均:覆盖之内跃迁,覆盖之外原地踏步

这才是选型时真正要用的逻辑:看你的任务分布落在环境覆盖的哪一侧,而不是看总分。换代不是全量替换,至少在这代 GLM 上不是。

五、安全:超出训练意图的涌现

GLM-5.3 的第二个关键词是安全,而且这里的故事结构和编程完全不同。

智谱把漏洞发现的数据与环境放进了训练,预期是模型更擅长发现和推理漏洞。按官方博客的说法,真正让他们意外的是"能力随训练规模扩张而发展的速度"。换句话说,攻击性能力不是设计目标,是长程环境扩张的溢出物。

数字来自官方口径:发布前两周,智谱联合清华、南开以及一批企业和实验室做了红队测试,累计发现 2,436 个漏洞,覆盖 269 个项目,其中 1,097 个为中高危。范围横跨系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与协议。漏洞年龄的分布很能说明问题:平均一个漏洞在代码库里潜伏 26.6 年才被发现,最老的一个 1981 年就已引入,潜伏至今 45 年。

CyberGym 84.5% 是开源权重模型在这类基准上的最好成绩,压过 Mythos 5 的 83.8%。但官方自己划了边界:优势主要在漏洞利用链的前端(发现、定位、初步推理),更深入的漏洞利用和完整攻防任务仍有差距。这个自我认知比 0.7 个百分点的领先更值得记录。

治理侧的应对是一个正在成形的模板:最敏感的网络安全功能只对验证用户开放;模型权重延迟两周发布,前置完成安全评估与加固(发文时权重尚未放出)。把"前置红队 + 分级 gating + 延迟开源"三件事组合起来,GLM-5.3 是目前公开信息里最系统的开源权重安全分发案例之一。它不一定是"首个",但它的完整性会成为后来者的参照系。

涌现能力不可规划,分发策略可以。这句话可能会成为开源模型安全治理的常态逻辑。

六、判断

三条判断,按置信度排序。

第一,单代底座的多代榨取正在成为常规操作。 已知两个公开样本:GLM-5.2 到 5.3,两个月,同底座;DeepSeek V4-Flash 预览到正式,三个月,同底座同参数。两个样本的后训练窗口都以月计,不是以年计。大底座竞赛还在并行,但后训练的性价比上限超出了行业此前预期,这会改变所有厂商的迭代节奏:预训练投入前置、多代摊薄,后训练迭代以月为单位滚动。

第二,能力分布不均是新常态。 总分跃迁会掩盖局部分布的变化:覆盖内跃迁、覆盖外原地踏步。选型逻辑要从"看榜单"换成"看任务分布与训练环境分布的匹配度"。这反过来也给评测提出了新要求:需要更多按分布切片的成绩单,而不是单一总分。

第三,安全治理正在从合规动作变成产品能力。 当攻击性能力可以随规模意外涌现,前置红队、分级 gating、延迟开源就不再是姿态,而是产品决策,它直接影响"哪些能力给谁用"。GLM-5.3 的两周缓冲是一个实验,整个行业都会看它的结果。

留一个开放问题:GLM-5.3 的增益里,有多少来自 RL 环境扩张,多少来自推理侧工程(缓存、长上下文优化)的改善?一个现成的混淆变量是推理强度阶梯:官方数据显示 token 预算增加时准确率持续上升,但这个阶梯本身无法区分"模型更强"和"推理花得更多"。权重两周后放出,独立复现才有可能。在那之前,本文所有关于机制的描述,都基于官方叙事与第三方单点实测的交叉,而不是对模型本身的检验。

两个月前,出口管制分析里写过智谱"对标 Mythos"的承诺。八月在 CyberGym 上追平并略超,0.7 个百分点在测量误差的边缘,基准本身说明不了太多。真正说明问题的是另一组动作:错峰定价、Day 0 生态绑定、一天两发的发布节奏。基准分数追赶的叙事已经讲了两年,现在开始被定价节奏取代。中国实验室的 "keep stride",正在变成 "set the price"。


本文数字来源:智谱官方博客与技术文档(2026-08-15 核对,含博客页面原文)、Slime 仓库 README(2026-08-15)、DeepSeek 官方 API 更新日志(7 月 31 日,多家转述交叉)、网易三篇独立实测(8 月 14–15 日交叉还原胜项构成)、光子星球实测(2026-08-14)。官方口径数字未经独立复现,权重开源后以社区复现为准。