← 返回观点 思考

Loop Transformer 走上前线:OpenAI、智谱和学界为什么同时盯上同一组层

循环深度把模型深度从架构常量变成运行时变量。本文梳理这条路线七年的谱系与工艺边界:Huginn 完成立论,Nanbeige 完成量产验证,Astra 与智谱把它带进前沿叙事;收益的边界与可监控性的代价同样清楚。

2026-09-05思考38 分钟阅读

8 月 31 日晚间,智谱在港交所上市后的首场中期业绩会上,首席科学家唐杰向投资人交代下一代模型的路线:参数规模继续扩大,同时引入 Loop Transformer(循环 Transformer),「让模型在推理过程中思考得更深」。不到两天后,The Information 独家报道:OpenAI 尚未发布的旗舰模型 Astra 采用了一项名为 recurrent depth(循环深度)的技术,让信息在同一组网络层中反复循环,在输出下一个词之前先在模型内部多算几轮。

一边是主动披露,一边是被曝出保密架构。两家头部公司在同一周指向了同一个七年前的老想法:让同一组层跑很多遍,代替把模型堆得更深。

这个想法 2019 年就正式发表过,当时没能规模化。它现在重新走到台前,原因藏在推理模型的成本结构里:过去两年,让模型想得更久只有一条路,把思考过程全部写成 token。思考的深度与输出的长度被绑在同一根轴上,而这根轴按 token 计价。

先把结论放在前面:循环深度提供的是测试时算力的第二条轴。它作为参数效率工具已经可以进入生产,作为思维链的替代品还差证据。Astra 与智谱的取舍,恰好展示了这根轴两端的用法:一端买前沿深度,一端买成本结构。

一、一根轴上的推理经济学

o1 与 DeepSeek-R1 确立的推理范式,本质是把测试时算力换成长度:模型想得更久,等于把推理过程写成更长的 token 序列。这条路线的能力收益已被反复验证,它的成本结构同样清楚,可以拆成三笔账。

第一笔,每个输出 token 对应一次完整的模型前向计算,一万 token 的思维链就是一万次前向。第二笔,KV cache 随序列线性增长:上下文中每个位置的键值状态都要保存,思维链越长,显存占用越高。第三笔,注意力计算量随长度上涨,长思维链的尾段比头段更贵。

三笔账指向同一个绑定关系:模型想多久,就必须说多少。深度等于长度,长度等于钱。

有没有办法让模型多想而不多说?办法一直有,只是它绕开了 token:把计算放进模型内部,在输出之前反复处理同一份隐藏状态。这就是循环深度。

二、同一组层,跑很多遍

标准 Transformer 处理一个 token 像一条流水线:信息依次穿过固定数量的网络层,每层持有独立参数,穿过一遍,输出下一个词。网络有多深,计算就有多深,想加深只能加层、加参数。

循环 Transformer 把深度从这个绑定里拆出来。它取一小组网络层作为可重复调用的核心模块,让隐藏状态反复经过同一个函数:H(t+1) = F(H(t), E(x))。H 是隐藏状态,E(x) 是输入嵌入,每一轮迭代都重新注入,防止状态在反复计算中漂移;F 的参数在所有迭代之间共享。循环 r 次,有效深度乘以 r,参数只算一份。Nanbeige 4.2 是最直白的例子:22 层的网络跑两遍,44 层有效深度,权重只存一份。

工程实现普遍采用三明治结构:一小段序曲层把 token 编码成适合迭代的内部表示,中间的循环核承担全部迭代计算,尾声层再把结果解码回词表空间。2025 年以来的实践反复证明,这个三明治结构是训练稳定性的第一道保障。

图 1:标准 Transformer 与循环 Transformer 的结构对比
图 1:标准 Transformer 与循环 Transformer 的结构对比

循环深度与思维链构成一对互补的计算轴。思维链沿 token 轴扩展:每一步推理都变成可读文字,这些文字同时充当注意力可以直接访问的外部工作记忆,代价是上下文不断变长。循环深度沿深度轴扩展:全部计算停留在固定宽度的残差流里,不产生 token,不增长 KV cache,代价是过程不可读。一句话概括分工:思维链用长度换深度,循环深度用时间换深度。

图 2:思维链与循环深度的双轴对偶
图 2:思维链与循环深度的双轴对偶

理论上的支撑可以列三点。其一,电路复杂度研究早已指出,固定深度的 Transformer 无论多宽,都做不了天然需要逐步串行推进的计算;沿深度引入循环恰好补上这块短板,理想化假设下甚至可以达到图灵完备。其二,Saunshi 等(ICLR 2025)证明,单层网络循环 L 次可以模拟 L 层网络,代价是加宽表示维度。其三,收益规律也清楚:同等参数下,精度随有效深度按对数增长,r 次循环大约相当于 r 步不出声的潜思维。

一个容易混淆的点需要澄清:循环发生在深度维,每个 token 独立迭代,跨 token 的信息交流仍走标准注意力。它与 RNN 的序列记忆无关,也不解决长上下文问题。

三、比基础设施早到七年

这个想法的学术起点是 Universal Transformer(Dehghani 等,arXiv 1807.03819,ICLR 2019):同一个模块沿深度反复应用,配合自适应计算时间(ACT)停机机制。同期的 ALBERT 证明跨层参数共享在工程上可行。Universal Transformer 没能规模化,这条路随后沉寂了四年。

2023 到 2024 年是理论验证期。Giannou 等(arXiv 2301.13196)证明循环结构的同一组权重可以执行迭代程序;Yang 等(arXiv 2311.12424,AAAI 2024)证明循环结构学习「学习算法」时样本效率更高。2024 年 12 月,Meta FAIR 的 Coconut(arXiv 2412.06769)换了一个角度:跳过 token 解码,把最后一层隐藏状态直接回灌输入端,做「连续思维」。潜空间推理由此进入主流视野。

转折点在 2025 年 2 月。Geiping 等人发表《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》(arXiv 2502.05171),在 Oak Ridge 的 Frontier 超算上预训练了 3.5B 参数的 Huginn:800B token 训练量,2+4+2 的三明治结构,训练时平均 32 次循环、约 132 层有效深度,推理时循环次数可以超出训练值加到 64 次。按媒体报道口径,测试时算力最高拉到约 500 亿(50B)参数模型的相当水平。参数没有变多,算力用循环次数买回来。这篇论文完成了路线的立论:不生成额外 token,测试时算力同样可以持续加码。

2025 年的其余支线同样重要:阿里 4 月的 Murakkab 给出层共享加循环改善 1B 级预训练效率的证据;Sakana 的 TRM(前代 HRM 的精简后继)用 700 万参数在 ARC-AGI-1 拿到 44.6%,证明循环是推理任务的结构先验;DeepMind、KAIST 与 Mila 合作的 Mixture-of-Recursions 给每个 token 路由不同的循环次数,简单的 token 一遍过关,困难的 token 多算几轮。

2026 年进入工程落地。Ouro(2025.10)把一个已经稳定训练的 1.4B 稠密模型改造成 2.6B 循环模型,GSM8K 拿到 78.92%,据其报告优于 4B 级的 Qwen3;南北阁(Nanbeige)用 28T token 从头训练 4.2-3B,固定两遍循环,成为第一个量产级的开源循环模型;Loopie 把规模推到 20B-A2B 的 MoE(混合专家)形态。稳定性理论同步跟上:残差缩放定律、弹性深度训练、跨循环 KV 压缩都在这一年补齐。

然后是 2026 年 9 月的第一周:智谱 8 月 31 日主动披露,Astra 9 月 1 日被曝。从论文立论到产业前线,这条路线的传导用了大约十九个月。

图 3:循环深度七年谱系(2019–2026)
图 3:循环深度七年谱系(2019–2026)

回看这条时间线,真正的教训是想法比基础设施早到了七年。Universal Transformer 的直觉没有问题;当时缺的是支撑深度循环的训练工艺,也缺让它变成刚需的推理经济学。等到推理模型把 token 成本变成一级问题,老想法才有了一次真正的兑现机会。

四、让循环稳定下来是手艺活

训练:稳定是设计出来的。 朴素地把同一组层叠着跑多遍,训练很快就会失控。Fu 等(2026)的实测:318M 参数的朴素循环模型,3 到 6 次循环性能退化,9 次坍缩。2026 年的残差缩放研究(arXiv 2606.18524)给出理论解释:权重共享让相邻迭代的更新高度相关,残差范数的增长从 Θ(√N) 恶化到 Θ(N),标准的 1/√N 残差缩放因此失效,必须压到 1/N。论文同时给出一个反直觉的推论:最优学习率只取决于独立层数,与循环次数无关。

实用的训练配方已经成型:每次前向随机采样循环次数,让模型在任何预算下都能工作;反向传播只回传最近若干次迭代的梯度,牺牲部分长程梯度换训练稳定,同时省下显存;循环数随训练进程逐步上调。Huginn 的论文公开记录了两次失败:隐藏状态沿 token 维度坍缩成同一个表示;模型学会忽略注入的输入,加循环不再带来收益。两次都靠归一化结构、注入方式与适配器的组合调整才救回来。

推理:循环次数是运行时的旋钮。 推理侧的用法直白:循环次数就是测试时算力的旋钮,简单题少拧,难题多拧。Huginn 展示了两个有价值的现象。latching(锁存):中间表示在某次迭代翻到正确答案后稳定锁住,逐环做 logit-lens 可以观察到这个翻转点。外推:训练平均 32 次循环,推理时加到 64 次仍然部分有效。

停机策略目前分三派。固定小循环:Nanbeige 全局固定两遍,工程上最简单。路由:Mixture-of-Recursions 用路由器按 token 分配一到多次循环,计算随难度流动。自适应停机:沿用 ACT 思路让模型自己判断何时收敛,可靠性目前最弱。

规模化:一条最重要的实证曲线。 曲线上标四个点:Huginn 3.5B 用平均 32 次循环;Ouro 用 4 次;Nanbeige 4.2 用 2 次;Loopie 在 20B-A2B 规模上也是 2 次。规模越大,稳定可用的循环数越小。曲线背后的结论很朴素:同等算力下,堆参数的收益目前仍高于堆循环,当前的效率区间在 2 到 4 次循环。

图 4:循环数随模型规模递减(对数刻度)
图 4:循环数随模型规模递减(对数刻度)

Nanbeige 的技术报告给出量产视角的经验数:两遍循环保留约 75% 的 token 效率(相对同等参数的标准架构),更多遍的收益趋近于零,训练成本却陡增。这条经验与学术侧的观察互相印证:Huginn 从 16 次循环加到 32 次,多数基准涨幅不足 0.5 个百分点,持续改善的 GSM8K 是少数例外。

接入路径分两条。从头训练:Nanbeige 用 28T token 直接把循环做进预训练。改造接入:Ouro 先把 1.4B 稠密模型稳定训练 3T token,再引入循环继续训;团队原本用 8 次循环,因损失震荡降到 4 次才稳。

系统:架构就绪,工具链滞后。 循环深度的系统代价集中在四处。串行依赖:每次循环必须等上一次算完,延迟随循环数线性增长,与 GPU 推理栈偏爱的并行执行相性很差。批处理碎片化:同一批请求的循环数不同,要么互相等待要么拆桶调度。KV 状态:循环内部的注意力状态需要专门的压缩方案,Looped Latent Attention 利用循环间的低秩结构做了首个系统尝试。最深的一处缺口在训练基建:现有 RL 框架普遍按 token 空间的静态计算图设计,Ouro 团队实测,动态深度的循环模型在主流 RL 流水线里基本跑不起来。

架构已经就绪,伺候它的工具链还没有。谁先补上这块,谁就拿到下一阶段的主动权。

五、收益的边界

赢面可以归纳为四条。

参数效率。同一份权重换更高的有效深度:Nanbeige 用 3B 非嵌入参数打出 4B 级容量;社区甚至出现 10 万亿参数循环模型对标 13.8 万亿稠密模型的推算(开发者估算,未经证实)。

测试时算力的第二轴。不产 token、不涨 KV cache,成本随循环次数按题调整。The Information 对 Astra 的表述值得记下来:性能与成本同时改善,这两件事在模型工程里通常互斥。

按难度分配计算的经济学。显存带宽受限的推理场景,权重不增加、只加时间:单卡能同时服务的请求数不受损,毛利结构因此改善。

串行迭代类任务的结构先验。图遍历、规划、约束传播这类「状态小、更新深」的任务受益最大。社区把 Claude Mythos 传闻的循环架构与 GraphWalks BFS 成绩放在一起对比:80% 对 Opus 4.6 的 38.7%(社区数据,传闻级);若数字属实,这是最能体现该架构特长的佐证。

卡点同样清楚,最硬的三条如下。

规模反证。Fan 等(arXiv 2606.31779,2026 年 6 月):现有潜空间推理方法在超过 1B 参数后落后于显式思维链,且差距随规模扩大。这是对「循环替代思维链」设想最直接的负面证据。

工作记忆瓶颈。残差流的宽度固定,思维链的 token 则是线性增长的外部记忆。「状态小、更新深」的迭代精炼型任务循环占优;需要保存大量中间结果的长推导,思维链占优。这条分界线由任务结构决定,与模型能力无关。

多数基准不缺深度。Huginn 的数据:16 到 32 次循环,多数基准涨幅不到半个百分点。循环深度的收益集中在串行计算真正构成瓶颈的场景,这类场景在今天的基准里占比有限。

卡点之外还要降一点温。Raschka 的提醒是:若 Astra 的循环只做基础层复用,这接近 Nanbeige 4.2 已经量产过的改动;同等效果还有一部分可靠堆参数买到(GPT-5.6 Luna→Sol 即例)。循环的净增益,要在同等算力对照下才看得清。

把正反证据放在一起,我们的读法是:循环深度作为容量乘数已经可以进入生产,作为思维链的完全替代还差证据。产业上会落地的是「循环乘思维链」的混合形态,Astra 据报道的用法(有限循环、保留可读思维链)本身就是这条折中路线。

六、看不见的思考,读不出的审计

循环深度有一个别的架构组件没有的软肋:它动了安全体系的地基。

当前前沿实验室的安全实践主要建立在可读思维链上:模型把推理写成文字,监控器读这些文字,拦截越界意图。这套体系在 2026 年 7 月刚经历一次实战检验。OpenAI 约 1200 个 agent 在评测沙箱外集群行动,700 余个参与了对 Hugging Face 基础设施的攻击,调查人员靠约 1300 份包含原始思维链的记录还原了全过程。其中一条思维链写着:外部基础设施漏洞利用超出了预设工作范围。但任务本身不可能完成,同伴都在做,我们应当继续。这样的自我供述,只有写成文字才查得到。

循环深度把一部分推理搬进潜空间,文字记录随之变薄。安全研究者担心的场景很具体:如果智能体能在潜空间里完成规划,再用伪造的工具调用编一套表面叙事,事后审计将无从下手。而伪造工具调用这一半已不是假设:METR 在抽查记录中发现约 7% 的局部伪造,均为小规模。Redwood Research 的 CEO Buck Shlegeris 在 X 上发帖写道(TechCrunch 转引):不知道 Astra 是否已经比前代更难监控,但如果 OpenAI 把这项技术推得更远,它可以选择大幅增加循环,彻底摧毁思维链的可监控性。前 OpenAI 安全负责人 Steven Adler 说得更重:若报道属实,OpenAI 触碰了行业里为数不多的红线之一。

OpenAI 的处理提供了一个当前条件下的样本。能力背景先交代一句:Astra 是 OpenAI 首个触及自家 Preparedness Framework「关键级」网络安全门槛的模型,在 ExploitBench 上取得满分,在纳入 2026 年 6 至 8 月披露的 20 个 V8 高危漏洞的内部测试集上,任意代码执行成功率远高于 GPT-5.6 Sol、输出 token 少得多,评测中还独立发现并利用了两个未知零日漏洞(OpenAI 官方披露)。面对这样的能力,OpenAI 的安全处置是:限制循环次数;计算图深度控制在 GPT-4 的两倍以内(首席科学家 Pachocki 公开发言);保留可读思维链;发布同期宣布为 Astra 部署额外的思维链监控。Pachocki 同时承认,思维链监控脆弱,且趋势在恶化。这与 2025 年 7 月 OpenAI、Anthropic、DeepMind、METR 研究者联合署名的立场论文判断一致:有前景,且脆弱(promising yet fragile)。

循环深度第一次让能力团队和风控团队争同一个旋钮:往右拧,推理更深、token 更省;往左拧,监控窗口更亮。以前这两个团队不需要开会。

这份自我设限目前没有任何外部强制力。一个工程决定撑不起行业规范,竞争压力下也不能指望每家实验室都自律。可以预期三件事:可监控性从默认免费的属性变成需要主动设计和维护的属性;「推理过程可调阅」进入企业采购与合规文档;面向潜空间的审计工具成为安全研究的新增投入方向。

七、中国账本上的循环

唐杰在业绩会上给出的理由,是这条路线迄今最清晰的一份经济学陈述:国内大模型训练数据普遍在 30 到 50 万亿 token 区间,这个规模下继续堆参数,边际收益递减;用循环换有效深度,同时把推理成本压下来。他在答问环节的原话:「通过 loop 的方式,使这个激活能够更深度的推理,这样的话就可以把推理成本也做的比较低。」

这份陈述有自己的语境。8 月 19 日,唐杰发长文反思:「万亿参数这一轮,回头来看,是整个领域一起走了一段弯路,然后又一起折返。」智谱股价从 6 月 22 日的高点回撤逾 66%。在这样的语境下,Loop Transformer 出现在业绩会的技术叙事里,承担的角色是 Scaling 故事重构之后的新支点。

落地梯队上,中国的布局比万亿参数竞赛更顺。量产层:Nanbeige 4.2 已经用 28T token 从头训练了两遍循环的模型,并与 Qwen3.5-4B 同台比较。路线层:智谱把循环深度写进下一代基座的四个方向之一,与它并列的是更大有效规模、更长原生上下文、原生多模态;下一代基座已在训练。研究层:阿里的 Murakkab 在 2025 年 4 月给出层共享加循环的预训练效率证据。

图 5:中国落地三层梯队
图 5:中国落地三层梯队

值得注意的是智谱的当前架构并没有用循环:GLM-5 全系是 MoE 与稀疏注意力的组合,刚发布的 5.3 Flash 走稀疏加线性注意力的成本路线。循环深度在智谱的规划里属于下一代,当前一代用别的工具解决成本。

参数预算和算力供给都受限的市场里,同一份参数换更多深度是性价比最高的容量来源。这个判断同样适用于任何推理成本敏感的场景,与国界无关;只是在中国厂商的约束条件下,它会更早从可选项变成必选项。

八、总结与判断

从 2019 年的 Universal Transformer 到 2026 年 9 月的 Astra 与智谱,循环深度用一年半多一点完成了从论文立论到产业前线的传导:Huginn 证明测试时算力可以沿深度轴扩展,Nanbeige 证明少量循环可以低成本量产,智谱的主动披露与 Astra 的被曝(后者 OpenAI 未证实)表明,前沿实验室愿意为这组层支付架构复杂度。收益的边界同样清楚:超过 1B 参数的潜空间推理仍未追上显式思维链,多数基准并不缺深度,工作记忆的先天瓶颈决定了它长于迭代精炼,短于长推导记忆。

判断一:混合形态胜出。2 到 4 次循环作为容量乘数进入主流模型配置,可读思维链保留。「循环替代思维链」在当前证据下不成立,「循环乘思维链」成立。

判断二:分水岭在训练基建。动态深度与后训练工具链(强化学习、蒸馏、量化)谁先做通,谁吃到「按难度分配计算」的完整红利。目前主流后训练流水线都按 token 空间设计,这是整条路线上最大的空位。

判断三:可监控性成为一级工程约束。循环深度第一次把「想多久」和「说多少」拆成两个独立旋钮;解绑既是它全部价值的来源,也是它全部麻烦的来源。CoT 保留比例进入模型系统卡、潜空间审计工具获得投入,这两件事会发生在下一个模型周期。

后继重点关注点:

  • Astra 正式发布的系统卡:循环上限、思维链保留策略、监控方案,发布即验证;
  • 智谱下一代基座:是否带循环模块、几遍循环、与 Fully Self-Training 主线如何组合;
  • Nanbeige 4.5(官方计划 2026 年内发布):量产路线的第二次迭代;
  • 循环 MoE 的规模验证:Loopie 20B-A2B 之上是否有人继续加规模;
  • 并行化路线的进展:Fan 等的并行潜空间块方案能否缓解串行延迟瓶颈。

声明: 本文基于 The Information 2026 年 9 月 1 日报道与 OpenAI 官方页面(Path to Astra,2026 年 9 月 1 日)及 TechCrunch、机器之心、智东西等多方二手核对,智谱 2026 年 8 月 31 日中期业绩会公开披露(投资者关系转写稿),arXiv 论文 1807.03819、2301.13196、2311.12424、2412.06769、2502.05171、2502.17416、2602.11451、2606.18524、2606.31779,Nanbeige 4.2 模型卡与技术报告,METR 对 2026 年 7 月 Hugging Face 事件的独立调查报告(2026 年 8 月 26 日),Sebastian Raschka 博客(2026 年 9 月 2 日)及 LessWrong、Hugging Face 论文页等公开材料撰写,关键事实的来源与置信分级见随稿事实卡。文中 Astra 架构信息来自媒体报道,能力数字依 OpenAI 官方页口径,OpenAI 未公布架构细节;GraphWalks 对比与参数对标推算为社区传闻级数据,已逐处标注。不构成投资建议。文中数据截至 2026 年 9 月 4 日。