刚刚,GPT-6 Astra背后的Loop技术全被挖出来了

PaperAgent · 人工智能

PaperAgent 2026-09-05 16:09 湖北 大家好,我是PaperAgent,不是Agent! 昨天,OpenAI 正式发布了 GPT-6 Astra ,今天已全量上线。同时, The Information 的一篇独家报道把它的「老底」揭了:Astra 的秘密武器,很可能是一种叫 recurrent depth(循环深度) 的架构技术。 the information报道 随后有研究者 @nrehiew_ 用一条长推把 looped transformer 技术方向的 5 篇关键论文串了起来,一起看看 GPT-6 Astra 背后到底藏着什么。 一张时间表看懂循环深度的八年 一、什么是 Looped Transformer? 普通 Transformer 的一次前向传播中,每层参数只被使用一次;而 Looped Transformer(循环 Transformer)会把同一组参数重复使用多次。 所有这些「循环」的玩法,都归于 recurrent depth 这个范畴: 整模型循环(model-loop) :把整个模型的输出隐状态重新作为输入喂回去——最经典的范式; 层块循环(block-loop) :只循环中间某一段连续的层; 逐层循环(layer-loop) :每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好; 潜变量条件化 :用某种潜在输出作为后续循环的条件。 Recurrent Depth 架构示意 最关键的一点: 循环结构是固定的、预先配置好的——每个 token 获得完全相同的计算量 。这与「想多久算多久」的自适应计算形成对照。 二、一切的源头:Universal Transformers Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广:它把 Transformer 的可并行性、全局感受野,与 RNN 的 循环归纳偏置(recurrent inductive bias) 结合起来——同一组参数在时间步(深度方向)上反复应用。 Universal Transformer 结构图 UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。 为什么它重要 :UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 的所有工作,思想源头都可以追溯到这里。 三、定名之作:Scaling up Test-Time Compute with Latent Reasoning 如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是 直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作 。The Information 报道中 Astra 使用的技术,名字正出自这里。 3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」 主流推理模型(o 系列、R1 系列)靠 生成更多 token 来扩展测试时计算——思维链越长,算得越多。这篇论文走了一条完全不同的路: 通过迭代一个循环块,在测试时把网络「展开」到任意深度 ,让模型在潜在空间中隐式推理。 这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉 难以用语言表达的思维类型 。 不同循环深度下的性能 3.2 怎么训练的? 架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接; 训练时 随机采样循环次数 (用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒; 规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。 3.3 效果:3.5B 打出 50B 的等效表现 作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升, 最高可达到约 50B 参数模型的等效计算水平 ——而物化参数只有 3.5B。 性能随测试时循环次数增长 和同训练配置、同数据的非循环基线对比(下表),差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。 循环 vs 非循环基线对比 3.4 最迷人的部分:潜在空间里到底发生了什么? 这篇论文最有「科

查看原文