awesome_loop_transformer · 汇总报告

循环 Transformer 与循环深度

GPT-6 Astra 背后的 Loop 技术全景:五篇核心论文 · 六十篇相关文献 · 十条趋势洞察(2018–2026)
基于微信文章《刚刚,GPT-6 Astra 背后的 Loop 技术全被挖出来了》串起的 5 篇论文,逐篇核对原文;
arXiv 全量检索补齐 2018–2026 年约 60 篇相关工作 · 2026-09-06
github.com/asimfish/awesome_loop_transformer
视觉规范:ppt-master · technical-deepdive(blueprint)1
一页结论

三句话说清这个方向在 2026 年的位置

首胜
算力匹配下第一次赢。 Loopie-20B-A2B 在与 Qwen3-30B-A3B 复现版相同的每步墙钟时间下训练 800B token,约 600B 后反超;SMELT 在 FLOPs/参数/KV 三重匹配下省 6.8–18% 训练 FLOPs。胜利发生在"两步 · 逐层 · MoE"这个窄配置里。
2 vs 32
"循环几次"分裂成两个 regime。 预训练算力受限 → 2(Loopie、LoopCoder-v2、SMELT、Nanbeige);推理算力可变 → 越多越好但要自适应(Huginn 到 32–64)。"三次以上回退"是 PLT 并行设计的位置税,不是循环的普适上限。
超加
隐式循环 + 显式 CoT 互补。 LoopCoder-v2 在 R=2 上叠加 thinking 模式,LiveCodeBench +26.9,远超两者单独之和;LOTUS 首次在 3B 规模用潜在 CoT 追平显式 CoT,思考延迟降 2.5–6.9×。标准 GRPO 与循环模型错配(RLTT、LoopRPT)。
给工程团队的一句话:中段循环、两次、layer-loop、MoE 骨干;部署前实测延迟和 KV cache——训练算力匹配的胜利不等于推理成本匹配的胜利。
数字来源:Loop the Loopies (2607.16051) · SMELT (2609.01343) · LoopCoder-v2 (2606.18023) · LOTUS (2606.31779)2
概念

什么是循环 Transformer:同一组参数在深度上重复使用,深度与参数量解耦

model-loop(UT 2018 · Huginn 核心 · Ouro) L1 L2 L3 L1→L2→L3→L1→L2→L3(整栈输出喂回) block-loop(Huginn 三段式 · Hyperloop · Training-Free · SMELT) prelude core ×r coda 首尾层不循环,中段重复;每步重新注入输入 e layer-loop(Loopie · Training-Free layer-mode · MixerLoop) L1 ×2 L2 ×2 L3 ×2 L1→L1→L2→L2→L3→L3(每层先局部迭代再下传)

三条正交设计轴

  • 循环次数:固定(Loopie、LoopCoder-v2)/ 训练随机·推理任选(Huginn)/ 逐 token 自适应停机(ACT、MoR、Think-at-Hard、RecurTrace)
  • 训练方式:从头预训练(Huginn、Ouro、Loopie)/ 改造已有模型(Relaxed Recursive、Retrofitted Recurrence)/ 免训练(Training-Free、Program-of-Layers)
  • 目标把循环当什么:截断展开的 LM(Huginn)/ 不动点(DEQ、STARS、Attractor)/ ODE 细化(Training-Free)/ 有监督潜在 CoT(LOTUS)/ 循环步 RL(RLTT、LoopRPT)

第四种:潜变量条件化

上一轮(或上一 token)的隐状态作为条件注入——Coconut、PLT 的跨循环位置偏移(CLP)、Latent Recurrent Transformer。PLT 的 CLP 正是"两次饱和"的来源。

粒度分类沿用微信原文与 Loopie/Training-Free 的术语3
时间线

八年:从 bAbI 过拟合的补丁,到前沿架构的候选组件

橙色年份 = 微信文章的五篇核心论文4
五篇核心论文

一张表看五篇论文:各自回答一个问题,合起来是一条论证链

Universal TransformersRecurrent Depth (Huginn)Training-Free LoopedLoopCoder-v2Loop the Loopies
arXiv / 时间1807.03819 · 2018-072502.05171 · 2025-022605.23872 · 2026-052606.18023 · 2026-062607.16051 · 2026-07
回答的问题机制是什么现代规模能训成吗已有模型能白拿吗部署时循环几次算力匹配下能赢吗
粒度 / 次数model-loop · ACTblock(2,4,2) · r̄=32 任选中间 4 层 · K=3 级 RKmodel-loop(PLT) · R=2layer-loop · R=2
训练从头 ~65M从头 3.5B · 800B tok不训练 0.6B–30B从头 7B · 18T tok从头 20B-A2B MoE · 3.5T
关键数字bAbI 22.1→0.29r 4→32:ARC-E 49.1→69.945 格 87% 非负 · MMLU-Pro +2.64SWE-V 43.0→64.4→27.6~600B tok 后反超 Qwen3-30B-A3B
核心贡献定义循环深度 + 停机首次训成;隐空间轨道层 = 欧拉步;子步而非重复两步饱和的机制诊断;CoT+loop 超加Loopie Recipe;SPT
最常被误读"同样 0.8T"基线实为 0.18T收益上限约 2–3 点非单调是 PLT 特有"算力匹配"= 实测步时,非 FLOPs
论证链:UT 提出机制 → Huginn 证明可训 → Training-Free 证明可白拿并给出 ODE 解释 → LoopCoder-v2 给出部署时的循环次数与代价 → Loopie 在算力匹配下赢。
详细解读见 reports/zh/01–055
论文 01 · 2018

Universal Transformers:把 N 层换成同一层重复 T 次,再让每个位置自己决定想多久

机制

每个时间步 t 对所有位置并行:自注意力交换信息 → 位置无关的转移函数(FFN 或深度可分离卷积)。参数跨时间步共享;坐标嵌入 Pt = 位置正弦 + 时间步正弦,每步重新加入(今天所有 timestep encoding 的雏形)。ACT 停机:每位置预测停机概率,累计过阈值即冻结状态。

任务TransformerUTUT + 动态停机
bAbI 10K 联合训练(错误率 / 失败任务)22.1 (12/20)0.47 (0/20)0.29 (0/20)
LAMBADA LM 测试困惑度7321319142
WMT14 En-De BLEU(base)28.028.9
Copy / Reverse / Addition 字符准确率(训 40 测 400).53 / .13 / .07.91 / .96 / .34
2.3 → 3.8
bAbI 中需要 1 / 2 / 3 条支撑事实的问题,ACT 平均步数 2.3 / 3.1 / 3.8:模型按需分配计算

留下的三个问题

  • 参数—计算比:翻译只 +0.9 BLEU,参数主导任务吃亏(→ MoEUT、Loopie)
  • 训练不稳定(→ 截断反传、残差缩放理论)
  • 推理成本无讨论(→ PLT、MELT、LLA)
为什么重要:定义了此后所有工作的三个要素——参数共享的深度循环、每步重新注入的条件信号、自适应停机。收益集中在难样本(干扰名词越多优势越大),这个模式七年后在 Huginn 上原样重现。
Dehghani, Gouws, Vinyals, Uszkoreit, Kaiser · ICLR 20196
论文 02 · 2025-02

Huginn-3.5B:Prelude → Core ×r → Coda,随机采样循环次数、只对最后 8 步反传

Prelude P(2 层)Core R(4 层)×r · 每步注入 eCoda C(2 层)

e = P(x); s₀ ~ N(0,σ²I); sᵢ = R(e, sᵢ₋₁); p = C(s_r)

  • 输入注入:像梯度下降每步都要用数据 y;只在第一步喂 e 的迭代不可能稳定。随机 s₀ + 注入 → 路径独立。
  • 训练目标:r ~ 对数正态泊松(均值 32,重尾);只对最后 k=8 步反传,内存与 r 无关。
  • 规模:h=5280,(2,4,2),3.5B 参数;r=32 时有效深度 2+4×32+2 = 132 层。800B token,4096 块 AMD MI250X,恒定学习率 4e-5,三明治归一化。
  • 两次失败:隐状态坍缩(token 间相关度→1);循环坍缩(r=1 与 r=32 困惑度相同,模型学会忽略状态 s)。
循环 rARC-EARC-CHellaSwagMMLUSciQGSM8K CoT
449.0727.9943.4623.3980.00
865.1135.1558.5425.2992.10
1669.4937.7164.6731.2593.90
3269.9138.2365.2131.3893.5034.80 / 42.08

Table 1–2,lm-eval-harness 零样本;GSM8K CoT 为 flexible/strict,带系统提示。EMA 权重平均后 r=64 时 GSM8K flexible 47.23。

32B / 50B
"3.5B 打出 50B"是 FLOPs 等效:预训练每 token 原始 FLOPs 接近 32B 稠密模型,测试时可扩到 ~50B 的等效算力;基准分数接近 OLMo-7B、落后 OLMo-2。
Geiping, McLeish, Jain, Kirchenbauer, Singh, Bartoldson, Kailkhura, Bhatele, Goldstein · arXiv 2502.051717
论文 02 · 续

公平对照只有 0.18T token;后 620B token 学到的东西全部编码在循环里

模型TokenARC-EHellaSwagGSM8K CoT
固定深度基线(同架构过一次核心)0.18T46.4237.341.82/2.20
循环模型早期 ckpt,r=320.18T53.6248.809.02/10.24
循环模型早期 ckpt,r=10.18T34.0129.190.00/0.15
循环模型最终,r=320.8T69.9165.2134.80/42.08
循环模型最终,r=10.8T34.8929.340.00/0.00

传播误差

把 0.8T 的循环模型与 0.18T 的基线并列成"同样 0.8T"夸大了差距;论文没有 0.8T 的非循环基线。正确读法:同为 0.18T,ARC-E +7.2、HellaSwag +11.5、GSM8K ×5。

循环在哪里最有用

  • 难任务(ARC-C)收益大,事实回忆(SciQ)收益小
  • 上下文越多需要的循环越多:ARC-C 零样本 8–12 次饱和,25–50 shot 需 32 次
  • 开卷 OBQA +11.0(38.2→49.2):记的事实少,对上下文推理强

零样本免费能力

逐 token 自适应停机(KL < 5e-4,MT-Bench 5.63→5.56)· KV cache 共享(预算 4 不掉分)· 连续 CoT(用上一 token 的 s_r 热启动)· 自推测解码

隐空间里发生了什么

多数 token 收敛到不动点;数值推理 token(GSM8K 的"3")进入多维轨道;关键 token("wrong")表现为单向滑块,可能在计步;换 s₀ 轨迹形状不变(路径独立)。Lu et al. 2025 用 logit lens 只发现有限的可解释潜在 CoT 证据。

Table 4 · Figure 9–12 · Section 6–78
论文 03 · 2026-05

Training-Free Looped Transformers:一层是 ODE 的一步欧拉,正确的循环是细分步长而不是走到 t=K

关键洞察

pre-norm 层 L(x)=x+F(x) ⇔ ẋ=F(x) 上 h=1 的前向欧拉;post-loop 层是在 x(t=1) 的近似上训练的

  • 朴素循环 x←g(x) 做 K 次 = 积分到 t=K,后段层没见过 → 掉点。2 维小网络:K=2 时 MSE 0.015→2.88,K=8 时 335。
  • 子步 x←(1−1/K)x+(1/K)g(x):以 O(1/K) 逼近同一个 x(t=1)。K=8 时 MSE 1.04(约 320× 差距)。
  • 特殊 RK 表:输出 = β·g(x₀) + (1−β)·FK(x₀),β 是锚点权重(安全阀)。
  • Anderson / heavy-ball / Aitken 都不如 RK 子步 → 预训练中段不是压缩映射,是 ODE 流。

统一配方(逐格零调参)

中间 4 层窗口 · 3 级 RK · 稠密 block-mode / MoE layer-mode(block-mode 下门控每次迭代路由到不同专家 → routing thrash)· ~2 万 H100 小时

模型基准基线循环Δ pp
Qwen3-4B-InstructMMLU-Pro 5-shot57.1459.79+2.64
GPQA-Main 0-shot33.7135.71+2.01
Llama-3.2-1B-InstructGPQA-Main27.9029.69+1.79
Qwen1.5-MoE-A2.7BARC-Challenge 25-shot48.2950.60+2.30
Moonlight-16B-A3BOpenBookQA31.6032.80+1.20
DeepSeek-V2-Lite-ChatARC-Challenge57.9458.79+0.85
Qwen3-30B-A3B(事先锁定配置)CSQA / MMLU-flex78.71 / 66.6779.85 / 67.46+1.14 / +0.79
87%
45 个(模型,基准)格子非负;60% 正、27% 中性
−27.7
循环整个模型(28 层)掉 27.73 点;n=4 +0.55,n≥6 悬崖
0.5
最优窗口相对深度 0.43–0.71(>1.7B);小模型前移到 0.25–0.56
Chen, Li, Liang, Lao, Liu · UT Austin · arXiv 2605.23872 · 收益集中在知识型多选题,小蒸馏模型可能掉分9
论文 04 · 2026-06

LoopCoder-v2:在并行循环 Transformer 里,第二次循环几乎是全部——第三次开始交位置税

PLT 怎样把延迟和 KV 压平

  • 共享 KV + 门控滑窗注意力:第一轮 KV 冻结共享;后续轮 = 全局分支(冻结 KV)与局部滑窗(w=64)的逐头门控混合。KV 从 O(RLSd) 降到 O(LSd)。
  • 跨循环位置偏移 CLP:B(r) = Embed(x) + shift(h(r−1)),上一轮状态右移一位,token i 的第 r 轮可与 token i−1 的第 r+1 轮并行。延迟 ≈ 单次前向。
  • 代价:token i 拿到的是邻居的状态 → 位置错配,标准循环没有这一项。

实验协议

7B 稠密 PLT,R∈{1,2,3,4} 各自从头训练 18T token(文本:代码 1:1,100+ 语言),同一份 600 万条 SFT,训练即推理循环数;合计 100 万 GPU 小时。

7B 模型HE+LCBSWE-VMulti-SWETB-v2BFCL均值
基线 R=181.127.443.014.011.232.238.0
R=284.135.464.431.021.040.146.5
R=375.028.627.611.012.236.336.9
R=476.824.522.49.39.039.534.3

Table 2;SWE-V = SWE-bench Verified。R=2 的 64.4 超过 Kimi-Dev-72B(60.4)、Qwen3-235B-A22B(45.2),接近 Qwen3-Coder-480B(67.0)。

174.6
有效秩在第 2 轮达峰(172.5 → 158.2 递减):后续循环在收窄表示子空间
30–45×
CLP 偏移成本 Ω ≈ 常数,是第 3 轮起边际收益的 30–45 倍
+26.9
R=2 上叠加显式 CoT(Thinking):LiveCodeBench 35.4→62.3,超加
适用边界:"两次最优"是 PLT 的性质(每次 R 单独从头训练,CLP 固定税)。顺序循环的 Huginn 到 r=32 单调上升。看有效秩曲线而不是穷举训练来选循环数。
Yang et al. · 北航 / IQuest / 澜舟 / 人大 · arXiv 2606.1802310
论文 05 · 2026-07

Loop the Loopies!:layer-loop + 实测步时匹配 + 两次循环,循环 MoE 第一次在算力匹配下赢

Loopie Recipe(按实测优化器步时匹配)

  1. 参考 Qwen3-like 30B-A3B(D=2048, L=48, R=1)→ 层数减半、循环两次:种子 (2048, 24, 2)。块执行次数不变,激活内存减半(∝ s·b·D·L,随存储深度而非执行深度)。
  2. 省下的内存换每卡 micro-batch 翻倍(梯度累积减半,每步 token 不变)。
  3. 把效率增益再投资到宽度/深度,选实测步时最接近参考的候选。
配置DLR名义算力激活内存
Qwen3 30B-A3B(参考)20484811.00×1.00×
种子 Loopie20482421.00×0.50×
Loopie-20B-A2B23042721.42×0.63×

名义 FLOPs 高 42%,但 MBS 2 vs 1 使每步墙钟时间持平。作者明确:这是实测训练成本相等,不是 FLOPs 相等;推理成本未报告。

为什么 layer-loop、为什么只两次

  • 6B-A0.6B 上 layer-loop 约 1.2T token 后反超 model-loop;消融去掉 layer-loop 明显更差
  • 流水线并行友好:一层的所有循环在同一 stage 内完成,无环回依赖
  • N× 循环 vs N× 存储层(250B token):边际收益在 R=2 最大,之后快速衰减
~600B
800B token 算力匹配对照,约 600B 后反超并保持领先;4 级扩展梯全胜且差距不缩小
81.28
20B-A2B Thinking MMLU(3.5T token)vs Nemotron 3 Nano 80.52、Cascade 2 81.22(各 25T)
80.42
6B-A0.6B Thinking 的 AIME24(Ouro 2.6B:62.50);AIME25 70.83

SPT:监督预训练

SFT 的损失掩码 + PT 的优化规模(batch ≥1024、序列 ≥128K、2T token、10 epoch):预训练指标和推理指标同时上升,无过拟合、无遗忘。

Gao, Chen, Xiao, Yang, Tao, Zhou, Dai · IQuest Research · arXiv 2607.1605111
02

更广的图谱与十条洞察

arXiv 全量检索 · 约 60 篇直接相关工作 · 十个主题

12
文献图谱

十个主题:2026 年上半年每个方向都有了专门的论文

理论

表达能力 · ICL · 长度泛化

Giannou 2023 可编程计算机;Saunshi 2025 k 层×L 次 ≈ kL 层;Xu&Sato 2025 循环擅长 DAG、CoT 擅长自约化;Zhang 2026 预算律 v≈n/T

预训练

规模化

Huginn 3.5B/0.8T · Ouro 2.6B/7.7T · LoopCoder-v2 7B/18T · Loopie 20B-A2B/3.5T · Nanbeige4.2-3B/28T · SMELT 至 54B。循环数 2–4,MoE 成默认

效率

延迟 · KV · 量化

PLT 并行;扩散式采样器 5×;MELT 常数 KV;Looped Latent Attention 跨循环 KV 低秩 32×;LT2 线性注意力;LoopQ W4A4

稳定性

训练理论

残差缩放需 1/N 而非 1/√L;DeepLoop 指数 1/4→1/2;Fully Looped 稳到 12 次;STARS 谱半径正则;settling/drifting 分类

停机

自适应计算

ACT · PonderNet · MoR(NeurIPS 25)· Think-at-Hard(93% token 不循环)· LoopFormer 弹性深度 · RecurTrace 平均 2.0 次达 56.9%

改造

免训练与改造

Relaxed Recursive(逐层 LoRA)· Retrofitted Recurrence 课程 · Training-Free RK 子步 · Program-of-Layers 学跳过/重复程序

后训练

RL 与监督

RLTT 沿潜在轨迹分配奖励 +10.9% · LoopRPT 强化预训练 · LOTUS 金标 CoT 监督潜在位置追平显式 CoT · LoopMTP · SPT

可解释

动力学

轨道/滑块(Huginn)· logit lens 证据有限(Lu 2025)· 两尺度动力学 · Jacobian lens:Ouro 每轮重建工作区、Huginn 跨 16 轮携带

小模型

递归推理器

HRM 27M 解数独/ARC · TRM 7M ARC-AGI-1 45% · Attractor Models 隐式微分、均衡内化 · Denoising Recursion 超过 TRM

应用

跨模态与 agent

LoopViT 18M ARC 65.8% · RD-VLA 0%→90%、80× 加速 · 组合式工具调用随深度提升 · Nanbeige4.2-3B agentic 产品

完整清单与摘要:README · data/papers.csv · data/related_abstracts.json13
洞察 1–3

算力匹配的门已过、但门很窄;循环次数分裂成两个 regime;粒度向中间收敛

1 · 窄门里的首胜

Loopie 与 SMELT 第一次在匹配训练成本下赢,但配置极窄:MoE、layer-loop/中段、两次。Schwethelm 的扩展律解释原因——一次循环只值 r0.46 份独立参数(截断反传下 0.38),用循环换参数在 FLOPs 匹配下必输;Loopie 是用循环省下的激活内存换 micro-batch 再换宽度,理论 FLOPs 看不见这笔红利。

2 · 两个 regime

最优循环数:Loopie 2 · LoopCoder-v2 2 · SMELT 2 · Nanbeige 2 · Ouro 4 · Huginn 32(可到 64)· RecurTrace 2.0 · Think-at-Hard 在 93% token 上 1。分裂线是算力约束在哪:预训练受限 → 2;推理可变 → 按需自适应(Huginn ARC-C 随 few-shot 数从 8 次饱和到 32 次)。"三次以上回退"是 PLT 的位置税。

3 · 粒度变细、位置居中

整模型(UT)→ 三段式(Huginn)→ 逐层/中段(Loopie、Training-Free、SMELT)→ 只循环 mixer(MixerLoop 保留 41.5% 收益、省 45.9% FLOPs)。三条独立证据指向同一位置:深度分数规则 0.43–0.71(众数 0.5)、SMELT 的"中间一半"、Huginn 的首尾层特化。MoE 必须 layer-loop(routing thrash),免训练与从头训练两篇独立一致。

Loopie 2607.16051 · SMELT 2609.01343 · Schwethelm 2604.21106 · MixerLoop 2608.18230 · Training-Free 2605.2387214
洞察 4–7

ODE 流还是不动点?稳定性成了定理;推理成本被拆成三件事;循环与 CoT 互补

4 · 两种哲学分化

Training-Free:预训练中段不是压缩映射,不动点加速器都不如 RK 子步——对已训练模型顺着 ODE 流细分步长。另一支把循环训成不动点:STARS(谱半径正则)、Fixed-Point Reasoners、Attractor Models(隐式微分)。Viakhirev:settling 算子加深不变差,一个终端不动点目标就能把 drifting 变 settling;Huginn 属 non-settling,LoopCoder-v2 的 cos θ<0 震荡正是其表现。

5 · 稳定性从经验到定理

Huginn 的两次失败(2025)到 2026 年成了定理:残差缩放 ε=1/N 而非 1/√L;DeepNorm 指数 1/4→1/2;最优学习率只依赖唯一层数,可跨循环数迁移。Fully Looped 稳到 12 次,LoopMTP 到 15 次。"循环模型难训"这道 2018 年以来的障碍基本被拆除。

6 · 推理成本拆成三个子问题

延迟:PLT 并行、扩散式并行采样器 5×。KV:共享(Huginn/MoR/MELT)或压缩(LLA:跨循环 KV 低秩,32× 近无损,H200 上批容量 32→768)。量化:LoopQ。三者独立可叠加。口径警告:Loopie 的算力匹配是训练步时;推理时每 token 54 次块计算 vs 48,KV 更大,未报延迟。

7 · 互补而非替代

LoopCoder-v2 R=2 叠加 thinking:LCB +26.9 远超各自之和;LOTUS 用金标 CoT 监督潜在位置,3B 追平显式 CoT,思考延迟降 2.5–6.9×;Xu&Sato 形式化分离两者擅长的问题类。配套发现:标准 RL 与循环模型错配——GRPO 只给最终潜在状态分配 credit;RLTT 沿轨迹分配后 Ouro-2.6B 数学 +10.9%;LoopRPT 在预训练就给潜在步分配强化信号。

STARS 2605.26733 · Think Shallow 2608.18222 · 残差缩放 2606.18524 · DeepLoop 2607.13491 · LLA 2607.15456 · RLTT 2602.10520 · LOTUS 2606.3177915
洞察 8–10

循环擅长"操作"知识而非"存储";应用扩到 agent 与具身;生产化开始、工具链没跟上

8 · 能力剖面

Ouro 的对照把优势归因于知识操作而非容量;Huginn 闭卷弱、开卷 +11.0;Frey:循环帮数学、记忆库帮常识,合并才超 iso-FLOP 基线;Dual-Path 学到的门控让标点/符号/算术 token 走"深"、功能词走"宽"。最佳搭档:检索、长上下文、MoE 专家库——把存储外置。

9 · 从谜题到 agent

2025 年证据集中在数独/迷宫/ARC/GSM8K;2026 年扩到三类:软件工程 agent(LoopCoder-v2 SWE-V +21.4、Terminal-Bench 大涨)、工具调用(多步有依赖的调用随深度提升;Nanbeige4.2-3B 以 3B 超 Qwen3.5-9B)、机器人(RD-VLA 0%→>90%,比 token 推理 VLA 快 80×)。共同点:一次前向内维护中间状态与依赖。

10 · 工具链缺口

五个开源家族:Huginn、Ouro、LoopCoder-v2、Loopie、Nanbeige4.2-3B(28T token,已作为产品发布)。但复现报告显示 Nanbeige 在 HF transformers 上开箱 5 个 bug(静默置零的 RoPE 缓冲、已移除的 cache API),修复后层复用仍使注意力内存翻倍。推理框架、量化、KV 管理都没有循环模型的标准接口;Loopie 的 megatron-loopie / vllm-loopie 分支是往这个方向的信号。

Ouro 2510.25741 · Frey 2603.08391 · Dual-Path 2605.30202 · Popescu 2608.18171 · RD-VLA 2602.07845 · Halloran 2608.1398716
核对

五处被二次传播放大的说法,对照原文

常见说法原文事实
Huginn "同样 0.8T token"下循环模型碾压基线非循环基线只训了 0.18T;同为 0.18T 时循环模型 ARC-E 53.62 vs 46.42、GSM8K CoT 10.24 vs 2.20
"循环两次就够,三次以上回退"是循环 Transformer 的规律是 PLT(跨循环位置偏移)特有的现象;每个 R 单独从头训练;Huginn 到 r=32 单调上升
Loopie 与 Qwen3-30B-A3B "相同算力"相同实测优化器步时;Loopie 名义 FLOPs 高 42%,推理成本未报告;对照的是 800B token 自复现版而非官方 36T 模型
Training-Free 让开源模型"变强"收益约 1–2.6 个百分点,集中在知识型多选题;3B 以下蒸馏模型可能掉分;额外约 15–30% 推理延迟
Huginn "3.5B 打出 50B 的表现"FLOPs 等效,非基准等效;基准上接近 OLMo-7B、落后 OLMo-2-7B
方法:每条都回到原论文的表号核对(Huginn Table 4、LoopCoder-v2 Table 2、Loopie Table 1 与 §2.4、Training-Free Table 2–3)。
reports/zh 与 survey 附录 A17
推断 · 明确标注

关于 GPT-6 Astra:能核实的与不能核实的

不能核实

Astra 用了哪种循环、循环几次、如何训练——OpenAI 发布页无架构细节,The Information 报道基于匿名信源,两份原始材料本报告作者均无法访问。以下四条全部是基于公开文献的推断。

四条推断

  1. 若 Astra 用 recurrent depth,公开文献中最接近"前沿规模 + 算力匹配"的配方是 Loopie/SMELT 路线:MoE、中段或逐层、循环次数很小。整模型循环 32 次的 Huginn 路线没有前沿预算下的算力匹配证据。
  2. "OpenAI 绕过了两次饱和"这一推测前提不成立——两次饱和是 PLT 特有;真正的瓶颈是推理成本,而 KV 32× 压缩、扩散式并行采样 5× 已把它压低一个量级。
  3. 报道中的"安全担忧"对应文献里的真实问题:潜在推理无可读中间 token,探测结果依赖层与解码方式(Lu 2025、Jacobian Lens 2026),比监督 CoT 更难。
  4. Loopie(7 月)、LLA(7 月)、SMELT(9/1)与 Astra(9 月初)密集出现:更合理的解读是多个团队在 2026 上半年同时把这个方向推到可用,而非某篇论文导致某个产品。
The Information, 2026-09-02(未访问原文)· openai.com/index/gpt-6-astra(无架构细节)18
未解问题

七个还没有公开答案的问题

  • 多循环的算力匹配。 所有算力匹配的胜利都在 R=2;R≥4 能否赢没有公开证据。
  • 推理成本的完整账。 训练步时、推理延迟、KV 峰值内存需同时报告;目前没有一篇三者齐全。
  • 扩展律的函数形式。 SMELT 到 54B、Schwethelm 到 ~1B;Chinchilla + rφ 项在 100B+ 是否成立未知。
  • 自适应停机的预训练规模收益。 MoR/TaH/RecurTrace 都在 ≤8B;只有 Ouro 的熵正则深度分配在 7.7T token 验证过。
  • 潜在推理的可监督性。 LOTUS 需要金标 CoT;无 CoT 数据时如何让潜在轨迹可读、可审计,是安全层面的开放问题。
  • layer-loop 的机制。 Loopie 三个理由中只有扩展性有实验;SMELT 的"第二次访问削弱注意力沉降"是唯一机制解释。
  • 循环 vs 序列长度扩展。 Hidden Decoding(WeLM 617B)走序列维度并称更兼容流水线并行;Loopie 的 layer-loop 恰为流水线兼容而设计;100B+ 上无正面对比。
最值得做的两个空白:R≥4 的算力匹配扩展律;循环专用的 RL 目标(把 credit 分到潜在轨迹上)。
19
给从业者

三种预算下的可执行配方

零训练:已有模型

  • 中间 4 层窗口,3 级 RK 子步,β 取中间值
  • 稠密 block-mode,MoE layer-mode(先固定路由)
  • 先在知识型多选题上验证;预期 +1–2.6 pp,多 15–30% 延迟
  • 任何"某段层跑两遍"的实验都用阻尼更新 x←(1−1/K)x+(1/K)g(x)

从头预训练:前沿预算

  • MoE 骨干,layer-loop,R=2
  • 层数减半 → 激活内存减半 → micro-batch 翻倍 → 用效率增益买宽度;按实测步时匹配算力
  • SmallInit / 三明治归一化 / 残差 1/N 缩放;检查 r=1 与 r=max 的困惑度是否分开
  • 后训练:SPT(SFT 掩码 + PT 规模);RL 用轨迹级 credit(RLTT 类)

推理时可变算力

  • 顺序循环(Huginn 类)+ 训练时随机 r + 截断反传,推理任选 r
  • 逐 token 自适应停机(KL 阈值 / 二阶步长差 / 学习式停机头)
  • KV:共享预算或 LLA 低秩编码;延迟:扩散式并行采样
  • 给它检索/长上下文——循环模型的强项是对上下文推理
部署前必做:实测延迟与 KV 峰值内存;不要把"训练算力匹配"当作"推理成本匹配"。
20
仓库导航

awesome_loop_transformer:这份报告的全部材料

目录

  • README.md — awesome 列表(按主题分类,含五篇核心论文标注)
  • papers/original/ — 五篇原文 PDF;papers/zh/ — 保版式中译 + QA 报告
  • papers/src/ — arXiv HTML 全文(Markdown)
  • reports/zh | en/ — 五篇逐篇深度解读
  • reports/pdf/ — 中、英文完整报告 PDF
  • survey/zh | en/ — 趋势综述(Markdown + PDF)
  • slides/html/ — 本 HTML 演示(含 PDF 导出);slides/beamer/ — Beamer PDF
  • data/ — papers.csv、related_abstracts.json;src/generator.py 生成 README

方法与工具

  • 翻译:SuperTranslate 保版式引擎(DeepSeek 后端)+ 对象级 QA,5 篇中 3 篇 0 issue,2 篇为图内刻度/公式行的可解释误报
  • 检索:arXiv API,关键词 looped/recurrent-depth/depth-recurrent transformer、latent reasoning ∧ loop,60 篇摘要留档
  • 写作:主张先行、必要限定只写一次、数字随处可核对(anti-defensive-writing / 说人话)
  • 排版:pandoc + XeLaTeX(报告)、Beamer 16:9(学术幻灯)、本 HTML(ppt-master technical-deepdive 风格)
github.com/asimfish/awesome_loop_transformer · 欢迎 PR 补充新论文(data/papers.csv → src/generator.py)
2026-09-0621
← → / 空格 翻页 · Home / End · P 打印