awesome_loop_transformer · 汇总报告
循环 Transformer 与循环深度
GPT-6 Astra 背后的 Loop 技术全景:五篇核心论文 · 六十篇相关文献 · 十条趋势洞察(2018–2026)
基于微信文章《刚刚,GPT-6 Astra 背后的 Loop 技术全被挖出来了》串起的 5 篇论文,逐篇核对原文;
arXiv 全量检索补齐 2018–2026 年约 60 篇相关工作 · 2026-09-06
github.com/asimfish/awesome_loop_transformer
一页结论
三句话说清这个方向在 2026 年的位置
首胜
算力匹配下第一次赢。 Loopie-20B-A2B 在与 Qwen3-30B-A3B 复现版相同的每步墙钟时间下训练 800B token,约 600B 后反超;SMELT 在 FLOPs/参数/KV 三重匹配下省 6.8–18% 训练 FLOPs。胜利发生在"两步 · 逐层 · MoE"这个窄配置里。
2 vs 32
"循环几次"分裂成两个 regime。 预训练算力受限 → 2(Loopie、LoopCoder-v2、SMELT、Nanbeige);推理算力可变 → 越多越好但要自适应(Huginn 到 32–64)。"三次以上回退"是 PLT 并行设计的位置税,不是循环的普适上限。
超加
隐式循环 + 显式 CoT 互补。 LoopCoder-v2 在 R=2 上叠加 thinking 模式,LiveCodeBench +26.9,远超两者单独之和;LOTUS 首次在 3B 规模用潜在 CoT 追平显式 CoT,思考延迟降 2.5–6.9×。标准 GRPO 与循环模型错配(RLTT、LoopRPT)。
给工程团队的一句话:中段循环、两次、layer-loop、MoE 骨干;部署前实测延迟和 KV cache——训练算力匹配的胜利不等于推理成本匹配的胜利。
概念
什么是循环 Transformer:同一组参数在深度上重复使用,深度与参数量解耦
三条正交设计轴
- 循环次数:固定(Loopie、LoopCoder-v2)/ 训练随机·推理任选(Huginn)/ 逐 token 自适应停机(ACT、MoR、Think-at-Hard、RecurTrace)
- 训练方式:从头预训练(Huginn、Ouro、Loopie)/ 改造已有模型(Relaxed Recursive、Retrofitted Recurrence)/ 免训练(Training-Free、Program-of-Layers)
- 目标把循环当什么:截断展开的 LM(Huginn)/ 不动点(DEQ、STARS、Attractor)/ ODE 细化(Training-Free)/ 有监督潜在 CoT(LOTUS)/ 循环步 RL(RLTT、LoopRPT)
第四种:潜变量条件化
上一轮(或上一 token)的隐状态作为条件注入——Coconut、PLT 的跨循环位置偏移(CLP)、Latent Recurrent Transformer。PLT 的 CLP 正是"两次饱和"的来源。
时间线
八年:从 bAbI 过拟合的补丁,到前沿架构的候选组件
- 2016Neural GPU · Adaptive Computation Time:循环 + 自适应停机的前身
- 2018-07Universal Transformers(Dehghani et al.):跨时间步共享参数、坐标嵌入、ACT;bAbI 联合训练错误率 22.1 → 0.29
- 2019–2022ALBERT(共享用于压缩)· Deep Equilibrium Models · deep thinking 系列(随机展开 + 输入注入)· 路径独立均衡模型
- 2023–2024Looped Transformers as Programmable Computers · <10% 参数学会 ICL 算法 · MoEUT 首次在 LM 上略胜标准模型 · Relaxed Recursive Transformers · Coconut
- 2025-02Recurrent Depth / Huginn-3.5B(Geiping et al.):800B token 训成,定名 recurrent depth;Saunshi 证明 k 层循环 L 次 ≈ kL 层
- 2025-06–11HRM · Mixture-of-Recursions · TRM · Ouro(2.6B,7.7T token)· Parallel Loop Transformer · 扩散式并行采样器 · Retrofitted Recurrence · Think-at-Hard
- 2026-01–04LoopFormer(ICLR)· RLTT(ICML)· LoopRPT · Hyperloop · 迭代深度扩展律 φ=0.46 · Loop-Think-Generalize(COLM)
- 2026-05Training-Free Looped Transformers(UT Austin)· MELT · LT2 · LoopQ · STARS(ICML)· Attractor Models
- 2026-06LoopCoder-v2(7B PLT,18T token,"只循环一次")· 残差缩放 1/N 理论 · LOTUS · Program-of-Layers(ICML)
- 2026-07Loop the Loopies!(Loopie-20B-A2B,算力匹配首胜)· Looped Latent Attention(KV 32×)· Nanbeige4.2-3B(28T token 产品模型)· Hidden Decoding(WeLM 617B 走序列维度)
- 2026-09SMELT 扩展律(省 6.8–18% 训练 FLOPs)· RecurTrace · GPT-6 Astra 发布,The Information 报道其使用 recurrent depth
五篇核心论文
一张表看五篇论文:各自回答一个问题,合起来是一条论证链
| Universal Transformers | Recurrent Depth (Huginn) | Training-Free Looped | LoopCoder-v2 | Loop the Loopies |
| arXiv / 时间 | 1807.03819 · 2018-07 | 2502.05171 · 2025-02 | 2605.23872 · 2026-05 | 2606.18023 · 2026-06 | 2607.16051 · 2026-07 |
| 回答的问题 | 机制是什么 | 现代规模能训成吗 | 已有模型能白拿吗 | 部署时循环几次 | 算力匹配下能赢吗 |
| 粒度 / 次数 | model-loop · ACT | block(2,4,2) · r̄=32 任选 | 中间 4 层 · K=3 级 RK | model-loop(PLT) · R=2 | layer-loop · R=2 |
| 训练 | 从头 ~65M | 从头 3.5B · 800B tok | 不训练 0.6B–30B | 从头 7B · 18T tok | 从头 20B-A2B MoE · 3.5T |
| 关键数字 | bAbI 22.1→0.29 | r 4→32:ARC-E 49.1→69.9 | 45 格 87% 非负 · MMLU-Pro +2.64 | SWE-V 43.0→64.4→27.6 | ~600B tok 后反超 Qwen3-30B-A3B |
| 核心贡献 | 定义循环深度 + 停机 | 首次训成;隐空间轨道 | 层 = 欧拉步;子步而非重复 | 两步饱和的机制诊断;CoT+loop 超加 | Loopie Recipe;SPT |
| 最常被误读 | — | "同样 0.8T"基线实为 0.18T | 收益上限约 2–3 点 | 非单调是 PLT 特有 | "算力匹配"= 实测步时,非 FLOPs |
论证链:UT 提出机制 → Huginn 证明可训 → Training-Free 证明可白拿并给出 ODE 解释 → LoopCoder-v2 给出部署时的循环次数与代价 → Loopie 在算力匹配下赢。
论文 01 · 2018
Universal Transformers:把 N 层换成同一层重复 T 次,再让每个位置自己决定想多久
机制
每个时间步 t 对所有位置并行:自注意力交换信息 → 位置无关的转移函数(FFN 或深度可分离卷积)。参数跨时间步共享;坐标嵌入 Pt = 位置正弦 + 时间步正弦,每步重新加入(今天所有 timestep encoding 的雏形)。ACT 停机:每位置预测停机概率,累计过阈值即冻结状态。
| 任务 | Transformer | UT | UT + 动态停机 |
| bAbI 10K 联合训练(错误率 / 失败任务) | 22.1 (12/20) | 0.47 (0/20) | 0.29 (0/20) |
| LAMBADA LM 测试困惑度 | 7321 | 319 | 142 |
| WMT14 En-De BLEU(base) | 28.0 | 28.9 | – |
| Copy / Reverse / Addition 字符准确率(训 40 测 400) | .53 / .13 / .07 | .91 / .96 / .34 | – |
2.3 → 3.8
bAbI 中需要 1 / 2 / 3 条支撑事实的问题,ACT 平均步数 2.3 / 3.1 / 3.8:模型按需分配计算
留下的三个问题
- 参数—计算比:翻译只 +0.9 BLEU,参数主导任务吃亏(→ MoEUT、Loopie)
- 训练不稳定(→ 截断反传、残差缩放理论)
- 推理成本无讨论(→ PLT、MELT、LLA)
为什么重要:定义了此后所有工作的三个要素——参数共享的深度循环、每步重新注入的条件信号、自适应停机。收益集中在难样本(干扰名词越多优势越大),这个模式七年后在 Huginn 上原样重现。
论文 02 · 2025-02
Huginn-3.5B:Prelude → Core ×r → Coda,随机采样循环次数、只对最后 8 步反传
Prelude P(2 层)→Core R(4 层)×r · 每步注入 e→Coda C(2 层)
e = P(x); s₀ ~ N(0,σ²I); sᵢ = R(e, sᵢ₋₁); p = C(s_r)
- 输入注入:像梯度下降每步都要用数据 y;只在第一步喂 e 的迭代不可能稳定。随机 s₀ + 注入 → 路径独立。
- 训练目标:r ~ 对数正态泊松(均值 32,重尾);只对最后 k=8 步反传,内存与 r 无关。
- 规模:h=5280,(2,4,2),3.5B 参数;r=32 时有效深度 2+4×32+2 = 132 层。800B token,4096 块 AMD MI250X,恒定学习率 4e-5,三明治归一化。
- 两次失败:隐状态坍缩(token 间相关度→1);循环坍缩(r=1 与 r=32 困惑度相同,模型学会忽略状态 s)。
| 循环 r | ARC-E | ARC-C | HellaSwag | MMLU | SciQ | GSM8K CoT |
| 4 | 49.07 | 27.99 | 43.46 | 23.39 | 80.00 | – |
| 8 | 65.11 | 35.15 | 58.54 | 25.29 | 92.10 | – |
| 16 | 69.49 | 37.71 | 64.67 | 31.25 | 93.90 | – |
| 32 | 69.91 | 38.23 | 65.21 | 31.38 | 93.50 | 34.80 / 42.08 |
Table 1–2,lm-eval-harness 零样本;GSM8K CoT 为 flexible/strict,带系统提示。EMA 权重平均后 r=64 时 GSM8K flexible 47.23。
32B / 50B
"3.5B 打出 50B"是 FLOPs 等效:预训练每 token 原始 FLOPs 接近 32B 稠密模型,测试时可扩到 ~50B 的等效算力;基准分数接近 OLMo-7B、落后 OLMo-2。
论文 02 · 续
公平对照只有 0.18T token;后 620B token 学到的东西全部编码在循环里
| 模型 | Token | ARC-E | HellaSwag | GSM8K CoT |
| 固定深度基线(同架构过一次核心) | 0.18T | 46.42 | 37.34 | 1.82/2.20 |
| 循环模型早期 ckpt,r=32 | 0.18T | 53.62 | 48.80 | 9.02/10.24 |
| 循环模型早期 ckpt,r=1 | 0.18T | 34.01 | 29.19 | 0.00/0.15 |
| 循环模型最终,r=32 | 0.8T | 69.91 | 65.21 | 34.80/42.08 |
| 循环模型最终,r=1 | 0.8T | 34.89 | 29.34 | 0.00/0.00 |
传播误差
把 0.8T 的循环模型与 0.18T 的基线并列成"同样 0.8T"夸大了差距;论文没有 0.8T 的非循环基线。正确读法:同为 0.18T,ARC-E +7.2、HellaSwag +11.5、GSM8K ×5。
循环在哪里最有用
- 难任务(ARC-C)收益大,事实回忆(SciQ)收益小
- 上下文越多需要的循环越多:ARC-C 零样本 8–12 次饱和,25–50 shot 需 32 次
- 开卷 OBQA +11.0(38.2→49.2):记的事实少,对上下文推理强
零样本免费能力
逐 token 自适应停机(KL < 5e-4,MT-Bench 5.63→5.56)· KV cache 共享(预算 4 不掉分)· 连续 CoT(用上一 token 的 s_r 热启动)· 自推测解码
隐空间里发生了什么
多数 token 收敛到不动点;数值推理 token(GSM8K 的"3")进入多维轨道;关键 token("wrong")表现为单向滑块,可能在计步;换 s₀ 轨迹形状不变(路径独立)。Lu et al. 2025 用 logit lens 只发现有限的可解释潜在 CoT 证据。
论文 03 · 2026-05
Training-Free Looped Transformers:一层是 ODE 的一步欧拉,正确的循环是细分步长而不是走到 t=K
关键洞察
pre-norm 层 L(x)=x+F(x) ⇔ ẋ=F(x) 上 h=1 的前向欧拉;post-loop 层是在 x(t=1) 的近似上训练的
- 朴素循环 x←g(x) 做 K 次 = 积分到 t=K,后段层没见过 → 掉点。2 维小网络:K=2 时 MSE 0.015→2.88,K=8 时 335。
- 子步 x←(1−1/K)x+(1/K)g(x):以 O(1/K) 逼近同一个 x(t=1)。K=8 时 MSE 1.04(约 320× 差距)。
- 特殊 RK 表:输出 = β·g(x₀) + (1−β)·FK(x₀),β 是锚点权重(安全阀)。
- Anderson / heavy-ball / Aitken 都不如 RK 子步 → 预训练中段不是压缩映射,是 ODE 流。
统一配方(逐格零调参)
中间 4 层窗口 · 3 级 RK · 稠密 block-mode / MoE layer-mode(block-mode 下门控每次迭代路由到不同专家 → routing thrash)· ~2 万 H100 小时
| 模型 | 基准 | 基线 | 循环 | Δ pp |
| Qwen3-4B-Instruct | MMLU-Pro 5-shot | 57.14 | 59.79 | +2.64 |
| GPQA-Main 0-shot | 33.71 | 35.71 | +2.01 |
| Llama-3.2-1B-Instruct | GPQA-Main | 27.90 | 29.69 | +1.79 |
| Qwen1.5-MoE-A2.7B | ARC-Challenge 25-shot | 48.29 | 50.60 | +2.30 |
| Moonlight-16B-A3B | OpenBookQA | 31.60 | 32.80 | +1.20 |
| DeepSeek-V2-Lite-Chat | ARC-Challenge | 57.94 | 58.79 | +0.85 |
| Qwen3-30B-A3B(事先锁定配置) | CSQA / MMLU-flex | 78.71 / 66.67 | 79.85 / 67.46 | +1.14 / +0.79 |
87%
45 个(模型,基准)格子非负;60% 正、27% 中性
−27.7
循环整个模型(28 层)掉 27.73 点;n=4 +0.55,n≥6 悬崖
0.5
最优窗口相对深度 0.43–0.71(>1.7B);小模型前移到 0.25–0.56
论文 04 · 2026-06
LoopCoder-v2:在并行循环 Transformer 里,第二次循环几乎是全部——第三次开始交位置税
PLT 怎样把延迟和 KV 压平
- 共享 KV + 门控滑窗注意力:第一轮 KV 冻结共享;后续轮 = 全局分支(冻结 KV)与局部滑窗(w=64)的逐头门控混合。KV 从 O(RLSd) 降到 O(LSd)。
- 跨循环位置偏移 CLP:B(r) = Embed(x) + shift(h(r−1)),上一轮状态右移一位,token i 的第 r 轮可与 token i−1 的第 r+1 轮并行。延迟 ≈ 单次前向。
- 代价:token i 拿到的是邻居的状态 → 位置错配,标准循环没有这一项。
实验协议
7B 稠密 PLT,R∈{1,2,3,4} 各自从头训练 18T token(文本:代码 1:1,100+ 语言),同一份 600 万条 SFT,训练即推理循环数;合计 100 万 GPU 小时。
| 7B 模型 | HE+ | LCB | SWE-V | Multi-SWE | TB-v2 | BFCL | 均值 |
| 基线 R=1 | 81.1 | 27.4 | 43.0 | 14.0 | 11.2 | 32.2 | 38.0 |
| R=2 | 84.1 | 35.4 | 64.4 | 31.0 | 21.0 | 40.1 | 46.5 |
| R=3 | 75.0 | 28.6 | 27.6 | 11.0 | 12.2 | 36.3 | 36.9 |
| R=4 | 76.8 | 24.5 | 22.4 | 9.3 | 9.0 | 39.5 | 34.3 |
Table 2;SWE-V = SWE-bench Verified。R=2 的 64.4 超过 Kimi-Dev-72B(60.4)、Qwen3-235B-A22B(45.2),接近 Qwen3-Coder-480B(67.0)。
174.6
有效秩在第 2 轮达峰(172.5 → 158.2 递减):后续循环在收窄表示子空间
30–45×
CLP 偏移成本 Ω ≈ 常数,是第 3 轮起边际收益的 30–45 倍
+26.9
R=2 上叠加显式 CoT(Thinking):LiveCodeBench 35.4→62.3,超加
适用边界:"两次最优"是 PLT 的性质(每次 R 单独从头训练,CLP 固定税)。顺序循环的 Huginn 到 r=32 单调上升。看有效秩曲线而不是穷举训练来选循环数。
论文 05 · 2026-07
Loop the Loopies!:layer-loop + 实测步时匹配 + 两次循环,循环 MoE 第一次在算力匹配下赢
Loopie Recipe(按实测优化器步时匹配)
- 参考 Qwen3-like 30B-A3B(D=2048, L=48, R=1)→ 层数减半、循环两次:种子 (2048, 24, 2)。块执行次数不变,激活内存减半(∝ s·b·D·L,随存储深度而非执行深度)。
- 省下的内存换每卡 micro-batch 翻倍(梯度累积减半,每步 token 不变)。
- 把效率增益再投资到宽度/深度,选实测步时最接近参考的候选。
| 配置 | D | L | R | 名义算力 | 激活内存 |
| Qwen3 30B-A3B(参考) | 2048 | 48 | 1 | 1.00× | 1.00× |
| 种子 Loopie | 2048 | 24 | 2 | 1.00× | 0.50× |
| Loopie-20B-A2B | 2304 | 27 | 2 | 1.42× | 0.63× |
名义 FLOPs 高 42%,但 MBS 2 vs 1 使每步墙钟时间持平。作者明确:这是实测训练成本相等,不是 FLOPs 相等;推理成本未报告。
为什么 layer-loop、为什么只两次
- 6B-A0.6B 上 layer-loop 约 1.2T token 后反超 model-loop;消融去掉 layer-loop 明显更差
- 流水线并行友好:一层的所有循环在同一 stage 内完成,无环回依赖
- N× 循环 vs N× 存储层(250B token):边际收益在 R=2 最大,之后快速衰减
~600B
800B token 算力匹配对照,约 600B 后反超并保持领先;4 级扩展梯全胜且差距不缩小
81.28
20B-A2B Thinking MMLU(3.5T token)vs Nemotron 3 Nano 80.52、Cascade 2 81.22(各 25T)
80.42
6B-A0.6B Thinking 的 AIME24(Ouro 2.6B:62.50);AIME25 70.83
SPT:监督预训练
SFT 的损失掩码 + PT 的优化规模(batch ≥1024、序列 ≥128K、2T token、10 epoch):预训练指标和推理指标同时上升,无过拟合、无遗忘。
02
更广的图谱与十条洞察
arXiv 全量检索 · 约 60 篇直接相关工作 · 十个主题
文献图谱
十个主题:2026 年上半年每个方向都有了专门的论文
理论
表达能力 · ICL · 长度泛化
Giannou 2023 可编程计算机;Saunshi 2025 k 层×L 次 ≈ kL 层;Xu&Sato 2025 循环擅长 DAG、CoT 擅长自约化;Zhang 2026 预算律 v≈n/T
预训练
规模化
Huginn 3.5B/0.8T · Ouro 2.6B/7.7T · LoopCoder-v2 7B/18T · Loopie 20B-A2B/3.5T · Nanbeige4.2-3B/28T · SMELT 至 54B。循环数 2–4,MoE 成默认
效率
延迟 · KV · 量化
PLT 并行;扩散式采样器 5×;MELT 常数 KV;Looped Latent Attention 跨循环 KV 低秩 32×;LT2 线性注意力;LoopQ W4A4
稳定性
训练理论
残差缩放需 1/N 而非 1/√L;DeepLoop 指数 1/4→1/2;Fully Looped 稳到 12 次;STARS 谱半径正则;settling/drifting 分类
停机
自适应计算
ACT · PonderNet · MoR(NeurIPS 25)· Think-at-Hard(93% token 不循环)· LoopFormer 弹性深度 · RecurTrace 平均 2.0 次达 56.9%
改造
免训练与改造
Relaxed Recursive(逐层 LoRA)· Retrofitted Recurrence 课程 · Training-Free RK 子步 · Program-of-Layers 学跳过/重复程序
后训练
RL 与监督
RLTT 沿潜在轨迹分配奖励 +10.9% · LoopRPT 强化预训练 · LOTUS 金标 CoT 监督潜在位置追平显式 CoT · LoopMTP · SPT
可解释
动力学
轨道/滑块(Huginn)· logit lens 证据有限(Lu 2025)· 两尺度动力学 · Jacobian lens:Ouro 每轮重建工作区、Huginn 跨 16 轮携带
小模型
递归推理器
HRM 27M 解数独/ARC · TRM 7M ARC-AGI-1 45% · Attractor Models 隐式微分、均衡内化 · Denoising Recursion 超过 TRM
应用
跨模态与 agent
LoopViT 18M ARC 65.8% · RD-VLA 0%→90%、80× 加速 · 组合式工具调用随深度提升 · Nanbeige4.2-3B agentic 产品
洞察 1–3
算力匹配的门已过、但门很窄;循环次数分裂成两个 regime;粒度向中间收敛
1 · 窄门里的首胜
Loopie 与 SMELT 第一次在匹配训练成本下赢,但配置极窄:MoE、layer-loop/中段、两次。Schwethelm 的扩展律解释原因——一次循环只值 r0.46 份独立参数(截断反传下 0.38),用循环换参数在 FLOPs 匹配下必输;Loopie 是用循环省下的激活内存换 micro-batch 再换宽度,理论 FLOPs 看不见这笔红利。
2 · 两个 regime
最优循环数:Loopie 2 · LoopCoder-v2 2 · SMELT 2 · Nanbeige 2 · Ouro 4 · Huginn 32(可到 64)· RecurTrace 2.0 · Think-at-Hard 在 93% token 上 1。分裂线是算力约束在哪:预训练受限 → 2;推理可变 → 按需自适应(Huginn ARC-C 随 few-shot 数从 8 次饱和到 32 次)。"三次以上回退"是 PLT 的位置税。
3 · 粒度变细、位置居中
整模型(UT)→ 三段式(Huginn)→ 逐层/中段(Loopie、Training-Free、SMELT)→ 只循环 mixer(MixerLoop 保留 41.5% 收益、省 45.9% FLOPs)。三条独立证据指向同一位置:深度分数规则 0.43–0.71(众数 0.5)、SMELT 的"中间一半"、Huginn 的首尾层特化。MoE 必须 layer-loop(routing thrash),免训练与从头训练两篇独立一致。
洞察 4–7
ODE 流还是不动点?稳定性成了定理;推理成本被拆成三件事;循环与 CoT 互补
4 · 两种哲学分化
Training-Free:预训练中段不是压缩映射,不动点加速器都不如 RK 子步——对已训练模型顺着 ODE 流细分步长。另一支把循环训成不动点:STARS(谱半径正则)、Fixed-Point Reasoners、Attractor Models(隐式微分)。Viakhirev:settling 算子加深不变差,一个终端不动点目标就能把 drifting 变 settling;Huginn 属 non-settling,LoopCoder-v2 的 cos θ<0 震荡正是其表现。
5 · 稳定性从经验到定理
Huginn 的两次失败(2025)到 2026 年成了定理:残差缩放 ε=1/N 而非 1/√L;DeepNorm 指数 1/4→1/2;最优学习率只依赖唯一层数,可跨循环数迁移。Fully Looped 稳到 12 次,LoopMTP 到 15 次。"循环模型难训"这道 2018 年以来的障碍基本被拆除。
6 · 推理成本拆成三个子问题
延迟:PLT 并行、扩散式并行采样器 5×。KV:共享(Huginn/MoR/MELT)或压缩(LLA:跨循环 KV 低秩,32× 近无损,H200 上批容量 32→768)。量化:LoopQ。三者独立可叠加。口径警告:Loopie 的算力匹配是训练步时;推理时每 token 54 次块计算 vs 48,KV 更大,未报延迟。
7 · 互补而非替代
LoopCoder-v2 R=2 叠加 thinking:LCB +26.9 远超各自之和;LOTUS 用金标 CoT 监督潜在位置,3B 追平显式 CoT,思考延迟降 2.5–6.9×;Xu&Sato 形式化分离两者擅长的问题类。配套发现:标准 RL 与循环模型错配——GRPO 只给最终潜在状态分配 credit;RLTT 沿轨迹分配后 Ouro-2.6B 数学 +10.9%;LoopRPT 在预训练就给潜在步分配强化信号。
洞察 8–10
循环擅长"操作"知识而非"存储";应用扩到 agent 与具身;生产化开始、工具链没跟上
8 · 能力剖面
Ouro 的对照把优势归因于知识操作而非容量;Huginn 闭卷弱、开卷 +11.0;Frey:循环帮数学、记忆库帮常识,合并才超 iso-FLOP 基线;Dual-Path 学到的门控让标点/符号/算术 token 走"深"、功能词走"宽"。最佳搭档:检索、长上下文、MoE 专家库——把存储外置。
9 · 从谜题到 agent
2025 年证据集中在数独/迷宫/ARC/GSM8K;2026 年扩到三类:软件工程 agent(LoopCoder-v2 SWE-V +21.4、Terminal-Bench 大涨)、工具调用(多步有依赖的调用随深度提升;Nanbeige4.2-3B 以 3B 超 Qwen3.5-9B)、机器人(RD-VLA 0%→>90%,比 token 推理 VLA 快 80×)。共同点:一次前向内维护中间状态与依赖。
10 · 工具链缺口
五个开源家族:Huginn、Ouro、LoopCoder-v2、Loopie、Nanbeige4.2-3B(28T token,已作为产品发布)。但复现报告显示 Nanbeige 在 HF transformers 上开箱 5 个 bug(静默置零的 RoPE 缓冲、已移除的 cache API),修复后层复用仍使注意力内存翻倍。推理框架、量化、KV 管理都没有循环模型的标准接口;Loopie 的 megatron-loopie / vllm-loopie 分支是往这个方向的信号。
核对
五处被二次传播放大的说法,对照原文
| 常见说法 | 原文事实 |
| Huginn "同样 0.8T token"下循环模型碾压基线 | 非循环基线只训了 0.18T;同为 0.18T 时循环模型 ARC-E 53.62 vs 46.42、GSM8K CoT 10.24 vs 2.20 |
| "循环两次就够,三次以上回退"是循环 Transformer 的规律 | 是 PLT(跨循环位置偏移)特有的现象;每个 R 单独从头训练;Huginn 到 r=32 单调上升 |
| Loopie 与 Qwen3-30B-A3B "相同算力" | 相同实测优化器步时;Loopie 名义 FLOPs 高 42%,推理成本未报告;对照的是 800B token 自复现版而非官方 36T 模型 |
| Training-Free 让开源模型"变强" | 收益约 1–2.6 个百分点,集中在知识型多选题;3B 以下蒸馏模型可能掉分;额外约 15–30% 推理延迟 |
| Huginn "3.5B 打出 50B 的表现" | FLOPs 等效,非基准等效;基准上接近 OLMo-7B、落后 OLMo-2-7B |
方法:每条都回到原论文的表号核对(Huginn Table 4、LoopCoder-v2 Table 2、Loopie Table 1 与 §2.4、Training-Free Table 2–3)。
推断 · 明确标注
关于 GPT-6 Astra:能核实的与不能核实的
不能核实
Astra 用了哪种循环、循环几次、如何训练——OpenAI 发布页无架构细节,The Information 报道基于匿名信源,两份原始材料本报告作者均无法访问。以下四条全部是基于公开文献的推断。
四条推断
- 若 Astra 用 recurrent depth,公开文献中最接近"前沿规模 + 算力匹配"的配方是 Loopie/SMELT 路线:MoE、中段或逐层、循环次数很小。整模型循环 32 次的 Huginn 路线没有前沿预算下的算力匹配证据。
- "OpenAI 绕过了两次饱和"这一推测前提不成立——两次饱和是 PLT 特有;真正的瓶颈是推理成本,而 KV 32× 压缩、扩散式并行采样 5× 已把它压低一个量级。
- 报道中的"安全担忧"对应文献里的真实问题:潜在推理无可读中间 token,探测结果依赖层与解码方式(Lu 2025、Jacobian Lens 2026),比监督 CoT 更难。
- Loopie(7 月)、LLA(7 月)、SMELT(9/1)与 Astra(9 月初)密集出现:更合理的解读是多个团队在 2026 上半年同时把这个方向推到可用,而非某篇论文导致某个产品。
未解问题
七个还没有公开答案的问题
- 多循环的算力匹配。 所有算力匹配的胜利都在 R=2;R≥4 能否赢没有公开证据。
- 推理成本的完整账。 训练步时、推理延迟、KV 峰值内存需同时报告;目前没有一篇三者齐全。
- 扩展律的函数形式。 SMELT 到 54B、Schwethelm 到 ~1B;Chinchilla + rφ 项在 100B+ 是否成立未知。
- 自适应停机的预训练规模收益。 MoR/TaH/RecurTrace 都在 ≤8B;只有 Ouro 的熵正则深度分配在 7.7T token 验证过。
- 潜在推理的可监督性。 LOTUS 需要金标 CoT;无 CoT 数据时如何让潜在轨迹可读、可审计,是安全层面的开放问题。
- layer-loop 的机制。 Loopie 三个理由中只有扩展性有实验;SMELT 的"第二次访问削弱注意力沉降"是唯一机制解释。
- 循环 vs 序列长度扩展。 Hidden Decoding(WeLM 617B)走序列维度并称更兼容流水线并行;Loopie 的 layer-loop 恰为流水线兼容而设计;100B+ 上无正面对比。
最值得做的两个空白:R≥4 的算力匹配扩展律;循环专用的 RL 目标(把 credit 分到潜在轨迹上)。
给从业者
三种预算下的可执行配方
零训练:已有模型
- 中间 4 层窗口,3 级 RK 子步,β 取中间值
- 稠密 block-mode,MoE layer-mode(先固定路由)
- 先在知识型多选题上验证;预期 +1–2.6 pp,多 15–30% 延迟
- 任何"某段层跑两遍"的实验都用阻尼更新 x←(1−1/K)x+(1/K)g(x)
从头预训练:前沿预算
- MoE 骨干,layer-loop,R=2
- 层数减半 → 激活内存减半 → micro-batch 翻倍 → 用效率增益买宽度;按实测步时匹配算力
- SmallInit / 三明治归一化 / 残差 1/N 缩放;检查 r=1 与 r=max 的困惑度是否分开
- 后训练:SPT(SFT 掩码 + PT 规模);RL 用轨迹级 credit(RLTT 类)
推理时可变算力
- 顺序循环(Huginn 类)+ 训练时随机 r + 截断反传,推理任选 r
- 逐 token 自适应停机(KL 阈值 / 二阶步长差 / 学习式停机头)
- KV:共享预算或 LLA 低秩编码;延迟:扩散式并行采样
- 给它检索/长上下文——循环模型的强项是对上下文推理
部署前必做:实测延迟与 KV 峰值内存;不要把"训练算力匹配"当作"推理成本匹配"。
仓库导航
awesome_loop_transformer:这份报告的全部材料
目录
- README.md — awesome 列表(按主题分类,含五篇核心论文标注)
- papers/original/ — 五篇原文 PDF;papers/zh/ — 保版式中译 + QA 报告
- papers/src/ — arXiv HTML 全文(Markdown)
- reports/zh | en/ — 五篇逐篇深度解读
- reports/pdf/ — 中、英文完整报告 PDF
- survey/zh | en/ — 趋势综述(Markdown + PDF)
- slides/html/ — 本 HTML 演示(含 PDF 导出);slides/beamer/ — Beamer PDF
- data/ — papers.csv、related_abstracts.json;src/generator.py 生成 README
方法与工具
- 翻译:SuperTranslate 保版式引擎(DeepSeek 后端)+ 对象级 QA,5 篇中 3 篇 0 issue,2 篇为图内刻度/公式行的可解释误报
- 检索:arXiv API,关键词 looped/recurrent-depth/depth-recurrent transformer、latent reasoning ∧ loop,60 篇摘要留档
- 写作:主张先行、必要限定只写一次、数字随处可核对(anti-defensive-writing / 说人话)
- 排版:pandoc + XeLaTeX(报告)、Beamer 16:9(学术幻灯)、本 HTML(ppt-master technical-deepdive 风格)
github.com/asimfish/awesome_loop_transformer · 欢迎 PR 补充新论文(data/papers.csv → src/generator.py)