Looped Flows 精读:把"想得更久"做进架构——循环流的局部训练之路
题目:Thinking with Looped Flows 链接:https://arxiv.org/abs/2609.11801 团队:AITHYRA(访问研究员完成,* equal advising) 数据日:2026-09-11
一、题目与背景
人类与机器解更难问题的一个通用策略:花更多计算。在推理侧(o 系/思维链)这通过生成更多 token 实现;在架构侧,循环模型(looped models)让网络反复更新同一个隐藏状态——理论上"深度随需扩展"。但循环模型有个训练死结:实践中的反传只穿过一或几次更新,于是早期更新步永远学不到"为后续步骤服务"的信号——链条上第一环的价值在链条末端才兑现,而梯度走不了那么远。
looped flows 的解法:换一种状态更新的数学形式,让每一步的训练目标局部闭合——不需要跨步梯度,每步自己监督自己。
二、研究定位
论文自己把坐标画在三个传统的交汇处:循环模型(recurrent depth)、流/扩散模型(连续时间状态更新)、推理的能量模型(用状态收敛表示答案)。相对既有 looped transformer 的差异点在训练目标的形式:用流匹配式的局部目标替代跨步自回归。
三、问题定义
让一个可循环执行的模型满足:推理时计算可扩展(多跑几步更好)、训练时无需跨步反传(局部目标)、支持多样解(同一输入可收敛到不同答案——多解任务的必需品)。形式上:循环状态 $z$ 与流状态 $x$ 的交替更新,直到终止判据。
四、解法
looped flows 的循环体:
- 状态化去噪器:以循环状态 $z$ 为条件,对流状态 $x$(从噪声初始化)做去噪预测——每步产出当前最佳解的猜测。
- 循环状态更新:去噪结果回写 $z$(该步学到的信息持久化,供下一步使用)。
- ODE/SDE 步:按流模型的标准更新规则推进 $x$。
- 局部训练:每个循环步的损失只依赖该步的(输入, 猜测, 目标)三元组——切断步间梯度(类似截断 BPTT 的极端版,但损失设计保证信息仍经由 $z$ 跨步传递,只是不靠梯度)。
- 多样解:概率传输(SDE 路径)保持随机性,同一问题多次采样可收敛到不同有效解。
五、实验结果
| 发现 | 数字 |
|---|---|
| 总体 | 六个推理基准整体超先前 SOTA looped 模型 |
| ARC-AGI-1 | 58.8% 测试准确率 |
| ARC-AGI-2 | 12.2% |
| 多解基准 | 两个多解基准上概率传输产出多样正确解 |
| 分析 | 学到的递归呈现可解释的"逐阶段精化"结构;流与递归两个组件各有独立贡献(消融) |
ARC 系列是抽象规律归纳的标杆——少样本视觉/符号规则迁移,正是"迭代精化"应该兑现场景。消融(Q3:什么让 looped flows 有效)确认:去掉流形式(退化为普通循环)或去掉递归状态(退化为普通流)都显著掉分——两个组件是乘性而非加性。
六、知识反推
- “梯度走不远"的出路是重构目标而不是硬扛长链。截断 BPTT、梯度裁剪都是在长链上打补丁;looped flows 的启示是重新设计每步的监督信号使收益即时化——跨步的信息仍然流动(经 $z$),但学习不需要等链条末端结算。任何多阶段 pipeline 的训练(多 Agent 系统的信用分配!)都有同构问题。
- 流形式是"质量随计算提升"的免费保证。ODE 求解步数是连续可调的算力旋钮——不像离散 token 生成有"半个 token"的不可分性。需要精细控制推理预算的场景(边缘设备、实时系统)里这个性质比"会思考"本身更工程友好。
- 多样解不是副产品而是设计目标。SDE 路径保持的随机性使 pass@k 的 k 次采样真正独立——对 ARC 这类"一题多律"的任务,多样性直接兑换成集成分数。
七、通用灵感
- 多阶段系统的信用分配改为"逐步局部目标”:编排式 Agent(规划→检索→执行→评审)若端到端 RL 信号稀疏,可给每阶段配局部可验证目标(检索阶段的召回率、执行的单步可判定成功),跨阶段靠持久状态传递——与 looped flows 的 $(z, x)$ 结构同构。
- 给推理预算做连续旋钮:与其"思考/不思考"二档,不如让系统接受一个预算参数并映射到迭代步数——同一部署覆盖快速预览与深度分析两档需求。
- 负结果提醒:局部目标牺牲了对"长期策略"的显式优化——若你的任务需要跨十步以上的全局规划(而非逐步精化),这条路未必优于显式规划器;选择前先问任务是"精化型"还是"组合规划型"。