Recurrent Looped Transformer
具备无限时间深度的潜在推理
Recurrent Looped Transformer(RLT) 将潜在计算贯穿于每个 prompt 与 response token。因果编码器构建全局键值(KV)记忆;循环解码器将该记忆与滑动窗口注意力(SWA)以及来自其上一个最终隐藏状态的反馈相结合。
作者: Yifan Zhang 日期: 2026年9月12日

三大设计原则
- 具备无限时间深度的潜在推理。 每个被处理的 token 都会延伸出一条贯穿解码器的循环路径。设解码器深度为 $L_D$,处理 $t$ 个 token 后,路径将遍历 $tL_D$ 个模块,而每个 token 执行的模块数量保持不变。
- 模型—硬件协同设计。 并行因果编码计算、跨独立序列的批处理、内存复用与激活检查点,为围绕循环解码器的高效训练与推理创造了机会。
- 模型—RL算法协同设计。 预训练、SFT、采样与当前策略 RL 重放使用同一套完整状态转移,包括 prompt 循环与解码器 SWA 缓存。
“无限深度”指随序列增长而可扩展的时间计算路径,而非单个 token 内的无限计算。推理提升、硬件加速与 RL 扩展在本报告中是研究目标,而非已测得的结果。
架构
对于 token $x_t$,设 $e_t$ 为其因果编码器表示,$M_{\le t}$ 为由编码器导出的全局 KV 记忆。完整解码器状态同时包含循环输出与逐层 SWA KV:
H_t=(s_t,C_t^D),\qquad H_0=(s_\star,\varnothing).
(s_t,C_t^D)=D_\phi\!\left(\mathrm{Merge}(e_t,s_{t-1});M_{\le t},C_{t-1}^D,t\right).
p_\Theta(x_{t+1}\mid x_{1:t})=\mathrm{softmax}\!\left(W_o\mathrm{RMSNorm}_o(s_t)\right)_{x_{t+1}}.
- 全局上下文: 交叉注意力仅通过当前位置读取编码器记忆。
- 局部解码器记忆: SWA 读取近期的解码器 KV 及当前 token 的 KV。窗口 $W$ 包含当前 token;为下一次更新最多保留 $W-1$ 条历史条目。
- 时间反馈: 上一个最终解码器输出会进入下一个 token 的合并。循环输出与 SWA 缓存都不会在 prompt—response 边界处重置。
具体配置采用 48 个编码器层 + 48 个解码器层,并在各阶段之间共享兼容的注意力与 FFN 权重。解码器模块额外执行编码器记忆交叉注意力,因此层数相同并不意味着 FLOPs 相同。
训练与推理的统一执行
| 模式 | 编码器 | 解码器与梯度 |
|---|---|---|
| Prompt 预填充 | 对已知 token 进行因果批处理 | 循环遍历每个 prompt token 并构建全部解码器 SWA KV |
| 生成 | 增量编码 | 从前一状态采样,然后对每个 token 精确消费一次 |
| 预训练 | 因果批处理 | 完整 BPTT;对所有有效的下一 token 目标进行监督 |
| SFT | 因果批处理 | 完整 BPTT;在所有上下文 token 上更新状态的同时监督 assistant 目标 |
| 当前策略 RL 重放 | 在当前权重下重建 | 重建完整历史,包括 SWA 缓存;在消费动作之前先评估动作 |
精确的当前策略重放会在权重更新后重建依赖参数的缓存。完整梯度贯穿循环输出、解码器 KV 与编码器记忆。对其中任一项进行梯度截断都属于梯度近似。行为 log 概率必须刻画实际的采样分布;精确的重要性采样还要求支撑集覆盖。共享执行语义消除了结构性的 prompt 边界失配,但仅凭这一点并不能保证数值内核层面的一致性或无偏的离策略目标。
资源
引用
@techreport{zhang2026recurrentlooped,
title = {Recurrent Looped Transformer},
author = {Zhang, Yifan},
year = {2026},
month = sep,
url = {https://github.com/yifanzhang-pro/recurrent-looped-tranformer}
}