同一道题反复检查,思路顺时可以快一点,越想越乱时则该放慢。循环 Transformer——让同一组网络层反复修正内部状态的模型——原本通常每轮都按固定幅度更新。这样虽能用较少参数换来更深推理,却不管题目和阶段难易,容易把额外计算花得机械。
论文提出 TAPS:它观察连续几轮的更新轨迹。若方向持续一致,就放大下一步;若更新来回波动,就缩小步幅。具体来说,它用指数移动平均——一种更看重近期变化的滚动统计——分别估计“持续前进”和“波动”的强弱,全程不需要知道正确答案。作者还从理论上给出条件:这种调度可降低最终损失,并用更少循环达到目标质量。
据作者实验,TAPS 无需重新训练,就能提升 Sudoku 和 Maze 等结构化推理任务的最终准确率;把同一原则加入训练后,还能在匹配基线准确率时获得最高达论文所报的墙钟时间加速。不过,所给正文片段未保留具体加速倍数,结果也尚不能据此推广到所有任务。