让机器人把杯子放进托盘,反复“想”十遍未必比想五遍更稳。流匹配 VLA——把画面和语言指令变成机器人动作的策略——会从随机噪声出发,多次修正后生成动作。每次修正都要调用模型,既增加延迟,也不保证真实执行更成功。
作者提出 Coda:先让冻结的原策略少算几步,再用一个轻量 Transformer 做一次终点纠偏。这个纠偏器根据候选动作、初始噪声和已有的观察信息,学习候选动作与示范动作之间的差值;训练时只更新纠偏器,不改原策略。在 50 个 RoboTwin Easy 任务上,作者报告五步 Coda 的闭环成功率——机器人边执行边观察、直到完成或失败的比例——由同为五步的 71.64% 升至 74.68%,同时比默认十步策略减少 30.2% 的前向延迟。两步版本达到 71.88%,速度为默认方案的 2.12 倍。结果说明,与其把计算全花在反复积分上,留一次机会专门修正最终动作,可能更划算;不过这些数字仍来自论文作者的实验设置。