机器人按计划连续收拾桌面,就像蒙头照着旧地图走:前几步哪怕只偏一点,后面的动作也可能建立在一个根本不存在的位置上。世界动作模型(World-Action Model)会同时预测未来画面和动作,让机器人先“想象”后果再执行,但长程运行容易累积误差。FBFM想解决的,正是如何把模型及时拉回现实。
它不重新训练模型,而是在流匹配——沿连续变化路径逐步生成动作方案——的推理过程中加入异步反馈:前一段动作执行时,下一段仍在生成;真实观测一返回,系统就把它对准未来序列中的相应时刻,并用带遮罩的伪逆校正,只约束已经观测到的状态和已经承诺的动作,其余部分继续交给原模型生成。作者称,在42个选定的RoboTwin2.0任务上,等权任务配置成功率提高3.0个百分点;四组LIBERO测试合计提高0.6个百分点,其中LIBERO-Goal和LIBERO-10均提高2.5个百分点。提升并非处处显著,但它展示了一条实用路径:不改模型参数,也能让机器人的内部“想象”在执行途中持续接受现实纠偏。