你请一位新手照着师傅的标准路线搬家具。练习时一切顺利;真到现场,他第一步稍微走偏,之后看到的角度、碰到的障碍就全变了,背熟的路线也随之失效。加速后的机器人模型会遇到类似问题:它在固定数据上学会模仿教师,却未必学过如何处理自己犯错后造成的新局面。
WAM-OPD 想做的,就是让学生模型边跑边暴露问题,再由教师沿途补课。论文把这种在策略蒸馏引入世界动作模型,希望修复模型加速后丢失的任务能力,同时让训练方式更接近真实部署。本文的效果数字和方法结论均来自作者论文,尚无第三方复现。
加速为什么会让能力掉队?
世界动作模型(World Action Model,WAM)是一类既预测未来画面、又生成机器人动作的模型。它不只决定“下一步怎么动”,还会先想象“这样做之后会看到什么”。论文研究的 video-first WAM 会先生成一段视频计划,再让动作分支根据这段计划输出动作。
这类生成模型通常需要多次计算,才能逐步得到视频和动作。Flash-WAM 通过蒸馏把这个过程压缩到很少几步。所谓学生—教师蒸馏,就是让较小或较快的学生模仿冻结的大模型教师,以降低部署成本。论文从公开的 one-video/one-action-step Flash-WAM 出发:视频和动作各用一步生成。
问题在于,原有加速蒸馏主要使用离线样本,也就是提前收集好的固定数据。学生如果只见过教师走过的理想路线,一旦自己的动作出现小偏差,后面遇到的画面和位置就可能越来越陌生。这叫状态分布漂移:训练时见到的情形,与真实连续运行时遇到的情形不同。
对 WAM 来说,漂移还有第二层。部署时,动作分支读取的是学生自己生成的视频计划。如果训练时却总把教师的计划喂给动作分支,就像练车时一直有人替学员把车摆正,考试时才让他面对自己刚刚停歪的位置。即使教师给出的动作很好,训练和部署的接口仍然对不上。
让学生决定老师该教什么
WAM-OPD 的关键不是换一个更大的教师,而是改变教学发生在哪里。
学生先在环境中实际行动,由它决定会走到哪些状态、产生哪些历史记录。冻结的 LingBot-VA 教师随后查看这些学生造成的历史,为每个情境提供相互一致的视频目标和动作目标。这就是在策略蒸馏(on-policy distillation,OPD):学生负责走路线,教师专门纠正学生真正会遇到的问题,包括学生自己带来的偏差。
这里的“在策略”不等于强化学习。强化学习通常依赖环境给出的奖励;机器人任务的成功信号往往很稀疏,可能整段操作结束后才得到一次成败结果。WAM-OPD 不使用这种稀疏奖励,而是让教师在沿途持续给出视频和动作监督。论文将它定位为一种互补的后训练接口,并未证明它比强化学习更便宜、更稳定或性能更高。
更重要的一步发生在动作训练时。学生先生成自己的视频计划,再让自己的动作分支基于这份计划学习教师动作。这样,学生训练时走的计算路径与部署时一致。教师动作目标目前仍基于教师自己的计划产生,因此两份计划之间还存在差距;视频监督的作用之一,就是把学生计划拉近教师计划。
两种能力一起改,但只动小部件
模型的视频和动作模块共用一个包含 30 个 Transformer 块的主干。Transformer 可以理解为处理上下文关系的核心网络。WAM-OPD 冻结已发布模型的大部分权重,只在这 30 个共享块中加入 rank-8 JointLoRA 适配器——一组轻量、可训练的小参数。
训练同时使用视频损失和动作损失:前者让学生想象的未来靠近教师,后者让学生在自己的视频计划下给出合适动作。作者还加入 action flow-matching regularizer,即动作流匹配正则项,用额外约束维持动作生成过程的学习信号。动作损失不会通过视频计划本身反向修改视频求解过程,但视频和动作的前向计算都能更新共享适配器。
这套试验规模很克制。每个任务使用 8 条学生轨迹、160 个教师标注的上下文和 120 个优化步骤。当前版本并没有在模型每次更新后重新收集轨迹,而是重复使用同一批数据。因此,它只对最初负责采集数据的已发布学生模型严格“在策略”;随着参数改变,数据也会逐渐变旧。
两个任务,效果一大一小
作者在 RoboTwin 2.0 的两个干净仿真任务上测试方法。
在 Handover Mic 中,机器人要在两只机械手之间传递麦克风。已发布 Flash-WAM 的成功率是 0.0%,WAM-OPD 后达到 58.3%,提高 58.3 个百分点。在 Put Object Cabinet 中,机器人要把物体放进指定柜子抽屉并松手;成功率从 16.7% 升至 33.3%,提高 16.7 个百分点。
评测为精确配对设计:同一组对比共享指令、初始模拟器快照、场景种子和噪声设置。每个任务包含 6 个留出场景种子和 2 组固定噪声,共得到 12 个配对单元。不过,两次噪声运行会复用同一个场景种子,所以不能把它们当作 12 个彼此独立的场景样本。
两个任务都改善,说明“让教师监督学生实际走到的地方,并让动作分支读取学生自己的视频计划”值得继续验证。但两项提升相差很大,也说明效果可能依赖具体任务。作者把结果称为初步、任务特定的能力证明,而不是广泛或均匀泛化的证据。
为什么值得关注?
模型部署不只是在服务器上把推理速度调快。加速会改变模型如何生成结果,也可能改变机器人随后遇到的世界。离线蒸馏解决的是“怎样更快地模仿教师”,WAM-OPD 进一步追问:“学生真的跑起来以后,教师应该去哪里纠正它?”
这让蒸馏从一次性的模型压缩,变成更贴近闭环运行的后训练。对同时生成未来画面与动作的 WAM,它还指出一个容易遗漏的细节:不能只让学生学习正确动作,还要让它在自己实际会使用的视频计划上学习动作。换句话说,教学数据要跟着学生走,训练接口也要和上线接口对齐。
局限与未知
- 证据只有两个干净的 RoboTwin 2.0 仿真任务和较小的留出评测,不能说明多任务泛化,也没有真实机器人迁移结果。
- 当前方法复用固定轨迹包,尚未验证反复执行“学生采集—教师标注—继续训练”是否更有效;也没有与计算量相当的监督微调、强化学习、纯动作蒸馏等基线比较。
- 教师动作仍基于教师视频计划生成,共享 JointLoRA 中视频与动作梯度是否互相帮助也未测量。作者计划通过更广任务、刷新轨迹和受控消融实验拆分这些因素。