教机器人“拿起书再放好”,通常要先由人把任务拆成抓取、搬运、放下。这项工作追问:如果只给专家演示,机器人能不能自己学会拆分?作者在 VLA——把视觉、语言指令直接变成机器人动作的模型——中加入 MoE。它像一支专家小队,由路由器根据当前画面、指令和机械臂状态,选择此刻该调用谁。
关键设计是:每次生成一段动作时只路由一次,并让同一选择贯穿整个动作模块。这样,“专家”更可能形成完整的小技能,而不是零散计算分工。作者在 LIBERO-10 任务中观察到,有的专家负责靠近并抓住细柄,有的负责搬运已抓住的物体,还有的负责松手后撤;同一专家会跨炉灶、抽屉和微波炉等不同场景复用。16 个专家中有 6 个基本未被使用,说明模型没有简单地把容量全摊开。
更有说服力的是人工改派实验:把一个原本不会被选中的“抓取专家”强行派到新任务,它仍做出抓取动作,甚至能补救一次抓取失败。这说明技能差异不只是路由器贴出的标签。不过作者也承认,自动路由尚未实现这种组合式泛化;目前证据主要是行为观察,而 MoE 的任务表现仅与普通单体基线相当。