Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER 约 1 分钟

机器人动作生成压到一步

IMLE-VLA把机器人动作从多轮采样压到一步,瞄准闭环控制中的等待与卡顿。

让机器人拿起杯子时,它常不是不会动,而是在等下一步动作算完:算一次、停一下,动作就显得走走停停。IMLE-VLA瞄准的正是这段等待。VLA(视觉—语言—动作模型)会根据画面和指令控制机器人;常见的连续动作头——负责输出关节移动量等可细调数值的模块——需要像反复修改草稿一样,用扩散或流匹配多轮生成动作。

IMLE-VLA保留原有视觉语言骨干,只把原先十步的流匹配动作头换成单步生成器。难点是,直接回归容易把多种合理做法平均成一个未必好用的动作。作者因此采用 cIMLE(条件隐式最大似然估计)训练:给同一情境配上不同随机噪声,让生成器一次产出完整动作序列,同时鼓励它覆盖多种可行动作,而非挤到单一模式。

这条路线的价值很直接:闭环控制要不断“观察—决策—执行—再观察”,每次决策少等几轮,机器人就更有机会连贯行动、及时应对变化。作者称,该方法在 40 项 LIBERO 模拟任务及 Franka Emika Panda 的四项实机任务中兼顾了成功率、平滑度与速度;但供稿中的具体数值缺失,因此这里不作量化比较。


供稿材料 SOURCES — 1

← 返回 2026-09-14 · 学术板块