Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
PAPER H 5 · HF 74 约 1 分钟

无动作视频也能提供动作先验

NAVA-WAM直接从普通视频预训练动作策略,减少对昂贵机器人标注的依赖。

普通视频能让 AI 看见“杯子怎样被拿起”,却不会告诉它机械臂各关节该转多少。NAVA-WAM 想跨过这道坎:直接用这类只有画面、没有控制指令的视频,预训练机器人的动作策略。它面向世界动作模型——一种既预测未来画面、又决定机器人如何行动的模型。意义在于,动作标注轨迹需要真机运行并同步记录控制指令,成本远高于普通视频。

最巧的一步发生在预训练阶段。研究者冻结负责视频的 Video-DiT,只让负责动作的 Action-DiT 学习;虽然视频里没有动作标签,模型仍要预测画面如何从当前状态变化到未来状态,这份训练信号会通过两个模块之间的联合注意力传给动作模块。换句话说,它从“东西后来怎么动了”反推常见的互动规律,形成动作先验,再用少量带动作标注的机器人演示适配具体机械臂。实际运行时,它只输出动作,不必生成未来视频。作者称,该方法在分布内、分布外及低动作标签预算下均优于对照方法,并在 Franka FR3 真机任务上展示了泛化能力;但所给材料未披露具体成功率。


供稿材料 SOURCES — 1

← 返回 2026-10-08 · 学术板块