Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER H 2 约 1 分钟

世界模型只在必要时想象

让机器人偶尔在后台“看一眼未来”,不耽误实时动作。

机器人一边做饭一边“想象未来”,有点像人切菜时偶尔抬头确认下一步:不必每落一刀都停下来重新规划。现有世界动作模型(WAM——预测动作将如何改变环境、再据此决策的模型)若在每次控制前生成未来视频,机器人就得等待;若完全不生成,又会失去明确的视觉目标。GlanceWAM试图拆开这对矛盾。

它让想象模块按较慢节奏在后台运行,只预测数秒后的一帧;控制器则继续高频输出一小段动作,不把视频生成放进每次动作前必须完成的“关键路径”。更巧的是,模型直接使用潜在空间——画面的压缩数字表示——传递未来信息,不必把它还原成可观看的视频。训练时,系统还刻意适应预测结果因异步运行而逐渐“变旧”的情况。作者称,这种稀疏的测试时想象在 RoboCasa 厨房与 LIBERO 任务上兼顾了成功率和实时速度;但供稿文本中的具体数值缺失,因此此处不作量化比较。


供稿材料 SOURCES — 1

← 返回 2026-08-29 · 学术板块