Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.043 — 2026-08-16
PAPER H 1 约 1 分钟

世界动作模型未必需要看见未来

ForeWAM 不再逐帧生成未来,而把未来压成内部表示,机器人因此能更快选动作。

机器人伸手拿杯子前,可以先“想象”杯子接下来会往哪动。但如果 AI 必须把这段未来逐帧画出来,再决定手怎么伸,反复的视频去噪——从噪声多轮修正出清晰画面——就会拖慢反应。ForeWAM 追问的是:机器人需要的也许不是未来画面,而只是其中与动作有关的信息。

它用 Future-KV 做了一次 Video DiT 预填充:把当前画面的潜变量——模型内部、无法直接观看的数字摘要——与随机的“未来空位”一起处理,再将各层产生的键值状态缓存起来,供 Action DiT(生成机器人动作的扩散 Transformer)反复读取。训练时,模型还借助真实后续画面和一个冻结的教师模型,学习物体移动、接触变化和任务进度;部署时则不需要教师,也不生成未来视频。作者报告,在 LIBERO-Plus 的已测子集上,ForeWAM 成功率为 61.6%,动作生成延迟从对比方法 Fast-WAM 的 667 毫秒降至 568 毫秒;加速版进一步降至 220 毫秒。结果仍限于论文所述基准,但它提出了一个值得关注的方向:世界动作模型或许只需保留“预见”,不必真的“看见”未来。


供稿材料 SOURCES — 1

← 返回 2026-08-16 · 学术板块