Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.086 — 2026-09-28
PAPER H 2 约 1 分钟

世界模型规划,目标别看得太远

世界模型没算错,也可能被远期目标带偏;改追近处子目标,反而更容易抵达终点。

像开车绕过路障,你得先向侧面打方向,短时间内反而离终点更远。视觉世界模型也会遇到这个问题:它先在内部模拟几种动作的后果,再挑预测画面最接近目标图像的一种。但目标太远时,这种评分可能把“暂时绕开”误判为退步,甚至让控制器原地不动。

Liu 等人用一个理论构造说明:即使动力学预测完全准确,五步搜索也找到全局最优,只盯最终目标仍可能永远选择不行动;若改追一连串子目标——通往终点的中间状态——同一套模型和搜索便能前进。基于这个思路,他们提出 Anchored Planning:从已有轨迹中找一段起点像当前画面、终点像最终目标的路线,再把路线开头不远处的画面当作眼前目标。

作者在冻结的 LeWM 世界模型上测试 Cube、PushT、Reacher 和 TwoRoom。所谓“冻结”,就是不再训练模型,只更换规划目标。在相隔 100—150 个动作的长程任务中,面向观测子目标的短搜索在四项任务上都超过已发布的 LeWM 规划器;单纯增加针对最终目标的搜索次数没有追上。论文还发现,后续画面预测得更准,也不必然带来更好的控制。换句话说,世界模型能否走远,不只取决于它算得准不准,还取决于眼下让它往哪里走。以上效果均为作者报告。


供稿材料 SOURCES — 1

← 返回 2026-09-28 · 学术板块