Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
PAPER H 2 约 7 分钟

SAGE:世界模型先定目标再行动

SAGE先预测可达子目标,再生成候选动作,让世界模型的长程规划少靠盲猜。

你让机器人把桌上的方块放到指定位置。它知道最后要去哪儿,却未必知道眼下该往哪边伸手、从哪里抓、先移动多少。目标越远,可选动作组合越多;如果机器人只能随机试少量路线,即使它很会预测后果,也可能根本看不到一条靠谱路线。

SAGE想解决的正是这个问题。它不急着直接朝最终目标搜索,而是在每个规划阶段先预测一个近期可达的中间状态,再围绕这个中间状态生成候选动作。标题里的“先定目标再行动”指的是这种逐段规划,并不是开工前一次性写好整套任务计划。

本文所有方法与实验信息均来自 Cheng、Zhang 与 Wang 的 SAGE 论文,尚无独立信源交叉验证。

瓶颈可能不在“想象”,而在“给什么选项”

潜在世界模型(Latent World Model)可以理解为一个不追求画面逼真的内部模拟器。它先把环境压缩成机器内部的数字状态,再预测“执行这串动作后,状态会怎样变化”。规划时,系统会在内部预演多条动作路线,比较哪条路线更接近目标,然后执行其中一小段,再观察、再规划。

这里有两个不同环节。世界模型负责评价候选路线,动作提议机制负责把哪些路线送进考场。后者很容易被忽视。

计算预算有限,系统只能检查固定数量的候选动作。目标很近时,随机抽取也许还能碰到几个像样方案。目标拉远后,动作组合迅速增多,同样数量的候选只能覆盖很小一角。如果抽到的全是差路线,再准确的世界模型也无从选出好计划。

SAGE因此没有重训世界模型,而是改造“出题”环节:让候选动作从一开始就更有方向。

先找下一站,再决定怎么走

SAGE全称是 Subgoal-Conditioned Action Generation,即“以子目标为条件的动作生成”。它把一次规划拆成两个紧密相连的问题。

第一步是预测潜在子目标。系统接收近期观察、当前低维状态、远处的最终目标,以及还剩多远、这一步准备规划多久等信息,预测指定时长之后应当到达的机器内部状态。这个子目标不是人写的“抓住把手”之类文字,而是世界模型潜在空间中的数字表示。

第二步才是生成动作。动作生成器同时参考当前状态、远期目标和刚刚预测的子目标,给出多组完整动作方案。论文用高斯混合模型表示这组方案,使候选可以保留不同的接触位置或接近方向,而不必全部挤在一种动作附近。

这些方案并不会被直接执行。冻结的 LeWM 世界模型——也就是参数保持不变的潜在世界模型——会预测每组动作的结果,再用 CEM(交叉熵方法,一种反复保留较优候选、据此调整下一轮搜索范围的优化方法)筛选和改进方案。最终只执行选中路线的前一段,然后根据新观察重新规划。

这套设计的关键,不只是“加入子目标”。SAGE让子目标同时承担两种职责:它既是世界模型评价近期结果的标尺,也直接约束候选动作从哪里产生。换句话说,“下一站在哪里”和“怎样去下一站”被绑在了一起。

长短子目标各管一段

SAGE还允许同一个生成器处理不同时长的子目标。短时长子目标保留局部修正所需的细节;长时长子目标负责推动整体进度。可以把它理解成导航:临近路口时需要精确到转向,长直路上则更关心有没有朝目的地方向前进。

训练时,研究者从专家轨迹中抽取对齐片段,其中包含近期历史、远期目标、某个时长后的局部状态,以及这段时间内的专家动作。子目标生成器先学习预测局部状态;随后它被冻结,动作生成器使用它实际预测出的子目标学习专家动作。这样,动作生成器训练时就会接触子目标预测可能带来的误差,而不是只在完美中间目标上练习。

两组长程结果最醒目

论文在 PushT 和 OGBench Cube 上测试了方法。前者要求持续进行平面接触操作,后者涉及机械臂移动、抓取和放置。各方法使用相同的冻结 LeWM、候选数量和 CEM 优化预算。每个规划距离使用三份固定测试清单,每份包含 50 个起点—目标对,并报告三份结果的均值和标准差。

在目标距离 H=150 时,论文报告 PushT 的成功率由 12.7%升至64.7%,OGBench Cube 由26.7%升至67.3%。这两项结果说明,在论文设置下,目标越远,改善候选动作质量的价值越明显;但它们不能直接证明 SAGE 已在各种机器人任务上普遍有效。

拆分实验也回答了“究竟是哪一步起作用”。只生成局部子目标、仍从普通高斯分布初始化动作的 Generator-only,在 H=150 时达到 PushT 58.7%和 Cube 51.3%;完整 SAGE 分别为64.7%和67.3%。这意味着,更合适的近期目标本身已经带来主要收益,而让动作生成直接受子目标约束还能进一步改善结果,尤其在 Cube 上更明显。

另一项实验去掉了世界模型的候选排名和 CEM refinement,只执行动作先验中权重最高的方案。在 PushT 的 H=150 设置下,这个 SAGE prior top 只有16.0%,完整方案则为64.7%。所以动作生成器并没有替代世界模型。它负责提出更像样的选项,世界模型仍负责检查和修正。

为什么值得关注

SAGE提供了一个很实用的观察:扩展规划能力,不一定总要训练更大的预测模型。世界模型和计算预算不变,只要把有限候选集中到更可能成功的区域,也可能显著拉长有效规划距离。

它还把长程规划中的两个常见思路接了起来。一个是把远期任务拆成可达的中间状态,另一个是学习更好的动作提议分布。SAGE让同一个子目标既定义近期要到哪里,又影响应该尝试哪些动作。与漫无目的地多抽样相比,这种搜索更像有路线提示的试错。

论文的时长安排实验还显示,规划效果不只取决于每段多长,也取决于长短段落的排列顺序。更频繁地重新观察和规划可能提高成功率,但也会增加计算开销。作者因此把根据状态和剩余距离自动选择规划时长,列为后续方向。

局限与未知

  • 目前证据来自同一篇 arXiv 论文。实验只覆盖 PushT 和 OGBench Cube,不能据此判断方法在更广泛任务和真实环境中的表现。
  • 最醒目的 H=150 结果有三份固定清单的均值与标准差设计作为背景,但论文材料不足以支持统计显著性或跨系统泛化结论;PushT 上完整 SAGE 在该设置的标准差为9.5个百分点,Cube 为3.1个百分点。
  • SAGE依赖专家轨迹训练子目标与动作生成器。供稿材料没有比较获取这些轨迹的成本,也没有说明面对明显偏离专家数据的状态时会怎样。

供稿材料 SOURCES — 1

← 返回 2026-07-24 · 学术板块