Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.094 — 2026-10-06
PAPER H 9 约 7 分钟

FutureWorlds:让机器人比较多种未来

FutureWorlds让机器人同时预演、比较多种未来,把“哪条更靠谱”变成新的训练信号。

你让机器人把杯子推到托盘里。它如果只预演一种结果,看到的可能只是“杯子大概向前移动”;但现实里,机械臂的姿势、杯子的位置,甚至杯子有没有被碰到,都可能不同。更有用的做法,是让机器人先想出几种未来,再比较哪一种最接近真实结果。

FutureWorlds做的正是这件事。它把机器人世界模型——一种学习“采取动作后,环境会怎样变化”的模型——从预测单一路径,推进到构造、保存并比较多种替代未来。论文的关键不只是“多生成几个视频”,而是把不同未来之间的质量差异变成训练信号。

本文数字与效果均来自Hao Wu等人的FutureWorlds论文及同项目代码,尚无第二个独立信源交叉验证;论文以arXiv预印本发布,材料未说明是否经过同行评审。

多想几条路,还要彼此真不一样

FutureWorlds建立在多模态离散自回归模型上。“多模态”指模型同时接收画面、机器人动作和可选的语言指令;“离散自回归”可以理解为视频版接龙:模型把画面变化压缩成一串离散符号,再逐个预测后续符号。已经生成的结果会成为下一步的依据,因此前面的小错误也可能一路累积。

传统的监督训练主要让模型照着记录过的真实轨迹学习。训练时,它总能看到正确的历史画面;实际预测时,它只能接着自己生成的画面往下走。这种落差容易让机械臂逐渐偏离正确姿势,物体位置也越预测越不准。

于是,FutureWorlds在强化学习阶段使用diverse beam search,即“多样化束搜索”。普通beam search不会只保留一条预测,而会同时展开若干高分路线;多样化版本还会惩罚候选之间的重复,避免四条路线看起来几乎一样。

论文的设置是四个搜索组,每组保留两条分支,最后每组产出一条轨迹用于比较。这样得到的候选既不能离模型认为合理的区域太远,又要有足够差异。否则,多生成几条近乎相同的未来,并不会提供多少新的学习信息。

每条未来都得带着自己的记忆

分叉之后,麻烦随之而来。假设一条预测里杯子已经向左滑,另一条里杯子仍在原位。模型继续生成时,必须分别记住这两段历史。如果用错上下文,就像拿甲路线的地图去评价乙路线,比较结果不再可靠。

FutureWorlds因此给每个候选配一份有上限的独立记忆。记忆保留初始场景、一个状态锚点,以及最近若干次预测和对应动作;旧内容在超过容量后退出上下文。搜索分支被重新排序时,它们的记忆也跟着移动。

更重要的是,模型生成某条未来和计算这条未来的训练分数时,使用的是同一份历史。论文把这种做法称为candidate-specific bounded memory,即“候选专属的有限记忆”。有限意味着显存开销不会随预测长度无限增长;专属则保证每条分支都沿着自己的世界继续走。

比完以后,怎样让模型学会

论文提出MemSPO,全称是Memory-Conditioned Search-Guided Policy Optimization,可译为“记忆条件下、由搜索引导的策略优化”。它先把候选符号解码成视频,再根据像素误差和感知距离给完整轨迹打分。

这里的感知距离以LPIPS衡量。它比较两幅图在视觉特征上的差异,数值越低,表示预测与真实画面越接近。MemSPO不把某个分数孤立地当答案,而是在同一输入生成的一组候选内部比较:哪条相对更好,哪条相对更差。它再把这种相对优势分摊到轨迹中的符号上,更新世界模型。

真实未来画面只用于计算奖励,不会被塞进候选记忆。换句话说,模型确实要靠自己生成的历史走完全程,然后再拿结果与真实轨迹对照。论文同时承认,候选由搜索产生,而非严格从当前策略独立采样,因此这种训练是“搜索引导的替代目标”,不保证得到无偏的在线策略梯度。

数字说明了什么

研究者在RT-1、BridgeV2和RoboCasa三个数据集上评测了真实与模拟环境中的机器人操作。每个数据集使用128条固定的留出轨迹,比较32帧预测。FutureWorlds在三项画质指标上都领先表中基线。

最直观的是LPIPS。相对各数据集该指标上最强的基线,FutureWorlds在RT-1、BridgeV2和RoboCasa上的LPIPS分别降低14.78%、20.84%和9.12%。这是相对降幅,不能理解为绝对下降了相同数值,更不能直接等同于机器人任务成功率提高。

只看后训练阶段,200次MemSPO更新后,在固定解码与记忆配置下,32帧LPIPS相对普通GRPO分别降低9.98%、1.58%和2.17%。GRPO是一种在同组候选中计算相对奖励的强化学习方法;这里的对照说明,加入多样化搜索和匹配历史后,优势不只是来自“做了强化学习”。

记忆消融也很关键。研究者固定模型权重和解码方式,只改变保留的历史。与不保留历史记忆相比,完整记忆使三个数据集32帧预测的均方误差分别降低40.83%、57.69%和29.22%。其中最近历史贡献最大,初始锚点带来较小的额外收益。

运动评测给出了另一层证据。相对监督训练版本,FutureWorlds在三个数据集上的光流误差分别降低12.40%、4.57%和16.68%。光流描述画面中物体如何移动;这组结果表明,改善不只体现在纹理更像,也涉及机械臂和物体运动更接近真实轨迹。

为什么值得关注

这项工作的变化看似朴素:不要让世界模型只复述一条未来,而要让它主动制造可比较的分歧。真正有价值的是三件事被连到了一起:候选要有差异;每个候选要保留自己的历史;比较结果还要能反过来训练生成模型。

这让“反事实”第一次成为更具体的学习资源。这里的反事实,就是问“从同一局面出发,如果未来以另一种方式展开会怎样”。FutureWorlds目前固定动作序列,比较的是同一动作条件下不同的场景演化假设;它还不是让机器人自主试遍不同动作。但从单一路径拟合走向多未来比较,确实改变了世界模型从自身预测中学习的方式。

代价也很清楚。论文报告,在BridgeV2的资源测试中,模型含视觉编解码器共有0.257B参数,峰值显存1.89 GiB;但束搜索生成一次32帧轨迹需26.76秒,而iVideoGPT为4.14秒。多条未来提供了更丰富的信号,也带来了明显延迟。

局限与未知

  • 现有证据主要是离线视频预测指标。论文把闭环规划和真实机器人控制验证列为未来工作,因此还不能据此断言机器人执行任务会更成功。
  • 论文展示了超出训练时域的继续预测,但材料没有给出可靠外推的具体长度、失败案例或更长时间后的退化速度。
  • 结果来自同一项目团队。虽然论文报告了固定轨迹、消融实验和资源测量,仍需独立复现;束搜索的26.76秒延迟也限制了实时使用。

供稿材料 SOURCES — 1

← 返回 2026-10-06 · 学术板块