Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
PAPER H 7 约 1 分钟

世界Token给VLA补一门预测课

让机器人训练时预判动作后果,部署时却不用现场生成未来视频。

机器人会按指令抓杯子,不等于它真懂“手一推,杯子会往哪儿走”。World Tokens 想补上这门预测课:视觉—语言—动作模型(VLA,即根据画面和文字直接生成机器人动作的模型)训练时不仅学正确动作,还要学习动作之后场景如何变化。

关键设计是“世界 Token”——由画面和指令压缩成的一组内部表示。未来视频预测和动作生成都只能依赖它,动作模块不能绕回原始信息另找捷径。这样,预测未来所学到的物体位移、接触等变化,会直接进入控制所用的表示。部署时,生成未来视频的分支会被整个移除,只保留世界 Token 相关模块和动作模块,无需在线生成视频。

作者报告,这个 2B 参数模型在实体 R1 Pro 机器人上的成功率从同条件、只学动作的基线 59.4% 提升到 76.0%,同时保持相近延迟。结果仍以论文自述为准,但它展示了一条实用思路:把“想象后果”留在训练期,把执行负担挡在部署之外。


供稿材料 SOURCES — 1

← 返回 2026-08-14 · 学术板块