Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.043 — 2026-08-16
PAPER 约 1 分钟

保留未来,删掉逐帧展开

RIFT不再逐帧“脑补”未来,而是一次生成机器人决策所需的未来摘要。

机器人行动前,可以先在“脑中”播放一段未来视频:杯子会往哪儿移动,机械臂下一步该怎么走。问题是,逐帧生成这段预演很慢,尤其扩散模型还要反复修改画面。RIFT追问:机器人真的需要看完整预演,还是只要其中对行动有用的未来信息?

作者在四种世界动作模型和LIBERO全部40项桌面任务上做了闭环干预——让机器人边执行边观察真实结果,同时替换或遮掉内部信息。结果显示,动作确实依赖未来内容及其位置;但对Joint和Cosmos-2,反复重放同一份最终K/V Cache,执行几乎不变。K/V Cache可以理解为模型留给后续决策读取的“内部笔记”。据此,RIFT用一组可学习的“预期token”一次写完整份未来笔记,再交给动作模块,不再生成可观看的视频。作者称,它在LIBERO上接近逐帧预演方案的成功水平,同时降低动作延迟;不过材料中的具体数值缺失,效果幅度暂无法判断。


供稿材料 SOURCES — 1

← 返回 2026-08-16 · 学术板块