Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
PAPER H 1 约 1 分钟

机器人执行延迟会骗过世界模型

延迟不只让机器人慢半拍,还会让世界模型按错误的动作时间线规划。

你让机器人先左转再前进,但旧命令晚到一步,它可能先走再转。麻烦不只是“慢”:世界模型——用动作预测接下来会发生什么的模型——以为正在执行 A,机器实际却在执行 B,后续规划便从错误起点展开。

作者用相同的规划命令、相同的环境状态,只改变动作传输延迟。结果显示,延迟越大,发出的命令与实际动作分歧越大,短期回报也越低。更关键的是,对 TD-MPC2 这类规划式控制器,仅告诉它当前执行了什么,或执行器缓冲区里有什么,都不够;只有把准确的未来动作序列放进模型内部的状态推演,控制才会改善。拿同一信息只给候选轨迹重新打分,并无帮助。

这说明延迟会改变动作的“含义”和时间线,而不只是制造外部扰动。论文据此提出轻量接口:TD-MPC2 向执行端发送未来动作序列,DreamerV3 则接收实际执行动作的反馈;两者都无需修改预训练世界模型。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 学术板块