Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER 约 1 分钟

机器人的身体从世界模型里拆出来

先把机械臂的运动渲染出来,再让世界模型专心预测环境如何响应。

想象机器人伸手推杯子:画面里既有机械臂移动,也有杯子被推动。普通视频世界模型往往要把两件事一起学,容易把“机械臂长什么样、怎样响应指令”也当成环境规律。Robot-Factored World Models 的思路是先拆开:机器人负责把动作命令换算成自身运动,模型只需预测周围物体会怎样变化。

关键在于作者没有使用执行后记录的真实机器人状态。那里面已经包含碰撞、延迟和控制修正,等于提前透露了本应预测的交互结果,形成“信息泄漏”。他们改用 nominal trajectory——机器人按自身控制器和运动学、但尚未考虑场景接触时得到的预定轨迹,再依据 URDF(描述机器人结构和几何形状的文件)把机械臂渲染进画面。模型看到的是“机器人准备怎样动”,而不是某台机器专用的控制数字。

作者还加入末端执行器与场景的深度信息,帮助模型分辨画面上看似重叠的机械臂和物体是否真的接近或接触。论文自述,这种接口优于直接输入动作向量的基线,并能在推理时迁移到未见过的机器人本体;其意义不只是画面更准,而是尝试把机器人专属的身体问题留给机器人,把环境变化留给世界模型。


供稿材料 SOURCES — 1
01
Robot-Factored World Models via Robot Rendering arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-07-30 · 学术板块