Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
PAPER H 14 约 1 分钟

视频模型开始预判三维运动

MotionForesight让视频模型不只看懂当下,还能预判物体未来的三维运动。

看到一只手拉动抽屉,人会自然猜到它接下来沿什么方向滑。视频模型通常只负责理解或生成画面,MotionForesight则让它从一段普通单目视频——即单个相机拍摄、没有直接距离信息的视频——预判被操作物体未来的三维轨迹。这值得关注,因为模型开始回答“物体接下来会怎样运动”,而不只是“画面里发生了什么”。

它最巧的一步,是把原本回看完整视频的3D追踪器改成“预言家”:先用完整片段生成未来轨迹作为伪真值,也就是由现有模型自动制作的训练答案;真正训练预测时,再遮住未来画面,只留下已经发生的部分。模型输出3D场景流——可理解为“带深度的光流”,描述物体上各点之后会往哪里移动。团队冻结大型视频模型和追踪组件,只训练轻量适配模块,并把注意力集中在被操作的物体上。

作者称,MotionForesight只用4万段人类交互视频、无需语言等辅助输入,就能适应训练分布之外的物体、环境、视角和交互,并超过使用逾百万段视频的更大模型。不过,论文材料未在此给出具体指标,效果幅度仍应以完整实验为准。


供稿材料 SOURCES — 1

← 返回 2026-07-23 · 学术板块