Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
PAPER 约 1 分钟

视频大模型可能看不懂运动

MotionBlind用成对视频测试运动感知:会认物体的Video-LLM,未必看得懂速度与方向。

同一个人在同一间屋里做同一动作,只是一次更快、一次更慢。视频大模型可能把人物和家具都说对,却分不清哪次更快。MotionBlind正是为这种“看见画面、没读懂运动”的落差设计:它专测速度、方向和运动幅度,挑战把Video-LLM——能看视频并用语言回答问题的模型——直接当作世界模型“眼睛”的常见假设。

研究团队自行录制内容近似、仅运动属性不同的成对视频。每组配两道互补的是非题,共形成四项判断;四项全对才算通过。这个对比式设计尽量堵住模型靠人物、场景或语言习惯猜答案的捷径。作者测试六个开放模型和两个闭源前沿模型,并改变帧数、抽帧方式和播放顺序。结果显示,开放模型整体接近随机水平;增加到更多帧,或用更聪明的选帧方法,也没有补上差距。只有Gemini 3.1 Pro整体通过,但仍在纯速度类别上失败。

这值得警惕:世界模型要预测下一刻会发生什么,感知前端若先读错速度或方向,后续规划就建立在错误输入上。论文说明的不是模型完全“看不见”视频,而是流畅描述静态内容,不等于可靠理解运动。


供稿材料 SOURCES — 1

← 返回 2026-09-13 · 学术板块