你让 AI 研究一段长视频,它可能根本不认真看:直接搜索文字,甚至凭训练时记住的内容猜答案。Video-DeepResearch(Video-DR)想解决的正是这个问题。它把 Deep Research Agent——会拆解问题、调用工具并整理证据的系统——从静态图片推进到连续视频,让检索、时间定位和证据组织连成一条链。
论文最值得注意的不是多加了一个视频工具,而是规定工具的开放顺序。系统先选出关键帧,再框出画面中的关键物体并做视觉搜索;完成这些跨帧定位后,才开放网页检索。像先在录像里确认“哪一秒、哪个位置出现了什么”,再去查它是什么。这个设计针对作者发现的模态偏置:测试中,Qwen3.5-397B-A17B 每题平均只调用 0.10 次视觉工具,却调用 1.27 次文字工具;GPT-5 则以几乎零视觉工具调用取得 57% 准确率,暴露出参数知识泄漏——模型靠内部记忆答题,而非真正查证。
作者还构建了含 200 道多步视频问答的 VideoDR-Bench。其自述结果显示,Video-DeepResearch-35B-A3B 平均准确率为 64.0%,高于 Claude-4.5-Sonnet 的 59.0%;这些效果目前仍以论文评测为准。