Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.060 — 2026-09-02
NEWS 约 4 分钟

Gemini开始主动“看懂”视频

Gemini不再匀速扫完整段视频,而会按问题主动找片段、调速度、查画面与声音。

IMAGE — Google DeepMind Blog

你让 AI 从一场 90 分钟的发布会里找出三个关键消息,它通常有两种笨办法:要么从头到尾密集地看,花掉大量计算;要么少看一些画面,却可能漏掉一闪而过的细节。Google DeepMind 新推出的 agentic video understanding,想让 Gemini 换一种做法:先理解问题,再决定去哪里看、看多快,以及该查画面、声音还是字幕。

说白了,Gemini 从“按固定速度看录像”,变成了“带着任务翻录像”。不过,目前所有效果数字都来自 Google DeepMind 的同一篇官方博客,尚无论文、完整评测细节或第三方测试交叉验证。

它到底新在哪?

传统的静态视频处理,会按固定帧率抽取画面,再一次性交给模型。Google 称其默认设置为每秒 1 帧,也可以通过 API 调整。这种办法简单,却有明显取舍:抽得密,Token 和费用会上升;抽得疏,又可能错过不到一秒的动作或镜头切换。Token 是模型处理文字、图像和视频时使用的基本计量单位,输入越多,通常计算和收费越高。

新的 agentic video understanding——可译作“智能体式视频理解”——把观看过程改成循环任务。模型先规划需要找什么,再调用内部视频工具,动态搜索、扫描和检查相关片段。它还能选择用什么速度查看,以及重点读取画面、音频还是转录文本。发现某个时间窗口值得怀疑时,它可以提高取样频率再看一次,而不必让整段视频都接受同样密度的处理。

这有点像查一场很长的会议录像。人不会为了确认一句话,把两个小时逐帧重看;通常会先根据主题和字幕定位,再回到附近片段核对语气与画面。过去开发者可以自己搭建这套检索流程,现在 Google 试图把规划和调用工具的步骤交给 Gemini。

少看一些,反而看得更准?

据 Google DeepMind 官方博客,在其所谓“标准视频分析基准”上,启用这项能力后,分析成本最多降低 66%,Token 消耗最多降低 88%,准确率最多提高 7%。三个数字都是最佳情形的上限,并非平均效果。

Google 还称,Gemini 3.7 Flash 配合这项能力,在其受测模型中位于 accuracy-to-cost Pareto frontier——也就是准确率与成本之间的“帕累托前沿”:想在一个指标上继续改善,通常就得牺牲另一个。这个说法只适用于 Google 所测试的模型,不能据此外推为整个行业领先。

这项能力同时覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。按照官方说明,它已支持上传视频和 YouTube 视频,可通过 Google AI Studio 中的 Gemini API,以及 Gemini Enterprise Agent Platform 使用。

为什么值得关注?

真正重要的变化,不只是节省 Token,而是视频分析开始从“一次推断”变成“可迭代的工作流程”。模型不再平均地处理所有内容,而会围绕目标分配注意力。这尤其适合长视频:10 分钟教程、90 分钟课程乃至数小时录像里,有用证据往往只占很小一段。

Google列出的方向包括亚秒级时刻检索、异常检测和动作或物体计数。时刻检索,就是从长视频中找到问题对应的准确片段。模型可以先粗筛,再精查短暂变化;异常检测也能对可疑窗口提高取样频率。若这些能力稳定,长视频搜索、自动剪辑和内容生产流程都可能少掉不少人工编排步骤。

局限与未知

  • Google没有披露具体基准名称、数据集、样本规模、评测方法、基线配置和分项结果,因此无法判断“最多”出现在哪些任务中。
  • 亚秒级检索、更准确的异常检测和精确计数,目前主要是官方能力描述,材料中没有独立量化证据。
  • 三款模型的正式产品信息与实际可用区域,在现有材料中没有第二信源确认。

供稿材料 SOURCES — 1

← 返回 2026-09-02 · 科技板块