Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.017 — 2026-07-21
PAPER HF 7 约 1 分钟

长视频模型把声音也听进去

AV-Flamingo让长视频模型同时看画面、听声音,还能按时间梳理前后关系。

看一段长视频时,关键线索未必在画面里:门外响起警报、人物停下动作,合起来才说得清发生了什么。AV-Flamingo正是为这种任务设计的音画联合模型——同时利用画面和声音,并记住相隔较远的事件,而不是只“看”几个短片段。

它最值得注意的一步,是把音频和画面按时间切成同步片段,再依照时间戳交错送入语言模型。音频由滑动窗口分成互不重叠的30秒片段,因此长录音不必直接截断;推理时,中间步骤也会对应到具体时间点,方便模型梳理“先发生什么、后发生什么”。团队还整理了700万条描述和问答训练实例,其中包括480万组问答,用三阶段训练把模型从短距离感知逐步带到长视频、多事件推理。

作者称,AV-Flamingo在15项以上相关基准中优于相近规模的开放模型,并开放模型、训练与推理代码;这些效果目前仍以论文自述为准。


供稿材料 SOURCES — 1

← 返回 2026-07-21 · 学术板块