Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER H 1 约 6 分钟

Qwen3.8-Omni:全模态走向原生Agent

Qwen把听、看、规划和工具调用装进同一模型,尝试让多模态AI从“会理解”走向“能交付”。

你把一段两小时的会议视频交给 AI,希望它认出谁说了什么、整理待办,再把任务发出去。普通多模态模型往往只能“看懂一段内容”;真正完成这件事,还要持续记忆、查找片段、调用工具并执行多个步骤。Qwen Team 发布的 Qwen3.8-Omni-Flash,想把这些能力放进同一个模型:它同时处理文字、图像、声音和视频,并以 Agent——能够规划步骤、使用工具和持续执行任务的 AI 系统——参与现实生产流程。

这里的“原生全模态 Agent”并没有统一行业定义。Qwen Team 用它强调两点:模型不只分别识别各种媒介,还要联合理解;Agent 能力也不只是外部程序套在聊天模型之外,而是在训练阶段就被迁移到音频、视频和工具执行任务中。本文所有结果均来自 Qwen Team 论文,尚无第三方评测或实际部署报告交叉验证。

不把视频一次塞完,而是按需取证

长视频的麻烦不只是“长”。如果把所有画面和声音一次性交给模型,视频越长,输入成本大致越高,而回答问题真正需要的证据可能只在几分钟内。

Qwen3.8-Omni-Flash采用由粗到细的办法:先根据问题制定搜索计划,再反复调用工具,取回相关的音频和视频片段;必要时把声音与画面分析交给多个子 Agent 并行处理。它更像一名先看目录、再翻到关键页的研究助理,而不是从第一页逐字读到最后。

配套模块进一步把视频压缩成容易使用的中间材料。Omni-Caption生成详细描述,Omni-Video2Note整理结构化笔记,Omni-Memory按需加载原始影音,Omni-Skill-Creator则从教程或标准操作流程中提取可复用的执行技能。Qwen-MM-Plugins把这些能力接入现有Agent框架;Qwen-Live-Harness则面向实时交互,负责协调上下文、记忆、工具和子Agent。

文字里学会的办事能力,迁移到声音和视频

模型沿用Qwen3.8-Next的稀疏混合专家架构。混合专家模型(MoE)可以理解为内部有许多专长小组,每次只调动一部分,因此能扩大模型容量,又不必为每个输入启用全部计算。

它用三套编码器分别处理视觉、一般音频和空间音频,再把结果投射到同一个表示空间,按时间顺序交给负责推理和工具调用的Thinker。空间音频保留声源方向、距离和运动线索;显式时间戳则帮助模型对应“什么时候听到什么、同时看见什么”。

训练分成四段。模型先在固定语言主干的情况下对齐视觉和音频编码器;随后用约2.5万亿token进行联合训练,其中包括1.1万亿文本token、0.7万亿音频token,以及图像、视频和视听组合数据。之后再训练Qwen Sparse Attention(QSA)——一种先筛选相关上下文块、再精读原始token的稀疏注意力机制。原生预训练长度为262,144 token,后训练阶段扩展到100万token。

后训练先让多个专门教师模型分别教授推理、编程、Agent执行、视觉和音频能力,再把这些能力蒸馏到一个模型中。蒸馏就是让统一模型学习多个专家产生的示范轨迹。随后,团队用强化学习继续训练;长程任务的奖励依据实际执行结果,而不是模型自己声称“已经完成”。

它想交付的是作品和行动

团队展示的方向包括会议处理、短剧翻译、音乐生成MV、长片解说、视频研究报告和教程转技能。例如会议场景中,模型尝试同时完成说话人区分、转写、身份对应、纪要和行动项提取,并可继续调用工具发邮件、组织任务或开始编码。

最能体现“从感知到行动”的案例,是一项12小时自动研究实验。模型自行选择四川话语音识别评测集、建立基线、听取错误样本并制作训练数据。经过四轮实验和3,413条训练样本,Qwen2.5-Omni-3B的字符错误率从25.79%降至15.30%,相对下降约40.7%。这是同一评测集上的团队自报实验,但它展示了一个完整闭环:听见问题、诊断原因、安排实验,再依据结果保留或撤回改动。

论文还称,相比Qwen3.5-Omni-Plus,新模型在29项音频推理、视听推理和视听Agent评测上的平均分提高超过25%;估算的每小时音频与视听API输入成本分别下降超过98%和93%。文本能力并非全面提高:例如SWE-bench Pro为63.3,对照Qwen3.8-Flash的62.5;DeepSWE 1.1则为57.8,略低于后者的58.7。这个结果至少说明,加入全模态能力没有让所有文本任务同步受益。

为什么值得关注

这次发布的平台意义,不在于又多了几个识别分数,而在于它重新划分了多模态模型的工作边界:输入不再只是等待回答的图片或视频,而可以成为规划、检索、创作和执行的工作现场。模型既能担任主Agent,也能作为专门处理影音的子Agent;两个开源框架则试图补上现有Agent系统不擅长接收流式音视频的缺口。

如果这套路径成立,未来衡量多模态AI的关键问题将不只是“它看懂了吗”,还包括“它能否找到证据、调用合适工具,并稳定交付结果”。

局限与未知

  • 所有效果与成本数字均来自Qwen Team。论文提供了多项基准结果,但目前没有独立复现或生产部署证据。
  • 100万token上下文不等于所有模态下都能无损使用;论文没有在所给材料中说明实际可用长度及随上下文增长的性能衰减。
  • 视频翻译、MV生成和自动研究展示的是能力与工作流案例,不能直接等同于稳定、可规模化的生产能力。

供稿材料 SOURCES — 1
01
Qwen3.8-Omni: Towards Native Omni-Modal Agents arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-26 · 学术板块