你让语音助手订一张机票,它却沉默了十几秒。你不知道它在思考、查票,还是已经卡住。Gemini 3.8 Live 想解决的正是这种尴尬:让 AI 在持续对话中理解语音和画面,同时调用工具;遇到复杂任务,也能先回应、再一边处理一边报告进度。
Google DeepMind 此次发布了两款模型。Gemini 3.8 Live 面向大规模、重视成本效率的应用;Gemini 3.8 Live Extended Thinking 则面向更复杂的多步任务。前者强调反应和交互,后者增加思考投入。所有性能数字和产品描述目前均来自 Google DeepMind 官方博客,尚缺少独立复现与完整测试配置。
两条路线,不是一味“想更久”
实时推理,指模型在对话仍在进行时快速理解输入并作答。它决定语音 Agent——能听懂要求并代用户执行任务的 AI——能否自然接话,及时调用外部工具。
Gemini 3.8 Live 走的是轻快路线。它支持近实时处理视觉输入,并做视觉 grounding——把一句话里的“这个杯子”对应到镜头中的具体物体。它还能在对话中自动识别并切换 97 种受支持语言。不过,这只说明系统支持切换,不代表每种语言的能力相同,也不代表它们都经过同等强度的测试。
更关键的变化是后台执行。模型调用工具或 API——连接航班、日历或企业系统的程序接口——时,不必暂停对话。它可以先确认请求,继续与用户交流,等后台任务完成后再交付结果。对语音产品来说,这种“边聊边办”比单纯缩短回答时间更重要,因为它让等待过程变得可理解。
Extended Thinking 则处理另一类难题。这个词指模型在回答前投入更多计算,完成多步推理,通常会带来更高延迟和成本。Gemini 3.8 Live Extended Thinking 的做法,是让推理和说话同时进行。它会先用“让我查一下”之类的简短回应确认收到要求,再实时播报多步骤任务的进展。换句话说,它没有消除等待,而是把黑箱式沉默改造成连续对话。
分数不错,但先别急着下结论
据 Google DeepMind 官方博客,Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 获得 82.6 分,排名总体第一;在衡量智能体任务完成的 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking benchmark 上为 35.1%。它在 Big Bench Audio 上取得 97.7%。标准版 Gemini 3.8 Live 则在 Speech Agent Arena 排名第二。
这些数字分别指向语音质量、任务执行和音频推理,但还不能直接回答真实使用中的延迟、价格与可靠性。官方没有在供稿中给出榜单版本、评测日期、参评模型、具体配置或第三方复现情况,因此“第一”应理解为特定评测条件下的结果,而不是全面领先。
在 ServiceNow 的 EVA-Bench 复杂工作流测试中,Google 称两款模型同时推进了准确率与对话质量的 Pareto Frontier——也就是在两项彼此牶制的指标之间取得了更好的组合。该测试通过 Gemini Enterprise Agent Platform 的 Live API 运行,未必能代表其他部署环境。
为什么这次升级值得看
这条路线最早因 Project Astra 演示受到关注。据 Google DeepMind,2024 年 Google I/O 的视频中,系统持续观察桌面和房间后,能回答“我的眼镜放哪了”。那次演示展示的不是一次性的看图答题,而是多模态 AI——同时处理文字、语音和画面的模型——如何保留现场上下文。
如今,竞争重点正从“AI 能不能听懂”转向“它能不能在不打断交流的情况下把事情办完”。标准版负责规模和效率,Extended Thinking 承担复杂推理,两者共同指向一种更实际的语音 Agent:它既要像人一样维持对话,也要像软件一样可靠执行流程。
Google 表示,这些模型将进入 Gemini app、Google Workspace 和 Search,开发者也可通过 Gemini Live API 构建语音智能体。AI 产品生成的音频会嵌入不可感知的 SynthID 水印,用于帮助识别 AI 生成内容。
局限与未知
- 官方使用了“近实时”“高性价比”和“生产就绪”等表述,但没有披露可比较的延迟、价格、故障率与对照实验数据。
- 第三方榜单的版本、日期、参评模型和测试配置仍需回查,现有成绩也尚无独立复现。
- 供稿未提供不同设备、网络和部署环境下的表现,企业平台测试结果不能直接外推到所有应用。