Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
NEWS 约 1 分钟

Gemini 3.8补上语音生成

Gemini 3.8新增两款语音生成模型,从听懂和推理进一步补齐声音输出端。

IMAGE — Google DeepMind Blog

让 AI 念稿不难,难的是让它像导演手里的演员:一句压低声音,下一句换口音,笑声和停顿也卡在合适位置。Google 为 Gemini 家族新增两款文本转语音(TTS,即把文字变成人声)模型,把此前侧重实时理解、工具调用和边说边推理的交互链路,延伸到了声音生成端。

Gemini 3.8 Flash TTS偏向创作和角色设计。用户可以直接用自然语言描述角色、口音和声音特征,覆盖100多种语言及方言;也能逐句指定语气、节奏和表演提示。它还支持从一段30秒、经授权的音频复制稳定声线,并配有同意验证、SynthID水印和C2PA凭证。Google称,该模型在Hume AI的Voice Design Benchmark中以71.4分位列综合第一,口音建模得分为60.8;这些成绩目前来自Google自述。

另一款Gemini 3.8 Flash-Lite TTS更看重低成本、大规模生成,面向配音、音频内容和语音代理。两款模型的分工很清楚:前者像可细调的录音棚,后者像批量生产线。值得看的不只是Gemini会“开口”,而是Google正把理解、推理、执行与声音输出接成更完整的实时交互产品栈。


供稿材料 SOURCES — 1

← 返回 2026-09-24 · 科技板块