Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
NEWS 约 1 分钟

开源长文本TTS新添2.9B模型

2.9B 参数开放权重 TTS,兼顾长篇连续生成、声音模仿与低延迟本地推理。

做本地有声书,难点不只是“把字念出来”:模型还要连续读很久,语气不能太僵,最好也别让听众等太久。TontaubeV1 是一款 2.9B 参数的开放权重 TTS——也就是把文字变成语音的模型,主攻英语和德语。它还能用最长一分钟的参考录音做零样本声音克隆,即无须针对某个声音重新训练,就能模仿其声音特征。

它把语音生成拆给四个自回归模型,按顺序从粗略的语义结构补到细致的声学信息;滚动上下文窗口则让模型一边忘掉过远内容、一边继续生成,从而支持流式、理论上不受固定篇幅限制的长文本。据发布者自测,预热后的 RTX 5090 约 200 毫秒可产出首段编码音频,批处理时速度最低达到 0.02 RTF——生成一秒语音约需 0.02 秒,相当于约 50 倍实时速度。

代价是当前门槛不低:低显存和平衡配置仍需至少 24 GB 显存,高吞吐配置需 32 GB。发布者还称其在 400 段、由大模型担任评委的有声书测试中,韵律表现对 ElevenLabs Flash v2.5 得分为 50.1%;但尚未完成大规模真人听测,真实听感仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 开源板块