Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.065 — 2026-09-07
REPO 128 STARS 约 5 分钟

OmniVoice:一次克隆说遍600种语言

OmniVoice 用短录音克隆声音,并覆盖 600 多种语言;亮点很大,但跨语种效果仍待验证。

IMAGE — GitHub Trending(Python·日榜)

你录下几秒钟自己的声音,交给模型,再输入一段外语文字,它就能试着用“你的声音”念出来。过去,为一个新声音制作语音系统,往往要专门收集大量录音;OmniVoice 想把这件事缩短为一段 3—10 秒的参考音频,同时把可生成的语言扩展到 600 多种。

这也是它值得现在关注的原因:项目连续登上热榜,单日新增 128 星。只是需要先说清,本文关于模型能力的数据均来自 k2-fsa 的官方 GitHub 仓库,尚无独立信源交叉验证。

一段录音,怎样变成另一种语言?

OmniVoice 是一个零样本文本转语音模型。文本转语音,也就是 TTS,负责把文字变成可播放的语音;“零样本”则表示,模型遇到一个新说话者时不用重新训练,只凭一小段参考录音,就尝试复现其声音特征。

使用时,用户提供参考音频和对应文字,再输入希望朗读的新文本。参考文字也可以省略,由 Whisper ASR——把语音自动转成文字的识别模型——完成转写。模型还允许把参考音频预先编码成一个可保存的声音提示,之后反复调用,不必每次重新载入和识别录音。

官方建议参考片段控制在 3—10 秒。更长的录音会拖慢推理,甚至可能降低克隆效果。跨语言克隆时,参考录音与目标文本语言不同,生成语音还可能带上参考语言的口音。换句话说,模型复用的不只是抽象的“嗓音”,也可能把原语言的发音习惯一起带过去。

它不只会复制声音

除了声音克隆,OmniVoice 还支持“声音设计”:用户不用提供真人录音,而是通过性别、年龄、音高、方言或口音、耳语等属性塑造一个声音。这更像给配音角色填写设定表,而不是模仿某位现实中的说话者。

它也提供更细的控制。用户可以在文本中加入 [laughter] 这类非语言符号,让语音包含笑声;遇到容易读错的词,可以用拼音或音素修正发音。音素可以理解为构成语音的基本发音单位,直接标注它,相当于告诉模型“这个词具体要怎样念”。阿拉伯数字还可先转写成单词,避免把“2345”机械地逐位读出。

模型采用扩散语言模型式架构。扩散模型通常从噪声或高度扰乱的状态出发,经过多轮去噪、补全,逐渐生成目标内容。OmniVoice 把这种思路用于语音生成。官方将其描述为简洁、可扩展,并声称兼顾质量与速度,但仓库没有给出足以支持横向比较的基准结果。

600 多种语言意味着什么?

覆盖 600 多种语言,把它的潜在用途从常见语种配音推向更广的跨语言创作。创作者可以复用声音特征,应用开发者也能用同一套模型处理更多语言,而不必为每种语言分别搭建系统。

不过,标题里的“一次克隆说遍 600 种语言”应当理解为能力方向,而不是已经完成的逐语种验收。官方分别宣称模型支持 600 多种语言和参考语音克隆,却没有披露同一克隆音色在全部语言上的覆盖率、逐语种结果、测试条件或完整语言表现。两项能力同时存在,不等于所有组合都达到相同质量。

速度方面,仓库给出的最低 RTF 为 0.025。RTF 是实时因子,即生成耗时与音频时长之比;0.025 的倒数约为 40,因此官方称其速度可达实时播放的 40 倍。但这是“最低可达”的结果,材料没有说明所用硬件、音频长度、批量大小、采样步数,也没有说明是否计入前后处理,不能把它当成所有设备上的常规速度。

开源让它更容易被试用

OmniVoice 已提供 GitHub 源码仓库、PyPI 安装包、本地 Web UI 和 HuggingFace Space。不会写代码的人可以先通过网页界面体验;开发者则能调用 Python API 或命令行工具。硬件支持覆盖 NVIDIA GPU、Apple Silicon 和 Intel Arc GPU,官方测试过 Arc A310 与 Arc Pro B50。

这种完整度很重要。一个语音模型能否真正进入创作流程,不只取决于演示效果,也取决于安装、下载、重复调用和硬件适配是否省事。OmniVoice 把模型、界面和开发接口一起放出来,使社区可以较快验证它到底适合哪些场景。

局限与未知

  • 所有效果论断目前都来自项目官方仓库。“高质量”“最先进”以及“覆盖最广”等说法没有附带评测集、竞品范围、人工听测或论文证据,暂不宜视为已证实结论。
  • 600 多种语言与声音克隆尚未给出完整的组合测试。尤其是低资源语言、跨语言口音和声音相似度,现有材料不足以判断。
  • Intel XPU 支持存在限制:flash_attn 不可用,模型会回退到 SDPA;使用 packed sequences 与 flex_attention 的训练也只有部分支持。

OmniVoice 眼下最有分量的,不是已经证明“每种语言都说得一样好”,而是把多语言、短录音克隆、声音设计和可直接运行的开源工具放进了同一个项目。它把能力边界推得很远;接下来真正需要看的,是公开评测能否跟上这张雄心勃勃的功能清单。


供稿材料 SOURCES — 1
01
k2-fsa/OmniVoice GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-09-07 · 开源板块