Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.074 — 2026-09-16
REPO 216 STARS 约 1 分钟

VoxCPM2绕过Tokenizer做语音

VoxCPM2跳过音频编号环节,直接生成连续语音,还能设计和克隆声线。

IMAGE — GitHub Trending(Python·日榜)

让 AI 念稿不难,难的是既自然地切换多种语言,又能按描述设计声音,或从一小段录音复刻说话风格。OpenBMB 的 VoxCPM2 正面向这些场景:它支持 30 种语言、声音设计和可控声音克隆,连续两日登上热榜,今日新增 216 星。

它最特别的是绕过 Tokenizer——许多语音模型会先把声音切成一串离散编号,再据此生成;VoxCPM2 则直接处理连续的语音表示。其架构把自回归与扩散结合:前者按顺序维持长段语音的连贯,后者从噪声中逐步还原声学细节。项目方称,这个 20 亿参数模型使用超过 200 万小时的多语种语音训练,可从文字描述创造新声线,也可依据短录音克隆音色并调节情绪、语速和表达。

模型还能直接输出 48kHz 音频,代码与权重采用 Apache-2.0 许可证开放。上述能力与性能均来自项目说明,材料未提供独立评测;但把多语种生成、声音设计和克隆集中到一套无 Tokenizer 系统中,已足以解释它为何值得关注。


供稿材料 SOURCES — 1
01
OpenBMB/VoxCPM GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-09-16 · 开源板块