Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
REPO 83 STARS 约 1 分钟

Pocket TTS把语音合成塞进CPU

Pocket TTS让普通电脑用CPU本地生成语音,约200毫秒即可开始播放。

IMAGE — GitHub Trending(全语言·日榜)

想让电脑把一段文字念出来,往往要调用远程语音服务,或准备独立显卡。Kyutai 的 Pocket TTS 想把这件事变轻:它把 TTS(Text-to-Speech,即文字转语音)封装成可在 CPU 上运行的本地模型,安装后可通过命令行或 Python 调用。这样一来,离线工具和低成本应用也能在普通电脑上生成声音。

项目模型规模为 1 亿参数,并支持流式音频——整段语音还没生成完,就先把开头交给用户播放。项目方称,首个音频块约需 200 毫秒;在 MacBook Air M4 的两个 CPU 核心上,生成速度约为实时播放速度的 6 倍。它还支持英、法、德、葡、意、西六种语言,以及用 WAV 音频进行声音克隆。项目仍依赖 PyTorch 2.5 以上版本作为运行底座,但不要求 GPU 版本。上述速度来自项目方披露,材料未提供其他设备上的独立测试。


供稿材料 SOURCES — 1
01
kyutai-labs/pocket-tts GitHub Trending(全语言·日榜) · REPO
原文 ↗

← 返回 2026-08-10 · 开源板块