想让电脑把一段文字念出来,往往要调用远程语音服务,或准备独立显卡。Kyutai 的 Pocket TTS 想把这件事变轻:它把 TTS(Text-to-Speech,即文字转语音)封装成可在 CPU 上运行的本地模型,安装后可通过命令行或 Python 调用。这样一来,离线工具和低成本应用也能在普通电脑上生成声音。
项目模型规模为 1 亿参数,并支持流式音频——整段语音还没生成完,就先把开头交给用户播放。项目方称,首个音频块约需 200 毫秒;在 MacBook Air M4 的两个 CPU 核心上,生成速度约为实时播放速度的 6 倍。它还支持英、法、德、葡、意、西六种语言,以及用 WAV 音频进行声音克隆。项目仍依赖 PyTorch 2.5 以上版本作为运行底座,但不要求 GPU 版本。上述速度来自项目方披露,材料未提供其他设备上的独立测试。