想把课本变成自己的声音来朗读,通常要处理模型部署、接口适配和生成速度。开源项目 open-omnivoice-tts 把这些环节装进一个本地 TTS(文字转语音)服务:应用提交文字,就能直接取得音频;再给一小段参考录音,还可以克隆其中的音色。
作者称,服务在 RTX 3080 上生成一句话约需 0.3 秒,并针对快速启动生成做了优化。它还提供 OpenAI 兼容接口——沿用 OpenAI 的请求格式和调用习惯,现有客户端通常只需更换服务地址和凭证,就能转接到本地后端。遇到长文本时,系统会按段落依次处理。作者自己的用法,是把学校课本制成个人音色的有声书,开车时收听。
项目免费开源,默认参数已经调好,也允许修改 CFG guidance scale 等设置。不过,0.3 秒是作者自述,材料没有给出独立测试、句子长度或音质对比。语音克隆还涉及录音授权和冒用风险,使用他人声音前应先取得许可。