做一段配音,常要在克隆声音、转写台词和合成音频的不同服务间来回切换,素材还可能需要上传云端。VoiceStudio 想把这些步骤收进一套桌面工具:TTS(文本转语音)负责把文字念出来,ASR(自动语音识别)负责把录音变成文字,并进一步支持视频配音、听写、批量生成和有声书制作。
它最值得注意的不是某个新模型,而是整合规模:项目列出 16 个 TTS 引擎、11 个 ASR 引擎,并提供 646 种 TTS 语言的目录。不过,项目方也明确提醒,实际可用语言和效果取决于所选引擎。核心流程采用 Local-first——优先在用户自己的设备上处理,声音、项目和输出默认留在本机,也不要求账号、API Key、订阅或按量计费。代价是速度和模型可用性受电脑硬件限制;项目目前仍处于 active beta,稳定工作建议使用最新正式版本。