想在自己的电脑上把文字变成语音,常见麻烦不只是模型大,还要安装 Python、PyTorch,并面对偏向 NVIDIA 显卡的 CUDA 加速环境。VoxGen 想把这件事变简单:它是一款面向 VoxCPM 2 的本地 TTS(文字转语音)推理引擎,用 Rust 编写,并以 Vulkan 承担 GPU 计算。Vulkan 可适配 AMD、Intel、NVIDIA 等多家硬件,因此 AMD 用户也多了一条不依赖 CUDA 的路径。
开发者称,项目起因是其显卡运行现有方案时语音严重卡顿、GPU 占用频繁飙升;改用 VoxGen 后,AMD 显卡运行更流畅,并为 Radeon RX 7900 XTX 设计了更激进的功耗和速度优化模式。程序还能从命令行调用,便于接入其他软件或脚本。安装时只需可执行文件和两份指定的 GGUF 模型文件——一种便于本地推理部署的模型格式。目前预编译版本仅提供 Windows 版;作者也未给出速度、显存占用或音质对比数据,因此实际提升仍需更多测试验证。