直播或通话时想换一种音色,过去常要在速度、延迟和设备性能之间取舍。MeanVC2想把这件事搬到普通 CPU 上:它做的是语音转换——保留原话的大致内容和说法,只改变说话人的音色,并支持跨性别、跨语言转换。流式处理让系统把声音切成小段,边听边输出,不必等整句话录完。
据 MeanVC2 项目页,模型会在解码时有限度地“偷看”后续声音,以 40 毫秒音频块稳定转换;作者报告端到端延迟从上一代的 211 毫秒降至 110 毫秒。Reddit 演示者称,它接入 audio.cpp 本地音频栈后可在 CPU 上达到三倍实时,即处理一秒音频约需三分之一秒;不过 Hugging Face 模型卡给出的单核完整流程实时因子低于 0.633,两组数字的硬件和测试口径未完全披露,不宜直接等同。项目采用 Apache License 2.0,并要求使用者取得相关说话人的同意。