做一段多人音频,过去常像拼接不同工种:一个系统合成人声,另一个补风雨、脚步和混响,最后还要对齐角色、时机与音量。SwanTale想把这些工作交给同一个模型:既能按自然语言从头设计角色声线和声场,也能听一小段参考录音,用相似声线说出新台词。后者叫“零样本语音生成”,意思是不必为这位说话者另行收集大量录音并训练。
它最值得注意的不是单项功能,而是统一方式。团队整理了约7000万条分层描述记录,不只标注台词,还描述环境、人物风格和局部音效;模型内部再用 Unified MoE——一套按任务和音频类型分派处理路径的“专家混合”结构——协调指令式生成、声音复刻和多种音频。训练还从零样本能力逐步扩展到完整混合任务,避免一开始把不同目标全塞在一起。
作者称,SwanTale在多项零样本与指令生成指标上领先,并在两类任务中取得最佳表现力分数。不过当前材料未给出这些分数及与基线的具体差距。更稳妥的看法是:它展示了语音基础模型正在从“分别合成再拼装”,走向在一条时间线上统一安排多人对白与场景声音。