今天的语音助手常像两台机器拼在一起:一台把你的话转成文字,另一台照着文字念答案。它能听清“说了什么”,却未必听懂语气、背景声和当时的场景。Nature Machine Intelligence 的这篇综述关注的,正是如何让机器把聆听、理解和开口回应连成一件事。
作者梳理了四条正在汇合的路线:理解音频、生成音频、进行语音对话,以及结合声音与画面理解环境。背后的关键是音频基础模型——先从多种声音中学习可复用规律,再承担识别、分类和生成等任务,相当于让不同应用共用一套“耳朵和声带”。其中,音视结合尤其重要:机器不只听见一声巨响,还能联系画面判断发生了什么。
这值得关注,因为目标已不再是把自动语音识别(ASR,即语音转文字)或语音合成(TTS,即文字转语音)分别做得更好,而是建立能感知声音线索、理解语境并自然回应的通用系统。不过,现有公开材料是综述摘要,未披露统一模型的具体性能数字;它呈现的是研究方向的合流,而非某个系统已经实现了接近人类的听说能力。