语音 AI 过去常像一条拼装流水线:先把人声转成文字,再思考,最后合成声音。阶跃星辰此次发布 StepAudio 3 系列,用五款模型覆盖四类需求——语音识别、语音生成、实时交互和音乐创作。值得关注的不是又多了一个模型,而是国产厂商开始争夺完整音频能力栈。
其中,StepAudio 3 Realtime 主打全双工语音,也就是双方能像打电话一样同时听和说,AI 可以判断何时回应、何时等待,并处理用户打断。它还把推理、工具调用和长任务执行放进对话流程。StepAudio 3 ASR 则负责把语音转成文字;据 InfoQ 报道,两款模型在 Artificial Analysis 评测中分别取得对话动态综合得分 98.9%、非流式识别词错误率 1.7%。
另外三款分别处理自然语音合成、包含人声与环境声的完整音频,以及歌曲创作与改编。五款模型均已上线阶跃星辰开放平台;上述排名和指标来自报道所引评测,材料未披露更完整的测试条件。