你让语音助手改一笔订单,它可能知道该调用哪个工具,却把你说的编号听错,随后反复提交错误参数。SpeechGym要解决的正是这类问题:它让两个全模态模型直接用声音多轮对话,并在本地数据库上调用工具,不再借助ASR(语音转文字)、TTS(文字转语音)或封闭API。这样,语音Agent就能用强化学习——根据整段任务的成败调整行为——反复练习,而不只是接受测试。
论文最关键的一步,是把奖励从“最后任务是否成功”细化到每次工具调用。基础模型的语音任务成功率很低,只看最终结果时,同组尝试往往全部失败,只有16%的训练组能提供有效学习信号;加入逐轮过程奖励后,这一比例升至99.6%。作者称,训练后的开放权重30B模型无需额外调优,在另一套独立语音评测流程中把pass@1(首次尝试成功率)从24%提高到53%。这些结果来自论文作者自报,但它至少说明:语音Agent的短板不只在“会不会听”,也在听错后能否确认、纠正并继续完成任务。