语音 Agent 边听边说时,麻烦不只是“反应慢一点”。它每收到一秒声音,就得在下一秒到来前处理完,像每秒一班的车;偶尔误点,音频便会积压、卡顿。DuplexCadence因此把全双工语音——系统同时听取和生成语音——看成严格的周期调度问题,而不是只看平均延迟。
论文最具体的发现是:拖后腿的并非自回归生成——逐步产生语音表示的串行过程——而是把语音 token 转成音频波形的最后一段。这里有数千个小操作逐个送往 GPU,令其在总耗时中有 57%—65%处于等待;流解码器实际使用的工作区也只有已分配空间的七分之一。
DuplexCadence让模型把各处理环节的固定节拍和保留范围明确告诉运行时,据此只分配真正需要且地址稳定的状态内存,并提前记录所有可能出现的精确形状,整批重放操作而不填充。作者称,在四个已发布模型、三种解码器架构上,输出保持逐比特一致;实时说话阶段的平均耗时从超出一秒节拍14%,降到低于节拍2%。重点很朴素:语音 Agent 不仅要平均跑得快,还要每一秒都准时交卷。