Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.069 — 2026-09-11
PAPER HF 124 约 1 分钟

实时多模态Agent不再轮流说话

Gander让AI边看边听边回应,还能在对话不中断时调用“外脑”办事。

和语音 AI 对话时,通常得等你说完,它才开口;一旦插话、多人交谈或现场有噪声,节奏就容易乱。Gander 想把这种“轮流说话”改成持续在线的协作:模型一边接收视频、语音和文字,一边判断该听还是该说,用户可以随时打断,它也能主动追问或汇报进度。

最具体的一步,是把各类输入和模型输出按时间切成小块,再排进同一条序列;模型在每一块都预测“听”或“说”。这让全双工交互——双方可同时听说——不再主要依赖外部模块判断一句话何时结束。系统同时采用“Cerebellum–Brain”分工:Cerebellum 负责低延迟交流,Brain 负责较慢的规划、推理和工具调用,并可异步把阶段结果送回对话。Brain 还能免训练替换成更强的推理模型。作者称其在噪声、多人交流和简短应答等场景中表现稳健,但目前没有专门的 Omni Interaction Agent 基准,相关能力仍主要依赖既有测试与主观演示判断。


供稿材料 SOURCES — 1
01
Omni Interaction Agent Technical Report Hugging Face Daily Papers · PAPER
原文 ↗

← 返回 2026-09-11 · 学术板块