几个人围着语音机器人聊天,真正棘手的不只是听清内容,还要知道每句话是谁说的。Nemotron 3 Diarization补的正是这一环:说话人分离——把音频按不同声音切开,标成“说话人A、B”等。它支持流式处理,也就是声音还在输入,系统就分块给出判断,不必等整段对话结束;最多可跟踪八名说话者。
据Reddit用户futterneid分享,他用一秒长的音频块测试,并把模型接入DGX Spark上的语音对语音系统和Reachy Mini机器人。演示中,新的人开口后,机器人会询问姓名,并在本轮对话里把姓名与声音标签绑定。这让本地语音Agent在多人实时交谈中更接近“知道该对谁说话”。
边界也很清楚:模型本身不负责转写,更不会直接认出真实姓名;所谓“认人”,还需要额外的身份记忆。测试质量、Transformers首日集成及商业友好许可证等信息目前均来自该用户自述,材料未提供独立评测或具体授权条款。