同一句话,换个地区、口音或手机录音,语音模型就可能听错。问题是,过去的开放榜单主要覆盖欧洲语言,这些差异很难被看见。Open ASR Leaderboard 现在加入 Monsoon en-IN 和 hi-IN 两套评测,覆盖印度英语和印地语;印地语也成为其多语言榜单中的首个 Indic(印度次大陆语言)语种。ASR 即自动语音识别,也就是把人说的话转成文字。
这次最值得注意的不是简单“多加一种语言”,而是测试集刻意扩大了现实差异。四个数据分区共涉及 4,888 名互不重叠的说话者,并为每人记录 12 项属性;采集覆盖数百个地区,使用参与者自己的手机和网络,包含室内外环境及自然对话。这样,榜单不只看一个平均错误率,还能暴露模型是否对特定年龄、性别、地区或设备表现失准。
每种语言都设有公开集和 Held-out private split——参赛者看不到的保留测试集,用来减少针对题目反复调参。印地语转写还接受多种合理拼写,避免内容正确却因书写变体被扣分。换句话说,这项更新把语音模型的竞争,从熟悉数据上的单一高分,推向更接近全球真实用户的覆盖能力。