想让手表、廉价手机甚至微控制器离线听写,难点不是“能不能识别”,而是模型是否装得下、跑得动。Cactus Compute推出的 Whistle 正为此而来:它是一款 ASR(把人声转成文字的自动语音识别模型),支持英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语,文件仅16.9MB。
Whistle含5500万参数,但每次只启用其中3600万,并采用 CQ 2-bit 量化——用更低精度保存参数,以缩小体积。作者称,它比145.3MB的 Whisper base 小约9倍、速度快6倍;在 LibriSpeech test-clean 上,WER(词错误率,越低通常越好)为4.31,对照模型为4.9;test-other 则为10.49,对照为11.0。它还允许应用加入人名等关键词,提高生僻名字被正确转写的机会,并能给出逐词时间戳。
这些数字目前来自作者在 Reddit 的自述,材料未披露速度测试所用硬件、各语种的单独成绩,也没有独立复核。因此更值得关注的不是“击败 Whisper”这句结论,而是多语言离线转写已被压到十几MB,开始接近超小型边缘设备可用的范围。