让一块便宜的小芯片直接把文字念出来,过去往往要牺牲听感,或把内容发到云端。Lokutor 团队推出的 ItoTTS,瞄准的正是离线语音交互的“输出端”:它能在售价约 5 美元的 ESP32-S3 上运行,提供两种英语音色,每种音色的模型权重为 4.89 MB。TTS 即“文字转语音”,与把人声转成文字的 ASR 方向相反;这也接上了该团队此前让 ESP32-S3 离线听懂英语的 Oído。
ItoTTS 支持流式合成,也就是整句话还没算完,设备便能陆续播放声音。输出音频为 24 kHz,表示每秒记录两万四千个采样点,但这个数字本身不等于自然。团队用自动语音质量指标 UTMOS 测试了八句话:Ito 得分 4.46,接近作为“老师”的 StyleTTS 2(4.49),并高于两款对比模型的 3.98 和 2.07。不过这些都是作者自述的小规模自动评测,并非独立人工听测;真机速度尚未测量,文字转音素目前也仍在主机端完成。