Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
NEWS 约 4 分钟

337KB语音合成跑上3美元芯片

sanoTTS把多语言语音合成压到337KB,试图让3美元芯片离线开口。

IMAGE — r/LocalLLaMA 日榜

如果一个玩具、家电或传感器想开口说话,通常要么联网调用云端服务,要么配上更强的计算硬件。sanoTTS想走第三条路:把整套文字转语音能力塞进一颗廉价微控制器,让设备断网也能直接合成人声。

微控制器(MCU)是把处理器、内存和外设控制装进一颗芯片的小型平台,资源远少于手机和电脑。项目作者称,sanoTTS最小只有294K参数,经int8量化——把模型里的数字压缩成8位整数——后,权重文件为337KB,可运行在约3美元、仅有512KB SRAM且没有NPU的ESP32上。NPU是专门加速神经网络的处理器;不用NPU,意味着它依靠芯片自身的通用计算单元工作。

本文所有性能与规模数字均来自项目作者发布的Reddit帖文及其项目载体,目前没有独立信源复核。

小,不只是少几个参数

sanoTTS不是单个模型,而是一套完整的TTS(Text-to-Speech,文字转语音)技术栈。其模型规模覆盖294K至220万参数,支持11种声线和6种语言。作者还提供了扩展语言与声线的操作方案。

最值得看的不是“小模型”这个标签,而是压缩后的能力组合:多语言、多音色、完整合成链,以及在资源极少的设备上运行。作者称其为“迄今最小的神经网络TTS模型”,并称它比Kokoro小约1000倍、比Voxtral TTS小约9000倍。不过,这些都是项目方的极值和营销性表述,帖子没有界定比较范围,也没有提供独立检索证明。

速度同样激进。作者报告,sanoTTS在ESP32上的RTF为0.225。RTF可以理解为“生成音频所花时间与音频时长的比值”:数值越低,生成越快。按作者的近似说法,它能用1秒生成约4秒音频。这意味着设备理论上不必等上一句说完的时间,才合成出下一句。

大一点的版本,声音怎么样?

极限压缩容易,压缩后还能不能听才是关键。作者给出的约150万参数版本sanoTTS-Amy,SCOREQ为4.13,UTMOS为4.10。这两项都是用来估计合成语音质量的评分指标。

在SCOREQ单项比较中,参数口径写作151万的sanoTTS-Amy得到4.13,高于463万参数的Inflect Nano的3.81,也高于1500万参数KittenTTS的3.02。换句话说,它在这一项指标上超过了参数量约为自身3.1倍和9.9倍的模型。但这不能扩写成综合质量全面领先。

作者还称该系列在Whisper评测中取得约2%的WER。WER即词错误率,用来衡量识别出的文字与原文相差多少,通常越低越好。这里可以把它看成一种间接检查:把合成语音交给语音识别模型,看看内容是否说清楚。

为什么值得关注?

它展示的不是手机端AI,而是更靠近资源底线的生成式语音:没有专用神经网络加速器,只有512KB SRAM,也试图完成多语言、多声线合成。如果这些结果能被复现,低成本家电、玩具和离线设备就可能拥有更自然的本地声音,不必把文本送上云端。

据Ampixa Labs与sanoTTS GitHub介绍,“sano”在尼泊尔语中意为“小”。团队也长期制作Nepali TTS、Devanagari字音转换工具和开放语音语料。因而,这次压缩不仅关乎芯片极限,也指向一个具体用途:让尼泊尔语等资源较少的语言,不必依赖云端巨型模型才能开口。

项目还通过WebAssembly提供网页运行方式。WebAssembly是一种可在浏览器中高效执行的可移植格式;开发者可使用sanotts-web npm包,把合成能力直接嵌入网页。代码、模型和在线演示已分别发布在GitHub、Hugging Face与演示站。

局限与未知

  • 337KB只是量化后权重大小。帖子没有披露峰值运行内存、代码与缓冲区占用、ESP32具体型号、时钟、外部存储及完整量化方案,因此尚不能仅凭文件大小确认512KB SRAM下的运行边界。
  • SCOREQ、UTMOS和约2% WER均未交代评测集、语言、声线、样本量与统一测试条件;RTF是否包含前后处理也不明确。
  • sanoTTS-Amy的参数量在标题、正文和比较段分别出现146万、约150万和151万三种口径;“3美元”也缺少芯片型号、采购数量和价格来源。

供稿材料 SOURCES — 1

← 返回 2026-09-05 · 开源板块