你给 AI 播一段录音:先是三声蜂鸣,接着有人敲了两次和弦。它答对了,不一定说明它真的听懂了;也可能只是根据问题措辞和常见答案猜中。Sori-1B 想追问的正是这件事:如果模型不先读海量纯文本,而是只在声音与文字成对出现时学习语言,它会不会更愿意相信耳朵,而不是依赖文字世界里学来的常识?
这是一个约 10 亿参数的音频语言模型。音频语言模型不只把语音抄成文字,还要理解音色、环境声等未必能完整写下来的信息。据项目模型页,它由首尔大学(SNU)研究者 Seonuk Kim 独立开发;“Sori”是韩语“声音”(소리)的音译。页面把路线概括为“Language learned only by listening”,同时承认这仍是一个开放问题,而不是已经得到证明的结论。本文涉及的训练与效果信息均来自同一项目页面,尚无独立信源交叉验证。
不是先学会读,再补一双耳朵
主流思路通常先做纯文本预训练——让模型从大量文字中获得语言能力,再用音频数据补上听觉。Sori-1B 则把顺序改了:它的解码器、词嵌入和输出头都从零训练,没有采用纯文本预训练,也没有用现成语言模型初始化。解码器就是根据输入逐步生成文字的部分;词嵌入则负责把词或符号变成模型能计算的内部表示。
它还使用自制的“auditory-ontology” tokenizer。Tokenizer 可以理解为模型切分和组织语言单位的字典;Sori-1B 的字典依据音频概念类别构建,而非从纯文本词表继承。思路很直白:一个孩子若只在听见声音时接触相应文字,语言与听觉证据或许会从一开始就绑得更紧。
但“从零训练”不能套在整个模型上。Sori-1B 复用了 NVIDIA Audio Flamingo Next 的预训练音频编码器。编码器负责把声音转换成模型可处理的内部表示,而且训练期间被冻结,也就是参数不再改变。按项目页的数据,这部分占全部参数的 61.5%。准确地说,从零开始的是语言生成一侧,不是整套听觉系统。
它想拆掉模型的“听觉替身”
这个项目关心的是 audio grounding——模型的回答是否真正建立在输入声音上,而不是靠语言常识或题目线索猜测。项目页给出的警示性对照是 AF3:把输入音频替换成静音后,它仍保留约 74% 的 MMAU 高于随机水平的优势。换句话说,音频消失了,成绩却没有同步消失。这说明相关评测表现可能有相当部分来自非音频线索。
不过,这个数字只描述 AF3 的静音对照,不能反过来证明 Sori-1B 已经更懂声音。现有材料没有给出 Sori-1B 的完整基准成绩,也没有提供足够对照来确认它实现了更强的音频 grounding。它目前更像一次针对训练范式的实验:先拿掉纯文本起跑线,再观察语言是否能从声音配对中长出来。
三张显卡上的实验赌局
据项目页,Sori-1B 使用约 7400 小时、475 万条音频—文本样本训练,硬件是 3 张 RTX 4090。模型支持选择题、开放式问答、音频描述和 ASR;ASR 即自动语音识别,也就是把说话内容转成文字。
页面还介绍了一个会自行合成声音的终端演示:程序生成扫频、噪声、蜂鸣与和弦,并把 mel spectrogram——一种把声音频率随时间变化画出来的图——显示成字符,再让模型描述或答题。三声蜂鸣、两次和弦都能由人直接核对。作者也明确提醒,这只是检查整条处理流程是否工作,不是正式基准测试。
为什么值得关注
Sori-1B 的意义暂时不在于宣布新纪录,而在于把一个常被忽略的问题摆上桌面:当音频模型回答正确时,我们究竟测到了“听懂”,还是测到了一个语言模型善于猜题?它没有完全抛弃预训练听觉组件,却主动切断了语言生成部分对纯文本预训练的继承。这让实验边界不算纯粹,却也使问题变得具体、可以检验。
局限与未知
- 项目未披露 Sori-1B 自身完整的基准结果,因此不能断言它比典型模型更依赖音频证据。
- 页面一面称推理处理器、合成音频演示和 MMAU test-mini 评测脚本随项目提供,一面又把代码仓库标为“coming soon”;这些资产是否已经公开可用并不清楚。
- 权重需要审批,仅限非商业或学术用途,也禁止自行再分发权重及未经作者同意发布衍生模型。项目页称,这是因为冻结编码器受 NVIDIA OneWay Noncommercial 条款约束。