你让 AI 听一段长录音,再问“某件事发生在第几分钟”,它不仅要听懂内容,还得记住声音与时间的对应关系。GigaChat 3.1 Audio 瞄准的正是这类原生语音任务:音频不先转成文字,而是经过 Conformer——一种兼顾局部声音特征和长距离关系的语音编码器——直接送进语言模型。
它最值得注意的是计算方式。模型共有 10B(100 亿)参数,但每次只激活 1.8B(18 亿)。这是因为底层采用 Mixture-of-Experts(MoE,混合专家)结构:模型像一个大型专家组,处理一次请求时只请少数相关专家出场。语音编码结果还会经过模态适配器,也就是一层“小翻译”,变成语言模型能接收的输入。
据项目页面介绍,它支持音频问答、分类、摘要和时间定位,还能给事件描述加上时间戳;这部分能力使用带时间对齐标注的长音频数据集 TimeGround-1M 训练。换句话说,它试图在保留大模型容量的同时压低单次计算量,为成本更可控的语音交互提供一种新选择。不过,现有材料未披露具体速度、成本或基准测试成绩。