Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.050 — 2026-08-23
NEWS 约 1 分钟

FireRed押注统一音频理解与生成

FireRedAudio用一套9B模型兼顾听懂、生成与编辑,FireRedTTS3同步亮相。

IMAGE — r/LocalLLaMA 日榜

让 AI 听懂一小时录音、模仿一段参考声音,再按文字要求修改语音,过去往往要换几套模型。FireRedTeam 同时亮相的 FireRedAudio 与 FireRedTTS3,押注把这些能力收进一条开放模型路线;其中已披露较多的 FireRedAudio,是一款兼顾音频理解与生成的音频语言模型。

它的关键做法像给“听”和“说”分配两本笔记:Audio Encoder 负责理解,RedAE-Patch 路径负责生成,两边采用解耦连续表征——把声音保存为连续数值,同时避免不同任务的信息全挤在一种表示里——再共享同一个90亿参数语言与推理骨干。项目介绍称,一套模型可覆盖 ASR(语音转文字)、音频问答、zero-shot TTS(凭陌生说话人的参考音频模仿其音色)、指令式语音合成和语音编辑,并能处理最长一小时的录音,按时间定位内容。

值得关注的不是功能清单本身,而是这种“分路表示、共享大脑”的统一思路。不过,现有供稿主要来自项目在 Hugging Face、GitHub 等页面的介绍及 Reddit 转述;FireRedTTS3 的具体方法和实验数字未披露,相关效果也仍是作者自述。


供稿材料 SOURCES — 1

← 返回 2026-08-23 · 开源板块