想让 AI 写一首完整歌曲,难点不只是唱出几句旋律,而是几分钟后还能记住主题、人声和段落安排。MiniMax Music 3 正是为此推出的开放权重模型:输入歌词和详细的音乐描述,就能生成最长五分钟、32 kHz、16-bit 的立体声 WAV,给本地实验 AI 作曲、编曲和人声生成多了一个可直接试用的选择。
它最值得注意的是“两层分工”。8B 参数的 Global LLM 负责全曲结构,0.6B 参数的 Local LLM 处理每一帧的声音细节,类似先排好主歌、副歌和桥段,再落实具体演奏与音色。用户还能在歌词中标注 [Verse]、[Chorus] 等段落,并用文字指定曲风、情绪变化、人声和乐器安排。
模型随后通过 Flow Matching 和 Flow-VAE,把内部表示逐步还原成连续音频。作者称,这套设计能维持旋律主题、节奏、人声身份和编曲推进;不过供稿未提供独立评测数字,实际长歌一致性仍需试听验证。