AI音乐生成领域迎来新突破,国内知名AI公司MiniMax正式发布其最新研发的音乐生成模型——MiniMax-Music3。该模型凭借独特的技术架构,能够根据用户输入的歌词或音乐描述,生成时长最长达5分钟的完整歌曲作品。
在技术架构层面,MiniMax-Music3创新性地采用分层自回归设计,由全局语言模型(Global LLM)与局部语言模型(Local LLM)协同工作。其中,参数规模达80亿的全局语言模型基于Qwen3-8B架构优化,通过逐帧预测首个RVQ码本,精准把控歌曲的长程语义逻辑与结构演变。该模型在训练阶段首先完成音乐语义词元嵌入层与输出层的适配,随后与局部模型联合优化全部RVQ码本,确保音乐主题的连贯性。
参数规模为6亿的局部语言模型则承担着声学细节的还原工作。通过预测每帧中的剩余声学码本,该模型能够精细捕捉旋律起伏、音色变化等微观特征,与全局模型形成互补。这种双模型协同机制,使得生成的音乐既具备完整的结构框架,又拥有丰富的听觉层次。
输出性能方面,MiniMax-Music3支持生成32kHz采样率、16-bit位深的立体声WAV格式音频,单首作品最长可达5分钟。经实测验证,该模型在长音频生成过程中,能够持续保持音乐主题的统一性,精准控制节奏变化,稳定还原特定歌声特征,并合理编排前奏、主歌、副歌、桥段等标准音乐结构,甚至包含器乐间奏等复杂段落。
此次技术突破标志着AI音乐生成从片段创作向完整作品制作的跨越,为音乐创作、影视配乐、游戏音效等领域提供了全新的工具选择。据开发团队透露,后续将持续优化模型对复杂音乐风格的处理能力,提升多乐器协同生成的精准度。










