MiniMax Music 3.0 音乐生成模型开放权重发布

新一代音乐生成模型发布并开放权重

MiniMax 面向音乐创作场景推出新一代音乐生成模型 Music 3.0,并以开放权重方式发布。用户只需提供一个创意想法和可选歌词,模型即可在一次生成中完成作曲、编曲、演唱与制作,输出一首结构完整的歌曲,单曲最长可达 5 分钟。

围绕创作意图重构生成链路

Music 3.0 重点解决音乐创作中难以被简单提示词概括的部分:理解创作者的表达意图,并在整首歌曲中持续贯彻这一意图。为此,模型从音乐描述、语言模型到声音渲染重新设计整条生成链路,用细粒度时序描述呈现情绪、配器与演唱的发展,以全局与局部协作的建模方式兼顾长程结构和声学细节,再通过多层量化表示与连续声音渲染提升保真度。

多层量化:分离核心结构与声学细节

模型采用八层残差矢量量化对音乐信息分级表达,第一层聚焦核心语义和结构,后七层逐步补足声学残差。分阶段训练让第一层先建立稳定的信息骨架,再由完整码本共同学习精细声音,既为长序列预测提供稳定的离散表示,也避免单层表示同时承担过多结构与音质信息。

全局与局部协同的混合语言模型

Music 3.0 由分词器、混合语言模型与合成模块三个核心组件衔接而成,分别解决音乐信息如何表示、长程结构与局部细节如何建模、声音如何高保真还原。其中 8B 规模全局模型负责语义标记的逐帧预测与全局上下文,随机初始化的 0.6B 规模局部模型负责帧内声学标记的深度轴预测;训练分为全局对齐与联合训练两个阶段,通过分层协作同时保证整曲结构稳定性与每一帧的声学细节。

隐状态融合与流匹配解码

区别于将离散声学标记直接送入解码器的常规做法,Music 3.0 融合全局模型与局部模型的连续隐状态,并将其作为 2.4B 流匹配模块的条件输入,随后由约 1.23 亿参数的流式变分自编码器完成音频解码。这一设计让结构理解与声音还原通过连续表征直接连接,在保持长程一致性的同时提升发音准确性、乐器连贯性与细节保真度。

三项核心升级

由此带来三项核心升级:更准确地理解创作意图,更完整且富于变化的编曲,以及更清晰、更自然的声音表现,生成的人声更接近真实演唱而非机器合成。

获取与使用

Music 3.0 的模型权重已在公开模型社区开放,开发者可获取权重进行本地化部署与二次开发;同时该模型已在官方开放平台与音乐创作产品中上线,可按需直接调用完成歌曲创作。

评论