AB
AiBoss站
project

MiniMax Music 3.0 - MiniMax 开源的音乐生成模型

MiniMax Music 3.0 是 MiniMax推出的下一代开放权重音乐生成模型。模型采用 8B Global LLM与 0.6B Local LLM 的分层架构,结合 Flow Matching + Flow-VAE 连...

MiniMax Music 3.0是什么

MiniMax Music 3.0 是 MiniMax推出的下一代开放权重音乐生成模型。模型采用 8B Global LLM与 0.6B Local LLM 的分层架构,结合 Flow Matching + Flow-VAE 连续隐状态合成技术,可根据歌词和结构化音乐描述生成最长 5 分钟、32kHz 立体声的完整歌曲。模型支持精细的段落控制,能在长音频中保持主题、节奏与歌声身份的一致性,实现从创作意图到高保真成品的端到端生成。

MiniMax Music 3.0的主要功能

  • 完整歌曲生成:支持生成最长 5 分钟的完整歌曲,涵盖前奏、主歌、副歌、桥段、尾奏等标准结构。
  • 歌词驱动创作:输入歌词与音乐风格描述,即可生成包含人声演唱、器乐编曲的完整作品。
  • 结构化段落控制:支持 [Verse][Chorus][Bridge] 等标签,精确控制歌曲各段落的情绪与编曲变化。
  • 长程一致性保持:在长达数分钟的音频中稳定维持音乐主题、节奏、歌声身份与编曲推进。
  • 高保真音频输出:生成 32kHz、16-bit 立体声 WAV 文件,音质接近专业录音室水准。
  • 提示词自动增强:内置 music-caption-rewriter 工具,可将简短描述扩展为包含全局元数据、人声细节与编曲规划的专业结构化提示。

MiniMax Music 3.0的技术原理

  • 分层自回归架构(Hybrid-LM):模型由 8B Global LLM 与 0.6B Local LLM 协同工作。Global LLM 基于 Qwen3 初始化,逐帧预测首个 RVQ 语义码本,负责建模歌曲的长程结构与语义;Local LLM 则在每帧内预测其余声学码本,恢复细粒度音色与音质。两者通过联合训练实现宏观结构与微观声学的高效分离与协作。
  • 多层残差向量量化(RVQ):采用 8 层 RVQ 对音乐信息进行分层表征。首层语义码本含 16,384 个条目,捕捉核心音乐语义与结构;其余 7 层声学码本各含 1,024 个条目,逐级编码残差声学细节。训练时先独立优化语义码本建立稳定骨架,再联合训练全部码本,以平衡语义容量、生成稳定性与细节重建。
  • 连续隐状态合成:推理融合 Global 与 Local LLM 的最终连续隐状态,作为条件输入 2.4B Flow Matching 模块映射至 VAE 潜空间,再由 123M Flow-VAE 解码为波形。保留了更丰富的高维声学信息,显著提升人声发音准确度、乐器物理真实感与长时一致性。
  • 结构化描述框架:引入精细时粒度的结构化描述体系,将单一全局标签扩展为包含 Global Metadata(流派、BPM、调性)、Vocal Details(音色、唱法、和声)与 Arrangement(乐器演进、段落变化)的三段式描述,使主观创作意图转化为模型可执行的专业编曲指令。

微信关注回复“开源”,加入AI开源项目交流群

如何使用MiniMax Music 3.0

  • 环境准备:确保本地拥有两张支持 CUDA 的 NVIDIA GPU,配置好 Python 环境以及 SGLang-Omni 推理框架的依赖。
  • 下载模型:执行 hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm 命令,从 HuggingFace 拉取完整的模型权重到本地目录。
  • 启动服务:运行 sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000 启动推理服务,其中 GPU 0 负责 Qwen3 与八层 RVQ 自回归生成,GPU 1 负责 Flow Matching 与 Flow-VAE 波形解码。
  • 准备输入:在 API 请求的 input 字段中填入带段落标签(如 [Verse][Chorus])的歌词,在 instructions 字段中填入音乐风格、情绪与编曲描述,两者共同作为生成条件。
  • 发送请求:向 http://127.0.0.1:8000/v1/audio/speech 发送 POST 请求,设置 modelminimax_ttmresponse_formatwavmax_new_tokens 为 9000,即可返回生成的 32kHz 立体声 WAV 音频。
  • 提示增强(可选):安装并调用 music-caption-rewriter skill,将简短的音乐描述自动扩展为包含全局元数据、人声细节与段落编曲的结构化提示,以提升生成精度与可控性。

MiniMax Music 3.0的核心优势

  • 完整长曲生成:原生支持最长 5 分钟完整歌曲生成,在长音频中稳定保持音乐主题、节奏、歌声身份与编曲推进的一致性,实现真正的”一首完整歌”。
  • 精准理解创作意图:通过结构化描述框架(Structured Caption)将主观创意转化为可执行的专业编曲指令,避免生成内容偏离原始需求,并配备提示增强工具降低专业门槛。
  • 高保真音频渲染:采用连续隐状态合成(融合 LLM 隐状态 → Flow Matching → Flow-VAE),而非传统离散 token 解码,输出 32kHz 立体声,乐器物理真实感更强、混音更通透。
  • 精细可控的编曲:支持歌词段落标签与三段式结构化描述(全局元数据、人声细节、段落编曲),可对情绪演进、乐器进出、人声技法进行精确时序控制。
  • 自然的人声表现:显著减少高频数字伪影,改善发音准确度、呼吸感与和声层次,使生成的人声更接近真实演唱而非合成效果。

MiniMax Music 3.0的项目地址

  • 项目官网:https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model
  • GitHub仓库:https://github.com/MiniMax-AI/MiniMax-Music3

MiniMax Music 3.0的同类竞品对比

对比维度 MiniMax Music 3.0 Suno v5
开发商 MiniMax Suno AI
模型性质 开放权重(可本地部署) 闭源(仅云端使用)
技术架构 8B Global LLM + 0.6B Local LLM + Flow Matching + Flow-VAE Transformer-based(具体参数未公开)
最长生成时长 5 分钟 ~5 分钟(v5.5 支持最长 8 分钟)
输出音质 32kHz / 16-bit 立体声 WAV 44.1kHz 立体声(Pro)/ 48kHz 24-bit(Premier)
歌词输入 支持,带结构化段落标签 支持,带元标签([Verse] 等)
音乐描述精度 结构化 Caption(流派、BPM、调性、段落编曲三段式精细控制) 自然语言风格描述(建议 200 字符以内)
部署方式 本地双 CUDA GPU(SGLang-Omni) 纯云端(官网 / App)

MiniMax Music 3.0的应用场景

  • 独立音乐人快速 Demo 制作:音乐人输入原创歌词与风格描述,可在数分钟内生成包含人声与编曲的完整 Demo,大幅降低创作前期的试错成本。
  • 短视频与播客定制化配乐:内容创作者根据视频情绪曲线生成主题曲或背景音乐,实现从”找版权音乐”到”定制专属音乐”的转变。
  • 游戏与互动娱乐动态配乐:开发者将模型接入游戏引擎,根据玩家实时行为动态生成适配场景氛围的长时音乐,增强沉浸感。
  • 广告与品牌营销音频内容:广告团队依据品牌调性描述快速产出多版本广告歌与 Jingle,支持 A/B 测试并避免版权纠纷。
  • 音乐教育与创作教学辅助:教师用模型演示不同流派、结构与编曲技法的实际效果,学生通过调整结构化描述直观理解音乐制作原理。