project
MiniMax Music 3.0 - MiniMaxのオープンソース音楽生成モデル
MiniMax Music 3.0は、MiniMaxの次世代オープンウェイト音楽生成モデルです。このモデルは、8BグローバルLLMと0.6BローカルLLMの階層構造を採用し、フローマッチングとフローVAEを組み合わせています。
MiniMax Music 3.0とは何ですか?
MiniMax Music 3.0は、MiniMaxの次世代オープンウェイト音楽生成モデルです。このモデルは、8BグローバルLLMと0.6BローカルLLMの階層構造を採用し、フローマッチング+フローVAE連続隠れ状態合成技術と組み合わせることで、歌詞と構造化された音楽記述に基づいて最大5分間の32kHzステレオ楽曲を生成できます。また、きめ細かなセグメント制御に対応し、長いオーディオトラック全体を通してテーマ、リズム、ボーカルの一貫性を維持することで、クリエイティブな意図から高忠実度の最終製品まで、エンドツーエンドの生成を実現します。
MiniMax Music 3.0の主な機能
-
完全な楽曲生成イントロ、ヴァース、コーラス、ブリッジ、アウトロといった標準的な構成を含む、最大5分間の楽曲全体を生成できます。
-
歌詞主導の創作歌詞と音楽スタイルの説明を入力すると、ボーカルと楽器編曲を含む完全な作品が生成されます。
-
構造化された段落制御:サポート
[Verse]、[Chorus]、[Bridge]このようなタグを使うことで、曲の各セクションにおける雰囲気やアレンジの変化を正確に制御することが可能になります。 -
長距離での一貫性維持数分間にわたる音声録音全体を通して、安定した音楽的テーマ、リズム、ボーカルの特徴、およびアレンジの展開を維持すること。
-
高忠実度オーディオ出力プロのレコーディングスタジオの基準に匹敵する音質を持つ、32kHz、16ビットのステレオWAVファイルを生成します。
-
プロンプトワードの自動強化:内蔵
music-caption-rewriterこのツールは、簡単な説明を、グローバルなメタデータ、ボーカルの詳細、アレンジメントの計画を含む、プロフェッショナルで構造化されたプロンプトに展開することができます。
MiniMax Music 3.0の技術的原理
- 階層型自己回帰アーキテクチャ(ハイブリッドLM)このモデルは、8BのグローバルLLMと0.6BのローカルLLMが連携して動作する構成となっています。グローバルLLMはQwen3に基づいて初期化され、フレームごとに最初のRVQ意味コードブックを予測し、楽曲の長距離構造と意味をモデル化する役割を担います。ローカルLLMは各フレームの残りの音響コードブックを予測し、きめ細かな音色と音質を復元します。この2つのモデルは共同で学習され、マクロ構造とミクロ音響の効率的な分離と連携を実現します。
- 多段階残差ベクトル量子化(RVQ)8層のRVQを用いて、音楽情報を階層的に表現する。第1層のセマンティックコードブックには16,384個のエントリが含まれており、音楽の中核となる意味と構造を捉えている。残りの7層のアコースティックコードブックはそれぞれ1,024個のエントリを含み、残余のアコースティックの詳細をレベルごとに符号化している。学習時には、まずセマンティックコードブックを個別に最適化して安定した骨格を構築し、その後、すべてのコードブックを共同で学習させて、意味容量、生成安定性、および詳細の再構築のバランスを取る。
- 連続的な隠れ状態合成グローバルLLMとローカルLLMの最終的な連続隠れ状態は推論によって融合され、条件付き入力として使用されます。2.4Bフローマッチングモジュールはこれらの状態をVAE潜在空間にマッピングし、その後123MフローVAEが波形にデコードします。このプロセスにより、より豊富な高次元音響情報が保持され、音声発音の精度、楽器の物理的なリアリズム、および長期的な一貫性が大幅に向上します。
- 構造化記述フレームワークこのシステムは、細かい時間粒度を持つ構造化された記述システムを導入し、単一のグローバルタグを、グローバルメタデータ(ジャンル、BPM、調性)、ボーカルの詳細(音色、歌唱スタイル、ハーモニー)、およびアレンジ(楽器の展開、セクションの変更)を含む3つの部分からなる記述に拡張することで、主観的な創造的意図を、モデルが実行できるプロフェッショナルなアレンジ指示に変換します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MiniMax Music 3.0の使い方
-
環境準備ローカルマシンにCUDAをサポートするNVIDIA製GPUが2つ搭載されていることを確認し、Python環境とSGLang-Omni推論フレームワークの依存関係を設定してください。
-
モデルをダウンロード:埋め込む
hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttmこのコマンドは、HuggingFaceからモデルの重みデータをすべてローカルディレクトリにダウンロードします。 -
サービスを開始する:走る
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000推論サービスを開始します。GPU 0はQwen3と8層RVQの自己回帰生成を担当し、GPU 1はフローマッチングとFlow-VAE波形デコードを担当します。 -
入力準備完了APIリクエストでは
input段落ラベルをフィールドに入力してください(例:)[Verse]、[Chorus]の歌詞)instructionsこれらのフィールドには、音楽のスタイル、雰囲気、アレンジの説明が記入されており、これらがまとめて生成条件として機能します。 -
リクエストを送信:に向かって
http://127.0.0.1:8000/v1/audio/speechPOSTリクエストを送信して設定しますmodelのためにminimax_ttm、response_formatのためにwav、max_new_tokensこれを9000に設定すると、生成された32kHzステレオWAVオーディオが返されます。 -
強化されたプロンプト(オプション)インストールして呼び出し
music-caption-rewriterこのスキルは、短い楽曲の説明を自動的に構造化されたプロンプトに展開し、グローバルメタデータ、ボーカルの詳細、セクション構成などを含めることで、生成の精度と制御性を向上させます。
MiniMax Music 3.0の主な利点
-
フルロングソング生成最大5分間の完全な楽曲の生成をネイティブでサポートし、長いオーディオファイルにおいても音楽のテーマ、リズム、ボーカルの特徴、アレンジの展開の一貫性を維持することで、真に「完全な楽曲」を実現します。
-
クリエイティブな意図を正確に理解するこれは、構造化されたキャプションフレームワークを通じて、主観的なクリエイティブなアイデアを実行可能なプロフェッショナルな構成指示に変換し、生成されたコンテンツが元の要件から逸脱するのを防ぎ、プロとしてのハードルを下げるためのヒントや強化ツールを提供します。
-
高忠実度オーディオレンダリング従来の離散的なトークン復号ではなく、連続的な隠れ状態合成(LLM隠れ状態のブレンド→フローマッチング→フローVAE)を採用し、32kHzステレオサウンドを出力することで、楽器のよりリアルな物理的感覚と、より透明感のあるミックスを実現しています。
-
正確かつ制御可能な配置歌詞セグメントタグと3部構成の構造化記述(グローバルメタデータ、ボーカルの詳細、セグメント配置)をサポートし、感情の展開、楽器の導入と終了、ボーカルテクニックの正確なタイミング制御を可能にします。
-
自然な発声高周波のデジタルノイズを大幅に低減し、発音の正確性、息遣い、倍音の重なりを改善することで、生成されるボーカルを合成エフェクトよりも実際の歌声に近づけます。
MiniMax Music 3.0プロジェクトのアドレス
- プロジェクト公式サイト:https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model
- GitHubリポジトリ:https://github.com/MiniMax-AI/MiniMax-Music3
MiniMax Music 3.0と類似の競合製品との比較
| 比較対象寸法 | MiniMax Music 3.0 | Suno v5 |
|---|---|---|
| 開発者 | MiniMax | Suno AI |
| モデルの特性 | オープンウェイト(ローカルに展開可能) | クローズドソース(クラウド利用のみ) |
| 技術アーキテクチャ | 8B Global LLM + 0.6B Local LLM + Flow Matching + Flow-VAE | 変圧器ベース(具体的なパラメータは非公開) |
| 最長世代時間 | 5分 | 約5分(v5.5では最大8分まで対応) |
| 出力音質 | 32kHz / 16ビット ステレオ WAV | 44.1kHzステレオ(Pro)/48kHz 24ビット(Premier) |
| 歌詞入力 | 構造化された段落タグに対応しています。 | メタタグ([Verse]など)をサポートします。 |
| 音楽描写の精度 | 構造化キャプション(ジャンル、BPM、音調、セクション構成の3つの要素を細かく制御) | 自然言語による説明(200文字以内を推奨) |
| 展開方法 | ローカルデュアルCUDA GPU(SGLang-Omni) | 完全にクラウドベース(公式サイト/アプリ) |
MiniMax Music 3.0の応用事例
-
インディーズミュージシャンのためのクイックデモ作成ツールミュージシャンはオリジナルの歌詞とスタイルの説明を入力するだけで、ボーカルとアレンジを含む完全なデモを数分以内に作成できるため、制作初期段階における試行錯誤のコストを大幅に削減できます。
-
短編動画やポッドキャスト向けのカスタムサウンドトラックコンテンツ制作者は、動画の感情的な流れに基づいてテーマソングやBGMを生成することで、「著作権のある音楽を探す」ことから「独自の音楽をカスタマイズする」ことへの変革を実現できます。
-
ゲームやインタラクティブエンターテイメント向けのダイナミックなサウンドトラック開発者はこのモデルをゲームエンジンに統合し、プレイヤーのリアルタイムの行動に基づいてシーンの雰囲気に適応する長時間の音楽を動的に生成することで、没入感を高めている。
-
広告およびブランドマーケティング向けのオーディオコンテンツ広告チームは、ブランドのトーンやスタイルに基づいて、広告ジングルや楽曲の複数のバージョンを迅速に制作することができ、A/Bテストをサポートし、著作権紛争を回避することができます。
-
音楽教育および作曲指導支援教師はモデルを用いて、さまざまなジャンル、構成、編曲技法の実際の効果を実演し、構造化された説明を調整することで、生徒が音楽制作の原理を直感的に理解できるようにする。