AB
AiBoss
project

SongGeneration - Tencent AI Labがオープンソース化した大規模音楽生成モデル

SongGenerationは、Tencent AI Labが開発した大規模なAI音楽生成モデルです。このモデルは、音質、音楽性、生成速度など、AI音楽生成分野における主要な課題に取り組んでいます。SongGenerationは、LLM-DiT融合アーキテクチャに基づいています。

SongGenerationとは何ですか?

SongGenerationは、Tencent AI Labが開発した大規模AI音楽生成モデルです。このモデルは、音質、音楽性、生成速度など、AI音楽制作(AIGC)分野における主要な課題に取り組んでいます。LLM-DiT融合アーキテクチャをベースとしたSongGenerationは、音質と生成速度を大幅に向上させ、多くのオープンソースモデルを複数の面で凌駕する楽曲を生み出します。一部の指標では、商用クローズドソースモデルに匹敵する性能を実現しています。SongGenerationは、テキスト制御、マルチトラック合成、スタイル追従などの機能をサポートし、クリエイターの演奏性ニーズを満たすとともに、商用アプリケーション向けの安定性と拡張性も備えています。SongGenerationは、ショートビデオのサウンドトラック、ゲーム効果音、バーチャルヒューマンのパフォーマンス、商業広告、個人音楽制作など、幅広い分野で活用されており、AI音楽制作を「補助ツール」から「インテリジェントな共同制作」という新たな段階へと押し上げています。

SongGenerationの主な機能

  • テキストコントロール「ハッピーポップ」などのキーワードを入力すると、AIが対応するスタイルと雰囲気の楽曲を素早く生成します。
  • スタイルフォロー10秒以上の参考音声ファイルをアップロードすると、同じスタイルで複数のジャンルを網羅した新しいフルレングスの楽曲が生成されます。
  • マルチトラック生成ボーカルと伴奏のトラックを自動的に別々に生成し、メロディー、構成、リズム、楽器編成の整合性を高く保ちます。
  • トーンフォロー基準となる音声の音色を忠実に再現することで、自然で感情豊かな、人間の声の「音色クローン」レベルのパフォーマンスを実現しています。

SongGenerationの技術的原則

  • LeLM(Language Model)混合トークンは、ボーカルと伴奏を組み合わせた音声を表し、楽曲全体の構造とリズムを捉え、ボーカルと伴奏の調和を確保するために使用されます。デュアルトラックトークンは、ボーカルと伴奏を別々にエンコードし、高音質な音声の詳細を生成するために使用されます。LeLMは、混合トークンとデュアルトラックトークンを並行して予測できるため、異なるトークンタイプ間の干渉を回避し、生成品質と効率を向上させることができます。
  • 音楽コーデックエンコーダーは音楽オーディオをミックストークンとデュアルトラックトークンに抽出します。デコーダーはデュアルトラックトークンを高忠実度の音楽オーディオに再構築し、生成される楽曲のオーディオ性能を向上させます。
  • 複数優先順位アライメント直接選好最適化(DPO)は、半自動的なデータ構築とDPO後のトレーニングに基づいており、多様な人間の選好に対応し、音楽性、指示への準拠性、ボーカルと伴奏の調和といった面でモデルのパフォーマンスを向上させます。多次元選好は、歌詞の整合性、キューの一貫性、音楽性など、複数の次元にわたる選好の整合性をサポートし、生成される楽曲の全体的な品質を高めます。
  • 3段階のトレーニングパラダイム
    • 事前トレーニング大規模な音楽データを用いた事前学習により、異なる入力形式や混在するラベルを整合させる。
    • モジュール式拡張トレーニングARデコーダーのさらなるトレーニング、デュアルトラックマーカーのモデリング、および音質と音楽性の向上。
    • 複数優先順位アライメントDPOの事後学習に基づいて、多次元嗜好におけるモデルのパフォーマンスを最適化します。

SongGenerationのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/tencent-ailab/SongGeneration
  • ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/SongGeneration
  • arXiv技術論文:https://arxiv.org/pdf/2506.07520
  • オンラインでデモを体験してください:https://huggingface.co/spaces/tencent/SongGeneration

SongGenerationの主な利点

  • 低ビットレートの音楽エンコードとデコード25Hzおよび0.35kbpsという極めて低いビットレートで高品質な音楽復元を実現し、言語モデリングの負担を軽減します。
  • 複数クラストークンの並列予測「ハイブリッド化優先、デュアルトラック後回し」という戦略に基づき、トークン間の相互干渉を回避し、音質と音楽性を向上させている。
  • 多次元的な人間の嗜好の整合音楽性、歌詞の整合性、およびキューの一貫性に関する好みを一致させることで、モデルのパフォーマンスと堅牢性が向上します。
  • 3段階のトレーニングパラダイム事前学習、モジュール式拡張学習、および複数嗜好整合学習は、音楽生成結果を最適化します。

SongGenerationのパフォーマンス

  • 全体的な主観的および客観的評価3つの商用モデル(Suno v4.5、Sponge Music、Mureka O1)と4つのオープンソースモデル(YuE、DiffRhythm、ACE-Step、SongGen)との包括的な主観的および客観的評価比較において、SongGenerationはオープンソースモデルの中で1位、商用モデルの中でもトップクラスにランクインし、顕著な競争優位性を示しました。
  • 客観的評価(第三者によるオープンソースモデルの評価)客観的な評価と横断的な比較において、SongGenerationはコンテンツの楽しさ(CE)、コンテンツの使いやすさ(CU)、制作品質(PQ)という3つの主要な側面で1位を獲得し、制作の複雑さ(PC)においてもトップの地位を占めました。
  • 主観的なレビュー(一般ユーザーとプロのミュージシャンによるレビュー)主観的な評価において、SongGenerationは歌詞の正確性でSunoを含む多くの大規模モデルを上回り、音声とテキストのアライメントにおけるモデルの大きな優位性と、コンテンツ生成の詳細を処理する成熟度を示しました。

SongGenerationの応用シナリオ

  • 楽曲SongGenerationは、ミュージシャンやプロデューサーに高品質な楽曲のドラフトを提供することで、制作時間の短縮、中核となるクリエイティブな作業への集中、そして創造性の刺激を支援します。
  • エンターテインメント業界映画、ゲーム、広告などのエンターテインメント業界において、SongGenerationは特定のニーズを満たすBGMを迅速に生成し、作品の没入感と魅力を高め、音楽コンテンツを豊かにします。
  • 教育音楽教育ツールとして、SongGenerationは学生が基本的な音楽知識を理解するのを助け、創造性を刺激し、オンラインコースを補完する例となる楽曲を提供し、教育効果を高めます。
  • 広告とマーケティングSongGenerationは、広告やブランド向けにテーマに合った音楽を生成し、広告の魅力とブランド認知度を高め、ブランドマーケティングを促進します。
  • 個人的な娯楽一般ユーザーはSongGenerationを使って、自分だけのオリジナルソングを作成したり、感情を表現したり、ソーシャルメディアで共有したり、楽しさやエンターテイメント性を加えたりすることができます。