AB
AiBoss
project

SongGeneration 2 - テンセントと清華大学が共同開発した音楽生成モデル

SongGeneration 2は、テンセントと清華大学が共同でオープンソース化した4Bパラメータの音楽生成モデルです。ハイブリッドLLM拡散アーキテクチャと階層的表現設計を採用し、商用レベルの音楽生成品質を実現しています。このモデルは、歌詞精度8.55%を達成しています。

SongGeneration 2とは何ですか?

SongGeneration 2は、テンセントと清華大学が共同でオープンソース化した4Bパラメータの音楽生成モデルです。ハイブリッドLLM拡散アーキテクチャと階層的表現設計を採用することで、商用レベルの音楽生成品質を実現しています。歌詞精度はPER8.55%を達成し、Suno v5などの商用モデルを凌駕しています。SongGeneration 2は、中国語や英語を含む多言語に対応し、複雑なマルチトラック構成もサポートしており、テキストによる説明や音声キューを通して、正確なスタイル制御が可能です。22GBのVRAMを搭載した一般消費者向けハードウェア上でローカルに動作し、1分以内に楽曲全体を生成できます。

SongGeneration 2の主な機能

  • 高品質な楽曲生成ハイブリッドLLM拡散アーキテクチャに基づいて、4分30秒の長さで、美しいメロディーと豊かなアレンジを持つ楽曲が生成された。
  • 多言語歌詞合成中国語、英語、スペイン語、日本語など複数の言語の歌詞に対応し、8.55%という超低頻度エラー率で明瞭かつ正確な発音を実現します。
  • 多様な発電方式楽曲全体、インストゥルメンタル、純粋なボーカル、またはボーカルと伴奏を別々に収録したデュアルオーディオトラックなど、柔軟に出力できます。
  • 正確なスタイルコントロール生成されるスタイルの精密な制御は、テキストによる説明(性別、ジャンル、ムード、楽器)または10秒間の音声プロンプトによって実現されます。
  • 柔軟な導入オプション22GBのビデオメモリによるローカル動作と、HuggingFace Spaceによる高速オンライン体験をサポートし、低ビデオメモリ対応ソリューションも提供します。

SongGeneration 2の技術的原理

  • ハイブリッドLLM拡散アーキテクチャ言語モデル(LeLM)は「作曲の頭脳」として機能し、音楽全体の構造と演奏の詳細を調整する一方、拡散モデルは「高忠実度レンダラー」として、言語モデルの指示の下で複雑な音響の詳細を合成します。この2つが連携して、音楽性と音質のバランスを取ります。
  • 階層的表現モデリングこの設計では並列モデリングを採用しており、混合トークンが高レベルの旋律的および構造的な意味を捉え、デュアルトラックトークンがそれぞれボーカルトラックと伴奏トラックにおけるきめ細かな音響的変化をモデル化している。
  • 自動美的評価11,717件の専門家による注釈付きサンプルに基づいて、きめ細かな評価フレームワークが構築され、音楽性に関する事前知識をモデルトレーニングに組み込み、推論段階で音楽性ラベルに基づくCFG戦略を導入した。
  • 3段階の漸進的なトレーニング後SFTによってデータ分布を絞り込み、高品質な基盤を構築することで、大規模オフラインDPOは20万組の厳密な正例と負例のサンプルを使用して歌詞の錯覚を排除し、セミオンラインDPOはモデルを定期的に更新して音楽性の上限を突破します。

SongGeneration 2プロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/tencent-ailab/songgeneration
  • ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/SongGeneration

SongGeneration 2の応用シナリオ

  • 音楽制作支援独立系ミュージシャンは、自分のインスピレーションを検証するためのデモを迅速に作成できるため、アレンジへの参入障壁が低くなり、制作コストも削減できる。
  • ビデオ音楽制作セルフメディアクリエイターは、動画のスタイルや感情的なニーズに基づいて、カスタマイズされたBGMを即座に生成できます。
  • ゲームオーディオ開発ゲーム開発者は、さまざまなシーン、キャラクター、ストーリーラインに合わせて、適切なテーマ音楽や効果音をまとめて生成することができます。
  • 広告およびマーケティングコンテンツブランドはキャンペーンのトーンに基づいてカスタムジングルを作成できるため、オーディオアセットの迅速な反復が可能になります。
  • 教育およびエンターテイメントアプリケーションこの音楽教育プラットフォームは、様式化された伴奏生成機能を提供する一方、カラオケやソーシャルアプリケーションは、ユーザーによるパーソナライズされた楽曲作成をサポートする。