project
Freestyler - 西北理工大学がマイクロソフトおよび香港大学と共同で開発したラップ音楽生成モデル。
Freestylerは、西北工業大学コンピュータサイエンス学部の音声・言語処理グループ(ASLP@NPU)、マイクロソフト、香港中文大学深圳研究院ビッグデータ研究所が共同開発したラップ音楽生成モデルです。直接...
フリースタイラーとは何ですか?
Freestylerは、西北工業大学コンピュータサイエンス学部の音声・言語処理グループ(ASLP@NPU)、マイクロソフト、香港中文大学深圳研究院ビッグデータ研究所が共同開発したラップ音楽生成モデルです。歌詞と伴奏に基づいてラップ音楽を直接生成できます。Freestylerは、言語モデルに基づいて意味タグを生成し、条件付きフローマッチングモデルに基づいてスペクトログラムを生成し、最後にニューラルボコーダーを使用して音声に変換します。Freestylerは、トレーニングとモデル開発をサポートするRapBankデータセットを提供しており、ゼロショット音色制御を可能にし、ユーザーが特定の音色でラップボーカルを生成できるようにします。
フリースタイラーの主な機能
- ラップボーカル世代音楽の知識がなくても、歌詞と伴奏の入力から直接ラップのボーカルを生成できる。
- ゼロサンプルトーンコントロールFreestylerは、3秒間の基準音声に基づいて、あらゆる話者の音色に適応し、ゼロサンプルでの音色制御を実現します。
- データセットの作成ラップデータの不足に対処するため、チームはRapBankデータセットを作成し、データ処理ワークフローを提供した。
- スタイルとリズムの調和生成されたラップボーカルは、伴奏のスタイルとリズムに非常に合致しており、スタイルとリズムの両方を包含している。
- 高品質な音声出力高度なボコーダー技術に基づき、自然で高品質なラップ音声を生成します。
フリースタイラーの技術的原理
- 歌詞の意味:
- 歌詞や伴奏の特徴に基づいて、個別の意味タグを予測するために、言語モデル(LLaMAなど)を使用する。
- 特徴量は、Wav2Vec XLS-Rなどの自己教師あり学習(SSL)モデルを用いて抽出され、意味タグはK平均クラスタリングを用いて取得される。
- セマンティクスからスペクトログラムへ:
- 条件付きフローマッチング(CFM)は、離散的な意味タグを連続的なメルスペクトログラムに変換するために使用されます。
- 参照音声は、意味タグに欠落している音色情報を補完するために、CFMモデルに組み込まれた。
- スペクトログラムから音声へ:
- 音声は、事前学習済みのボコーダー(BigVGAN-V2など)を使用してスペクトログラムから再構築されます。
- ボコーダーは、さまざまな言語の音声、歌声、環境音など、さまざまな種類の音声データを処理できます。
- データセットと処理フロー:
- RapBankデータセットには、インターネットから収集された多数のラップソングが含まれており、自動クロール、ソース分離、セグメンテーション、歌詞認識、品質フィルタリングなどの手順を経て処理されています。
- データセットの処理には、音楽ソースの分離、音声活動検出(VAD)によるセグメンテーション、自動音声認識(ASR)による歌詞認識、および品質関連指標の計算が含まれます。
- ゼロサンプル制御参照エンコーダは、参照音声からグローバルスピーカー埋め込みを抽出し、それを用いて生成される音の音色を制御する。
フリースタイラーのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/NZqian/RapBank
- arXiv技術論文:https://arxiv.org/pdf/2408.15474
Freestylerの応用事例
- 楽曲音楽プロデューサーや作曲家にインスピレーションを与え、ラップの歌詞やボーカルを素早く生成して、新しい音楽作品を生み出すことができる。
- ライブパフォーマンスコンサートやDJパフォーマンスでは、音楽に合わせてラップのボーカルがリアルタイムで生成され、観客にダイナミックな音楽体験を提供する。
- ゲームの効果音ビデオゲームにおいて、キャラクターにラップの効果音を付けることで、ゲームへの没入感とインタラクティブ性が向上する。
- 教育と訓練音楽教育において、私たちは学生がラップのスキルや作曲を習得できるよう支援し、デモンストレーション用の音声教材を作成することで学習効果を高めます。
- ソーシャルメディアコンテンツの作成コンテンツ制作者は、ソーシャルメディアプラットフォーム上の動画や音声コンテンツを充実させ、より多くの視聴者を引き付けるために、独自のラップ音源を作成する。