project
SoulX-Singer - Soul Appと大学が共同開発した歌声合成モデル。
SoulX-Singerは、Soul Appが天津大学および西北工業大学と共同開発した、オープンソースの産業グレードのゼロショット歌唱合成モデルです。このモデルは、42,000時間分の高品質な多言語歌唱データで学習されており、MIDIスコアとF0をサポートしています。
SoulX-Singerとは何ですか?
SoulX-Singerは、天津大学および西北工業大学と共同でSoul Appがオープンソース化した、産業グレードのゼロショット歌声合成モデルです。このモデルは、42,000時間分の高品質な多言語歌声データで学習されており、MIDIスコアとF0メロディーのデュアルモード制御をサポートし、正確なピッチとリズム制御、言語を跨いだ音色のクローン作成、歌詞編集を可能にします。SoulX-Singerは、高度なフローマッチングアーキテクチャと2段階の学習戦略を採用し、ピッチ精度、歌手の類似性、主観的なリスニング体験といった主要な指標において、既存のオープンソースソリューションを総合的に凌駕し、AI音楽制作やバーチャルシンガーアプリケーションのための信頼性の高いインフラストラクチャを提供します。
SoulX-Singerの主な機能
-
ゼロサンプル歌唱クローニング任意の歌手の参考音声を入力するだけで、追加のトレーニングなしに、その音色を持つ高品質な歌声を生成できます。
-
デュアルモード制御合成MIDI楽譜を通して音程とリズムを正確に制御できるだけでなく、F0メロディーを通してハミングから歌唱へと切り替えることもできる。
-
多言語音声合成北京語、英語、広東語における高品質な音声生成をサポートします。
-
言語を跨いだ音色の伝達ある言語の歌手の声の特徴を、他の言語の歌唱に転用すること。
-
リアルタイム歌詞編集メロディーと歌唱スタイルを維持しつつ、歌詞は柔軟に変更できる。
SoulX-Singerの技術原理
- フローマッチング生成フレームワーク従来の拡散モデルではなくフローマッチングを採用し、確率分布の伝送経路を直接学習することで、より効率的で安定した音声生成を実現する。
- オーディオ充填機構歌声合成は条件付き波形補完タスクとしてモデル化され、コンテキストフラグメントを使用してターゲットオーディオが予測されるため、長期的な一貫性と音色の一貫性が自然に確保されます。
- 明示的なマルチモーダルアライメント長さ調整機能を使用して歌詞、MIDIノート、音響要素間の時間的関係を強制的に一致させることで、暗黙的な一致によって生じるリズムのずれや発音の曖昧さが解消されます。
- 段階的な二段階トレーニング短いセグメントのトレーニングは楽譜の理解を深め、長いセグメントのトレーニングは長期的な呼吸制御を習得し、最終的には局所的な正確さと全体的な自然さのバランスを取る。
SoulX-Singerのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/Soul-AILab/SoulX-Singer
- ハギングフェイスモデルライブラリ:https://huggingface.co/Soul-AILab/SoulX-Singer
- arXiv技術論文:https://arxiv.org/pdf/2602.07803
SoulX-Singerの応用事例
-
バーチャルシンガーの作成このモデルを使えば、個性的な声を持つバーチャルアイドルを素早く作成できるため、実際の歌手の契約やレコーディングにかかる費用を削減できる。
-
AIによるカバー曲とファンによる作品ユーザーは、あらゆる歌手の声を使って人気曲をカバーすることができ、言語やスタイルを超えた創造的なアレンジを実現できます。
-
音楽を活用した創作作曲家はMIDI入力を使ってデモを素早く作成し、メロディーと歌詞の相性を確認することができる。
-
オーディオコンテンツ制作オーディオブック、ポッドキャスト、ゲームの吹き替えなど、さまざまな用途向けに、高品質な歌声や詠唱コンテンツをまとめて生成できます。
-
パーソナライズされたエンターテイメント一般ユーザーは自分の声をアップロードすることで、あらゆる曲を歌うパーソナライズされたAI歌手を生成できる。