project
GTSinger - 浙江大学がオープンソース化した、大規模で多言語対応の高品質な歌唱データセット。
GTSingerは、浙江大学の研究チームが開発した大規模でオープンソースの高品質な歌唱データセットであり、多様な歌唱タスクをサポートするように設計されています。GTSingerには、9つの異なる言語を網羅した、プロが録音した80.59時間のボーカルが含まれています。
GTSingerとは何ですか?
GTSingerは、浙江大学の研究チームが開発した大規模でオープンソースの高品質な歌唱データセットで、多様な歌唱タスクをサポートするように設計されています。GTSingerには、20人のプロの歌手が9つの異なる言語(中国語、英語、日本語、韓国語、ロシア語、スペイン語、フランス語、ドイツ語、イタリア語)で歌った、80.59時間分のプロ仕様のスタジオ録音ボーカルが含まれており、豊かな音色とスタイルの多様性を提供します。GTSingerは歌唱テクニックの制御とモデリングを重視しており、6つの一般的な歌唱テクニックについて、コントロールグループと音素レベルの注釈を提供します。GTSingerは、実際の作曲を支援する本格的な楽譜を提供します。このデータセットには、さまざまな歌唱タスクに適応する人工音素アライメント、グローバルスタイルラベル、ペア読み取りデータが含まれています。
GTSingerの主な機能
- 多言語歌唱データセットGTSingerには9つの異なる言語のボーカルが収録されており、多様な音色とスタイルを提供するとともに、多言語間のボーカル合成と分析をサポートしています。
- 歌唱技術のコントロールこのデータセットは、一般的に用いられる6つの歌唱テクニックについて、対照群と音素レベルの注釈を提供しており、研究者が歌唱テクニックをより適切にモデル化および制御することを可能にする。
- リアルな楽譜サポートボーカルに合った正確な楽譜を提供することは、ボーカル合成技術を実際の音楽制作に応用する上で非常に役立ちます。
- マルチタスクへの適応GTSingerは、歌唱合成、スキル認識、スタイル変換、音声から歌唱への変換など、さまざまな歌唱タスクをサポートするように設計されています。
- ベンチマークさまざまな歌唱タスクにおけるデータセットの性能と適用性を評価するためのベンチマークテストを提供します。
GTSingerの技術原則
- 高音質の音声録音GTSingerデータセットは、プロの歌手がプロのレコーディングスタジオで録音した音源から構築されており、高品質な音声データが保証されています。
- 音素のアライメントと注釈MFAやPraatなどの音楽情報検索技術に基づき、音素レベルでの精密な制御を実現するために、音素のアライメントとアノテーションが実行される。
- 歌唱テクニック専門家による聴取と音声分析技術に基づき、歌唱における歌唱技法にラベルを付けることで、モデルの学習と制御を容易にする。
- 楽譜生成音声信号処理技術と音楽理論を組み合わせることで、歌声から音高情報を抽出し、MIDI楽譜に変換した後、専門家が実際の楽譜に調整する。
- データセットの構築と検証手動によるレビューとそれに続く処理に基づき、音声セグメントのセマンティックセグメンテーションや無音部分の処理を含め、データセットの品質と適用性が保証されます。
GTSingerのプロジェクトアドレス
- プロジェクト公式サイト:gtsinger.github.io
- GitHubリポジトリ:https://github.com/GTSinger/GTSinger
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/GTSinger/GTSinger
- arXiv技術論文:https://arxiv.org/pdf/2409.13832
GTSingerの応用シナリオ
- 歌唱合成データセット内の音声サンプルと技術注釈に基づいて、特定の技術とスタイルを用いた高品質な音声を合成するシステムが開発された。
- 発声技術の認識歌唱における音素レベルのテクニック注釈を分析し、さまざまな歌唱テクニックを認識・分類するモデルを訓練する。
- 歌唱スタイルの移転楽曲を別のスタイルに変えること。例えば、ポップソングをクラシック調にアレンジするなど。
- 声から歌への変換(音声歌唱変換、STS):通常の音声をメロディーのある歌声に変換するもので、音声合成や作曲に用いられる。
- 音楽教育データセットに含まれる実際の楽譜と歌唱サンプルに基づいて、学生が歌唱スキルを学び、練習するのに役立つ音楽教育ツールを開発します。