project
MaskGCT - FunWan Technologyが香港中文大学と共同で開発した大規模音声合成モデル。
MaskGCTは、FunWan Technologyが香港中文大学深圳校と共同開発した大規模音声合成モデルです。マスク生成モデルと音声表現の分離型エンコーディングに基づいており、音声クローニング、多言語合成、音声制御などのアプリケーションを可能にします。
MaskGCTとは何ですか?
MaskGCTは、FunWan Technologyが香港中文大学深圳校と共同開発した大規模音声合成モデルです。マスク生成モデルと音声表現の分離型エンコーディングに基づき、音声クローン、多言語合成、音声制御などのタスクにおいて優れた性能を発揮します。複数のTTSベンチマークデータセットにおいて業界最高水準の性能を達成しており、一部のパフォーマンス指標では人間の能力を凌駕しています。MaskGCTは、音声を迅速かつリアルにクローンし、音声の長さ、速度、感情表現を柔軟に調整できるほか、中国語、英語、日本語、韓国語、フランス語、ドイツ語の6言語の合成に対応しています。このモデルはAmphionシステム上でオープンソースとして公開されており、世界中のユーザーが利用可能です。
MaskGCTの主な機能
- サウンドクローニング人間やアニメキャラクターを含むあらゆる音色を素早く再現でき、イントネーション、スタイル、感情を完全に再現できる。
- 言語間合成中国語、英語、日本語、韓国語、フランス語、ドイツ語など、複数の言語での音声合成をサポートしており、多言語音声生成を可能にします。
- 音声制御生成される音声の長さ、速度、感情表現を柔軟に調整できるだけでなく、編集可能なテキストを使用して音声コンテンツを編集し、リズムと音色の一貫性を維持することも可能にします。
- 高品質な音声データセット高品質な多言語音声データセット「Emilia」で学習されているため、豊富な音声合成素材を提供します。
MaskGCT技術の原理
- 音声意味表現コーデック音声は意味タグに変換され、VQ-VAEモデルを使用してベクトル量子化コードブックが学習され、音声自己教師あり学習モデルから音声の意味表現が再構築される。
- 音声音響コーデック音声波形は、すべての音声情報を保持するために、多層の離散マーカーに量子化されます。音声波形はRVQ方式で圧縮され、デコーダーとしてVocosアーキテクチャが使用されます。
- テキストから意味モデルへこの手法は、テキスト音声のアライメント情報に頼ることなく、非自己回帰マスクを使用してTransformerを生成し、言語モデルの文脈学習能力に基づいて意味タグを予測します。
- 意味論から音響モデルへ非自己回帰マスクを使用してトランスフォーマーが生成され、意味タグを使用して条件付きで多層音響タグシーケンスが生成され、高品質の音声波形が再構築されます。
MaskGCTのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/open-mmlab/Amphion/tree/main/models/tts/maskgct
- ハギングフェイスモデルライブラリ:https://huggingface.co/amphion/MaskGCT
- arXiv技術論文:https://arxiv.org/pdf/2409.00750v2
- 公開ベータ版アドレス(チオン):https://voice.funnycp.com/
MaskGCTの応用シナリオ
- オーディオブックとポッドキャストMaskGCTを使用して生成された高品質な音声は、電子書籍、オーディオブック、ポッドキャストに自然な朗読音声を提供し、リスナーの聴覚体験を向上させます。
- スマートアシスタントとチャットボットMaskGCTは、スマートデバイスやカスタマーサービスシステムにおいて、より自然でパーソナライズされた音声対話体験を提供します。
- ビデオゲームとバーチャルリアリティゲームやバーチャルリアリティのアプリケーションにおいて、MaskGCTはキャラクターにリアルな音声を生成し、没入感を高めます。
- 映画・テレビ番組の制作および吹き替え映画やテレビのポストプロダクションにおいて、MaskGCTはキャラクターボイスを迅速に生成または置き換えることができ、制作効率を向上させます。
- 言語学習と教育MaskGCTは、標準音声またはアクセント付き音声を生成し、言語学習者が発音とリスニング理解の練習をするのに役立ちます。