project
DiaMoE-TTS - 清華大学とGiant Interactiveがオープンソース化した、多言語対応の音声合成フレームワーク。
DiaMoE-TTSは、清華大学とGiant Interactiveが共同開発した多方言音声合成(TTS)フレームワークです。このフレームワークは、国際音声記号(IPA)統一入力システムと、方言を考慮したMixture-of-Experts(MoE)フレームワークを組み合わせたものです。
DiaMoE-TTSとは何ですか?
DiaMoE-TTSは、清華大学とGiant Interactiveが共同開発した多言語音声合成(TTS)フレームワークです。国際音声記号(IPA)統一入力システムに基づき、方言を考慮したMixture-of-Experts(MoE)アーキテクチャと低リソース適応戦略(PEFT)を組み合わせることで、低コストかつ導入しやすい多言語音声合成を実現しています。このフレームワークは、複数の言語やあまり話されていない言語にも対応しており、限られたデータでも迅速なモデリングが可能で、効率性と柔軟性を兼ね備えています。DiaMoE-TTSのデータ、コード、手法はすべてオープンソースであり、方言の保存と文化の継承を促進し、少数言語がデジタル世界で活用されることを可能にします。
DiaMoE-TTSの主な機能
-
多言語音声合成広東語、閩南語、呉語など、複数の方言や少数言語の音声合成をサポートしており、京劇の韻を踏んだ対話のような特殊な形式にも拡張できるため、ニッチな言語での発話も可能になります。
-
資源の少ない適応PEFT戦略とデータ拡張により、わずか数時間分のコーパスという限られたリソース条件下でも、新しい方言に迅速に適応し、自然で流暢な音声を合成することができる。
-
高い拡張性サプライチェーン全体がオープンソースであり、完全なデータ前処理、トレーニング、推論コードを提供し、複数の言語をサポートし、研究者や開発者による再現と拡張を容易にします。
-
非常に自然な音声合成方言を考慮したMoEアーキテクチャは、動的なゲーティングメカニズムを使用してエキスパートネットワークを選択し、各方言特有の音色とリズムを維持し、音声の自然さを向上させます。
DiaMoE-TTSの技術原理
- 統合IPAフロントエンド国際音声記号(IPA)を統一された入力システムとして使用することで、すべての方言の音声を同じ音素空間にマッピングし、方言間の違いを排除し、モデル学習の一貫性と汎化能力を確保します。
- 方言対応のMoEアーキテクチャ複数のエキスパートネットワークが導入され、各エキスパートは1つまたは複数の方言の特徴学習に特化することで、単一ネットワークにおける「スタイル平均化」問題を回避します。入力されたIPAに基づいて、音声合成に最適なエキスパートネットワークが自動的に選択され、さらに方言分類補助損失を追加することで、エキスパートネットワークの識別能力が向上します。
- 低資源適応戦略(PEFT)コンディショニングアダプタとLoRAはテキスト埋め込み層とアテンション層に統合されており、方言拡張を実現するためにわずかなパラメータ調整のみが必要となります。一方、バックボーンネットワークとMoEモジュールは固定されたままです。ピッチ摂動や音声速度摂動などの技術を用いて、低リソース条件下でのモデル合成性能を向上させています。
- 多段階トレーニング方法オリジナルのF5-TTSチェックポイントを基に、入力フォーマットのスムーズな転送を実現するために、IPA音素変換データを事前学習に導入しました。複数のオープンソース方言データセットを使用して共同モデリングを行い、MoE構造を活性化し、共通の特徴を学習し、異なる方言間で発音パターンを区別します。動的ゲーティングと方言分類支援損失を使用して、MoEのセグメンテーション効果をさらに最適化し、各方言の固有の特徴を捉えます。コーパスデータが数時間しかない新しい方言については、データ拡張と組み合わせたPEFT戦略を使用して、既存の知識を維持しながら効率的な転送を実現します。
DiaMoE-TTSプロジェクトの住所
- GitHubリポジトリ:https://github.com/GiantAILab/DiaMoE-TTS
- ハギングフェイスモデルライブラリ:https://huggingface.co/RICHARD12369/DiaMoE_TTS
- arXiv技術論文:https://www.arxiv.org/pdf/2509.22727
DiaMoE-TTSの応用シナリオ
-
教育このシステムは、方言やあまり教えられていない言語の学習に役立つ、鮮明な音声合成ツールを提供し、学生がさまざまな言語の発音をより効果的に学習し、習得できるよう支援します。
-
文化遺産の保存音声合成技術を用いて消滅の危機に瀕している方言やあまり話されていない言語を録音・再現することで、方言やあまり話されていない言語の保護と保存に貢献し、文化的多様性の維持に貢献する。
-
バーチャルヒューマンとデジタルコンテンツ仮想人間やデジタルアシスタント向けに多様な方言の声を生成し、仮想キャラクターの表現力を豊かにし、ユーザーエクスペリエンスを向上させる。
-
デジタル文化と観光観光名所で複数の言語による音声ガイドを提供することは、観光客の地域文化への帰属意識と親近感を高める。
-
国境を越えた交流複数の言語や方言での音声合成をサポートし、異なる言語的背景を持つ人々の間のコミュニケーションと相互理解を促進します。