project
Confucius4-TTS - NetEase Youdaoのオープンソース多言語音声合成エンジン
Confucius4-TTSは、NetEase Youdaoが開発したオープンソースの13億パラメータ多言語音声合成エンジンです。このモデルは、参照テキストを必要とせず、わずか3秒の参照音声のみを使用してサンプル数ゼロの音声を複製でき、中国語、英語、日本語、韓国語など14言語のクロス言語処理をサポートしています。
Confucius4-TTSとは何ですか?
Confucius4-TTSは、NetEase Youdaoが開発した、13億パラメータを持つオープンソースの多言語音声合成エンジンです。わずか3秒の参照音声で声質を再現でき、参照テキストは不要です。中国語、英語、日本語、韓国語を含む14言語で、クロスランゲージかつアクセントフリーの合成をサポートし、感情的な抑揚も再現できます。ローカル環境での展開と学習が可能で、デジタル音声ナレーション、海外ローカライズ、多言語コンテンツ制作などに最適です。
Confucius4-TTSの主な機能
-
サンプル不要の迅速クローニングわずか3秒間の基準音声だけで、基準となるテキストや書き起こし、事前のトレーニングを必要とせずに、あらゆる音色を再現できる。
-
14言語対応のアクセントフリー多言語合成中国語、英語、日本語、韓国語、ドイツ語、フランス語、スペイン語、インドネシア語、イタリア語、タイ語、ポルトガル語、ロシア語、マレー語、ベトナム語に対応しています。音声は異なる言語間でシームレスに切り替えられ、発音は自然でアクセントがありません。
-
感情リズムの伝達音声プロンプトを通して参照音声から感情タグを自動的に抽出し、イントネーション、リズム、感情を正確に再現するとともに、言語間のロスレス転送をサポートします。
-
ローカルオフライン展開54GBのフルモデル重みデータはApache 2.0ライセンスの下でオープンソースとして公開されており、ローカルでの推論、商用利用、およびファインチューニングトレーニングが可能です。
Confucius4-TTSの技術的原理
-
音声符号化層参照音声はWav2Vec2-BERT 2.0を使用して意味的特徴を抽出するために使用され、話者識別はECAPA-TDNNを使用してエンコードされた。
-
セマンティックモデリング層GPTスタイルの大規模言語モデルは、テキストと話者の条件を受け取り、対象言語の意味的なトークンシーケンスを生成することで、アイデンティティ、言語、感情のモデリングを統合する基盤として機能します。
-
サウンドスチューデントレイヤーフローマッチングは、意味トークンをメルスペクトルに変換し、従来のボコーダーに取って代わる。
-
波形合成層BigVGAN高忠実度ニューラルネットワークボコーダーは、メルスペクトルを最終的な音声波形に復元します。
-
全体的なプロセス参照音声 → 音声エンコーダが識別/意味特徴を抽出 → LLMが意味トークンを生成 → フローマッチングがメルスペクトルに変換 → BigVGANが波形を合成。これらすべてが参照テキストなしで行われ、真のゼロサンプルエンドツーエンド音声合成が実現されます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Confucius4-TTSの使い方
-
環境準備ローカル環境にPython 3.10とCUDA 12.6がインストールされていること、および推論またはトレーニングをサポートするのに十分なビデオメモリを備えたNVIDIA GPUが利用可能であることを確認してください。
-
コードを取得GitHubから公式のConfucius4-TTSリポジトリをローカルディレクトリにクローンしてください。
-
環境づくりcondaを使用してconfuciusttsという名前の新しいPython 3.10仮想環境を作成し、それをアクティブ化します。
-
依存関係をインストールしますプロジェクトディレクトリで依存関係インストールコマンドを実行すると、必要なすべてのPythonライブラリが自動的に構成されます。
-
モデルを準備する公式の54GBのフルウェイトファイルと、Wav2Vec2-BERTやAmphion MaskGCTなどの事前学習済みコンポーネントをダウンロードし、指定されたディレクトリに配置してください。
-
実行理由推論インターフェースを呼び出し、3秒間の参照音声、ターゲットテキスト、言語コードを渡すと、モデルはクローンされた音色を持つ合成音声を生成し、音声ファイルとして保存できます。
-
オンライン体験Gradioの公式オンラインデモページにアクセスして、参照音声をアップロードし、ローカル環境にインストールすることなく、合成結果を直接聞くことができます。
-
トレーニングデータを準備するトレーニングセットは、言語コード、音声パス、正規化されたテキスト、意味トークンファイル、参照音声パスなどを含む仕様に従ってTSV形式で構成されています。
-
T2Sモデルのトレーニング事前学習済みのT2S重みを読み込み、準備されたデータに基づいてテキストから意味トークンを生成するモジュールを学習させる。
-
S2AモデルのトレーニングT2Sとエンコーダーを固定した状態で、フローマッチングモデルを別途トレーニングして、意味トークンをメルスペクトルに変換します。
-
オープンソースのリソースを入手するモデルの重みデータ、設定ファイル、および付属のツールチェーン一式は、GitHub、HuggingFace、またはModelScopeからダウンロードできます。
Confucius4-TTSの主な利点
-
真のゼロサンプルクローニングわずか3秒の基準音声だけで、基準テキストや文字起こし、事前のトレーニングを必要とせずに、あらゆる音色を再現できます。箱から出してすぐに使用できます。
-
14言語、多言語対応、アクセントなし中国語、英語、日本語、韓国語を含む14言語に対応。あらゆる音声トーンを言語間でシームレスに転送でき、自然でリアルな発音を実現。「中国語訛り」といった業界の課題を完全に解決します。
-
感情とリズムが一体となって伝達されるこのモデルは、音声プロンプトを通して参照音声のイントネーション、リズム、感情を正確に再現することができ、言語間のロスレス転送にも対応しています。
-
完全オープンソースで商用利用可能54GBに及ぶモデルの重みデータ、トレーニングコード、およびツールチェーンはすべてオープンソースであり、Apache 2.0ライセンスの下でライセンス供与されています。オフラインでローカルにデプロイしたり、自由に微調整したり、制限なく商用利用することも可能です。
Confucius4-TTSプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/netease-youdao/Confucius4-TTS
- ハギングフェイスモデルライブラリ:https://huggingface.co/netease-youdao/Confucius4-TTS
- オンラインでデモを体験してください:https://confucius4-tts.youdao.com/gradio/
Confucius4-TTSと類似の競合製品との比較
| 比較対象寸法 | Confucius4-TTS | CosyVoice |
|---|---|---|
| 参照テキストの依存関係 | わずか3秒の音声だけで、サンプルを一切使用せずにクローンを作成できます。参照テキストは不要です。 | 標準的なクローン作成には、通常、参照テキストまたは転写が必要となる。 |
| ゼロサンプル閾値 | 箱から出してすぐに使用可能。どんな音色にも対応し、トレーニングは不要です。 | 多言語クローンに対応しているが、テキストのない場面での使いやすさはやや劣る。 |
| 言語間のアクセント | 14の言語ではアクセントの転移がなく、話される頻度の低い言語ほどWERが低い。 | 多言語能力は高いが、あまり話されていない言語では発音がやや純粋さに欠ける。 |
| 感情の伝達 | 音声プロンプトの感情表現や韻律の言語間転送をサポートします。 | 音色の複製に重点を置いているため、音声レベルでの感情伝達は主な目的ではありません。 |
| オープンソースライセンス | Apache 2.0、54GBのフル権限+ツールチェーン、商用利用制限なし。 | オープンソースですが、一部の拡張版には使用制限があります。 |
| 技術アーキテクチャ | 音声エンコーダー + GPT スタイルの LLM + フローマッチング | 独自開発の大規模音声モデル、離散トークン符号化および復号化 |
| マイナー言語の堅牢性 | タイ語、ベトナム語、その他の言語はWERスコアが非常に低く、安定したパフォーマンスを示している。 | 一般的な言語では優れた性能を発揮するが、ニッチな言語環境では性能に大きな差がある。 |
| パラメータと展開 | 1.3Bパラメータ、シングルカード推論機能、シングルノードトレーニングをサポート | バージョン0.5B/1.5Bは柔軟な展開が可能ですが、テキストの配置調整が必要です。 |
Confucius4-TTSの応用シナリオ
-
多言語コンテンツ作成短い動画、ポッドキャスト、オーディオブックの多言語版を迅速に生成し、一貫した音声品質を維持しながら、吹き替えコストを削減します。
-
デジタル音声による人間の声バーチャルアンカーやAIデジタルヒューマン向けに、一貫性があり感情に訴えかける音声を提供し、14言語間のシームレスな切り替えをサポートします。
-
異言語間教育この語学学習プラットフォームは、ネイティブスピーカーの声を使って本物の外国語の発音例を生成することができ、学習者が正しい発音を身につけるのに役立ちます。
-
海外事業の現地化ゲーム、eコマース、広告などの海外向けアプリケーションでは、ローカライズされた音声コンテンツを迅速に生成できるため、中国語のアクセントがユーザーエクスペリエンスに与える悪影響を回避できます。
-
感情的な音声インタラクションインテリジェントな顧客サービス、コンパニオンAI、アクセシビリティ支援などのシナリオでは、参照音声の感情的なスタイルに基づいて、自然で温かみのある音声フィードバックを出力できます。