project
Muyan-TTS - ゼロショット音声合成のためのオープンソースのテキスト音声合成モデル。
Muyan-TTSは、ポッドキャスト向けに設計されたオープンソースのテキスト音声合成(TTS)モデルです。このモデルは10万時間以上のポッドキャスト音声データで事前学習されており、ゼロショット音声合成を実現し、大量のターゲット話者の音声データを必要とせずに音声を生成できます。
Muyan-TTSとは何ですか?
Muyan-TTSは、ポッドキャスト向けに設計されたオープンソースのテキスト音声合成(TTS)モデルです。10万時間以上のポッドキャスト音声データで事前学習されたこのモデルは、ゼロショット音声合成を実現し、膨大なターゲット話者データを必要とせずに高品質な音声を生成します。また、話者適応機能により、個々のニーズに合わせた音声カスタマイズが可能です。Muyan-TTSは高速な合成速度を誇り、1秒の音声を0.33秒で生成できるため、リアルタイムアプリケーションに最適です。ポッドキャストやオーディオブックなどの長尺コンテンツも自然かつ一貫性のある音声合成が可能で、ローカル展開やAPI利用にも対応しているため、様々なアプリケーションへの統合が容易です。
Muyan-TTSの主な機能
- ゼロサンプル音声合成少量の参照音声とテキストを用いて高品質な音声を生成し、大量の対象話者データを必要としない。
- 話者の適応パーソナライズされた音声カスタマイズは、対象話者の少量の音声データに基づいて微調整を行うことで実現されます。
- 迅速な生成1秒分の音声を0.33秒で生成するため、長時間の音声コンテンツのリアルタイム生成やバッチ生成に適しています。
- 長文コンテンツの一貫性のある合成ポッドキャストやオーディオブックなどの長尺コンテンツを、自然かつ一貫性のある形で統合することをサポートします。
- オフライン展開に対応ローカル推論をサポートし、データプライバシーと低遅延を実現します。
Muyan-TTSの技術原理
- フレームワーク設計GPT-SoVITSフレームワークに基づき、事前学習済みのLlama-3.2-3B言語モデル(LLM)とSoVITSモデルを組み合わせて音声デコードを行います。LLMはテキストと音声トークンを整合させて中間表現を生成する役割を担い、SoVITSモデルはその中間表現を音声波形にデコードします。
- データ処理このデータセットには、10万時間を超えるポッドキャスト音声データが含まれており、データ収集、クリーニング、フォーマットなど複数の段階を経て処理され、高品質かつ多様なデータが確保されています。音声は自動音声認識(ASR)モデルを用いてテキストに変換され、音声埋め込みは離散トークンに量子化されて並列コーパスが形成されました。
- 事前学習と微調整LLMは、テキストと音声トークンの関係性を学習するために、並列コーパスで事前学習されています。その後、教師ありファインチューニング(SFT)を用いて、対象話者の少量の音声データでモデルをさらに最適化し、合成音声の自然さと類似性を向上させます。
- デコーダーの最適化デコーダーとしてVITS基本モデルを採用することで、錯覚の問題が軽減され、音声生成の安定性と自然さが向上しました。デコーダーは高品質の音声データで微調整され、合成音声の忠実度と表現力がさらに向上しています。
- 推論の高速化高効率なメモリ管理と並列推論技術により、推論速度が向上し、レイテンシが低減されます。自動アクセラレーション機能を備えたAPIモードをサポートしているため、リアルタイムアプリケーションに適しています。
Muyan-TTSプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/MYZY-AI/Muyan-TTS
- ハギングフェイスモデルライブラリ:https://huggingface.co/MYZY-AI/Muyan-TTS
- arXiv技術論文:https://arxiv.org/pdf/2504.19146
Muyan-TTSの応用シナリオ
- ポッドキャストとオーディオブック録画時間を節約しながら、長くて一貫性のあるコンテンツを生成します。
- 動画吹き替えさまざまなキャラクターに合わせて、英語のスクリプトとナレーションを迅速に合成します。
- AIキャラクターと音声アシスタント個性的なキャラクターボイスを生成し、自然なインタラクティブ体験を提供します。
- ニュース放送テキストを効率的に音声に変換するため、スマートデバイスでの放送に適しています。
- 教育とゲーム学習と娯楽体験を向上させるための、教育用音声とゲームナレーションを生成する。