project
Zonos - ZyphraAI のオープンソース多言語 TTS モデル
Zonosは、Zyphraが開発した高忠実度テキスト音声合成(TTS)モデルです。Zonosは、16億個のパラメータを持つTransformerモデルとハイブリッドSSMモデルの2つのモデルで構成されており、どちらもApache 2.0ライセンスの下でオープンソースとして公開されています。Zonosは…
Zonosとは何ですか?
Zonosは、Zyphra社が開発した高忠実度テキスト音声合成(TTS)モデルです。Zonosは、16億個のパラメータを持つTransformerモデルとハイブリッドSSMモデルの2つのモデルで構成されており、どちらもApache 2.0ライセンスの下でオープンソースとして公開されています。Zonosは、テキストプロンプトと話者埋め込みに基づいて自然で表現力豊かな音声を生成し、音声クローニングをサポートするとともに、音声速度、ピッチ、感情などのパラメータを調整できます。出力サンプリングレートは44kHzです。このモデルは、約20万時間分の多言語音声データで学習されており、主に英語をサポートし、他の言語のサポートは限定的です。Zonosは、高速な音声生成のための最適化された推論エンジンを備えているため、リアルタイムアプリケーションに適しています。
Zonosの主な機能
- ゼロサンプルTTSと音声クローニング入力テキストと10~30秒の音声サンプルを入力するだけで、高品質な音声合成(TTS)出力を生成できます。
- 音声プレフィックス入力テキストと音声の接頭辞を追加することで、話者の声をより正確に一致させることができ、ささやき声など、話者埋め込みでは再現が難しい動作を実現できます。
- 多言語対応英語、日本語、中国語、フランス語、ドイツ語に対応しています。
- 音質と感情制御音声速度、音程、最大周波数、音質、および様々な感情表現を細かく制御できます。
Zonosの技術原則
- テキスト前処理eSpeakツールに基づき、入力テキストを音素シーケンスに変換するために、テキスト正規化と音素変換が実行されます。
- 特徴予測TransformerまたはHybrid Backboneを使用してDAC(ディスクリートオーディオコーデック)タグを予測します。
- 音声生成予測されたDACタグに基づいて、オートエンコーダによるデコードによって高品質の音声出力が生成される。
Zonosプロジェクトの住所
- プロジェクト公式サイト:https://www.zyphra.com/post/beta-release-of-zonos-v0-1
- GitHubリポジトリ:https://github.com/Zyphra/Zonos
Zonosのアプリケーションシナリオ
- オーディオブックとオンライン教育テキストコンテンツを自然で流暢な音声に変換し、オーディオブックやオンラインコース向けに高品質な音声ナレーションを提供します。
- バーチャルアシスタントとカスタマーサービス仮想アシスタントやカスタマーサービスシステムでは、自然な音声対話が生成され、より人間らしいユーザー体験が提供される。
- マルチメディアコンテンツ制作映像制作、アニメーション、広告において、高品質なナレーションやボイスオーバーを生成します。
- アクセシビリティ技術視覚障害者向けに音声読み上げサービスを提供し、ウェブページ、文書、書籍などを音声化することで、情報へのアクセスを容易にします。
- ゲームとインタラクティブエンターテインメントゲームやインタラクティブなエンターテイメントアプリケーションにおいて、キャラクターのセリフやナレーションを生成し、没入感を高める。