project
GLM-TTS - ZhipuのオープンソースAIテキスト音声合成モデル、音声クローンをサポート
GLM-TTSは、Zhipuが開発したオープンソースのAIテキスト音声合成モデルで、音声クローン、多様な感情表現、高精度なテキスト理解、高品質な音声出力といった特長を備えています。意味モデリングと音響モデリングを組み合わせた2段階生成パラダイムを採用しています。
GLM-TTSとは何ですか?
GLM-TTSは、Zhipuが開発したオープンソースのAIテキスト音声合成モデルで、音声クローン、多様な感情表現、高精度なテキスト理解、高品質な音声出力といった特長を備えています。2段階生成パラダイムを採用し、意味モデルと音響モデルによる効率的な音声合成を実現しています。GLM-TTSは、方言クローン、きめ細かな発音制御、多様な感情表現をサポートしており、インテリジェント音声アシスタント、オーディオブック、教育、エンターテイメント、カスタマーサービス、アクセシビリティ支援、広告、ニュース、スマートホーム、バーチャルアンカーなど、幅広い用途に適しています。低い単語誤り率と高い自然さにより、GLM-TTSはユーザーに柔軟で効率的、かつパーソナライズされた音声対話体験を提供し、音声合成技術の多分野への普及を促進します。GLM-TTSは、GitHub、Hugging Face、ModelScopeなどのプラットフォームでオープンソースとして公開されています。
GLM-TTSの主な機能
- 音響再生GLM-TTSは、特定の話し手の音色を迅速に再現することができ、少量の音声データだけで非常に類似した音声合成を実現し、複数の言語や方言の音色クローンにも対応しています。
- 複数の感情クローンテキストの内容の雰囲気に基づいて対応する音声感情を自動的にマッチングさせ、喜び、悲しみ、怒りなどさまざまな感情表現をサポートし、音声合成の自然さと表現力を向上させます。
- 高精度テキスト理解優れたテキスト理解能力を備え、テキストコンテンツを正確に処理し、単語エラー率を低減し、合成音声の正確性と流暢性を保証します。
- 方言と特殊音声合成四川方言や東北方言など、さまざまな方言や特殊な発音の合成をサポートし、多様な言語的・文化的背景を持つ人々のニーズに応えます。
- 洗練された発音制御: 音素入力技術を用いることで、多声文字や稀少文字の発音問題を解決し、発音の正確性と制御性を向上させます。
- 高忠実度音声出力独自開発の2D-Vocosボコーダーをベースに、高品質で高忠実度の音声波形を生成し、高サンプリングレート出力に対応し、音質性能を向上させています。
GLM-TTSの技術的原理
- 2段階生成パラダイムGLM-TTSは、意味モデリング(テキストからトークンへの変換)と音響モデリングおよび波形再構成(トークンからWAVへの変換)からなる2段階の生成パラダイムを採用しています。第1段階では、自己回帰モデルを使用してテキストを意味トークンのシーケンスに変換し、コンテンツの正確性と一貫性を確保します。第2段階では、条件付きフローマッチングモデルを使用してメルスペクトログラムを予測し、それを2D-Vocosボコーダーを使用して高品質の音声波形に変換します。
- 多重報酬強化学習GLM-TTSは、GRPOアルゴリズムフレームワークに基づいたマルチ報酬強化学習メカニズムを導入しており、文字誤り率(CER)、類似性(Sim)、感情(Emotion)、およびパラ言語(笑い声など)といった多次元報酬を統合しています。動的サンプリングと勾配剪定戦略により学習プロセスが最適化され、音声の感情表現と擬人化が大幅に向上します。
- 洗練された発音制御(音声入力)GLM-TTSは、音素入力技術を採用し、動的に制御可能な辞書とハイブリッド入力方式によって多声文字や稀少文字のターゲット音素を提供することで、正確な発音制御を実現します。推論段階では、音素シーケンスとテキスト入力モデルを組み合わせることで、テキストのリズムを維持しながら正確な発音を保証します。
- LoRA(プレミアムサウンドカスタマイズ)GLM-TTSは最適化されたLoRA微調整パラダイムを採用しており、モデルパラメータの約15%のみを微調整すれば済みます。少量の高品質オーディオデータと組み合わせることで、全パラメータ微調整に匹敵する音色の忠実度と自然さを実現し、音色カスタマイズの開発コストと実装ハードルを大幅に削減するとともに、音色の汎化能力とシーン間の安定性を向上させます。
- データ処理と特徴抽出GLM-TTSは、音声標準化、背景雑音の分離と除去、話者分離と結合、WERフィルタリング、句読点の最適化、特徴抽出などのステップを含む包括的なデータ処理パイプラインを構築します。異種混在の音声からクリーンな音声と高品質な特徴を抽出し、モデル学習のための信頼性の高いデータを提供します。
- モデル構造の最適化GLM-TTSは、音声トークナイザーを最適化し、トークンレートと語彙サイズを増加させ、ピッチ推定モジュール(PE)を導入し、因果畳み込み制約を撤廃し、ピッチモデリングの精度を最適化します。同時に、2D-Vocosボコーダーは、2D畳み込みとDiTライクな残差接続によってスペクトル特徴の解像度精度と音質を向上させ、複雑な音声キューへのモデルの適応性を高めます。
GLM-TTSプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/zai-org/GLM-TTS
- ハギングフェイスモデルライブラリ:https://huggingface.co/zai-org/GLM-TTS
GLM-TTSの使い方
- オンライン体験https://audio.z.ai/ にアクセスし、テキストまたは音声プロンプトをアップロードすれば、すぐに音声を生成できます。
- API呼び出しZhipu AIオープンプラットフォームを通じてAPIキーを取得し、ドキュメントに従ってリクエストを送信し、テキストまたはトーンの要件をGLM-TTSサーバーに送信して合成音声を取得します。
- ローカル展開GitHub、Hugging Face、またはModaコミュニティからモデルリソースをダウンロードし、ローカルのGPU環境にデプロイして、二次開発やカスタマイズに使用します。
GLM-TTSの応用シナリオ
-
インテリジェント音声アシスタントGLM-TTSは、インテリジェント音声アシスタント向けに自然で流暢な音声フィードバックを提供し、多言語と感情表現をサポートし、ユーザーコマンドに基づいて状況に応じた音声対話を生成することで、ユーザーエクスペリエンスを向上させます。
-
オーディオブックとオーディオコンテンツ制作GLM-TTSは、さまざまなスタイルや感情を込めた音声コンテンツを迅速に生成でき、複数の音色切り替えや方言読み上げに対応しており、オーディオブック、ポッドキャスト、その他のコンテンツにおける多様な音声制作ニーズを満たします。
-
教育と訓練GLM-TTSは、洗練された発音制御によって学習者が多声文字や珍しい文字の発音を正しく発音できるよう支援し、多言語教育や方言教育をサポートし、教育の質と効率を向上させます。
-
エンターテインメントとゲームGLM-TTSは、ゲームキャラクターやエンターテイメントコンテンツ向けの方言や感情表現を生成し、ゲームやエンターテイメントの没入感と楽しさを向上させます。
-
顧客サービスとインテリジェントなインタラクションGLM-TTSは、ユーザーの感情に基づいて音声スタイルを調整し、穏やかで丁寧な音声応答を生成することで、インテリジェントな顧客サービスの対話体験と顧客満足度を向上させます。