AB
AiBoss
project

GLM-4-Voice - Zhipu AIが発表した、エンドツーエンドの感情ベースの音声モデル。

GLM-4-Voiceは、Zhipu AIが開発したエンドツーエンドの感情表現音声モデルです。中国語と英語の音声を直接理解・生成でき、リアルタイムの音声対話に対応し、ユーザーの指示に応じて音声の感情、声調、速度、方言などの特徴を柔軟に調整できます。

GLM-4-Voiceとは何ですか?

GLM-4-Voiceは、Zhipu AIが開発したエンドツーエンドの感情音声モデルです。中国語と英語の音声を直接理解・生成でき、リアルタイムの音声対話に対応し、ユーザーの指示に応じて音声の感情、トーン、速度、方言などの特徴を柔軟に調整できます。このモデルは3つの部分から構成されています。GLM-4-Voice-Tokenizerは連続音声を離散トークンに変換する役割を担い、GLM-4-Voice-Decoderはトークンを連続音声出力に変換し、GLM-4-Voice-9BはGLM-4-9Bモデルに基づいて事前学習およびアライメントされ、音声の理解と生成を行います。GLM-4-Voiceの設計では、エンドツーエンドのモデリングを採用することで情報損失を低減し、音声対話の自然さと流暢さを向上させ、低遅延のリアルタイム対話に対応し、ユーザーに豊かで自然な音声対話体験を提供します。

GLM-4-Voiceの主な機能

  • 音声の理解と生成中国語と英語の音声を直接理解・生成できるため、スムーズな人間とコンピュータの対話が可能になる。
  • 感情表現喜び、悲しみ、怒り、恐怖など、さまざまな感情や声のトーンをシミュレートすることで、音声応答をより自然にします。
  • 音声速度を調整するユーザーの指示に応じて音声速度を調整するため、さまざまな会話シーンに適しています。
  • リアルタイムの割り込みとコマンド入力これにより、ユーザーはいつでも音声出力を中断し、新しいコマンドを入力して対話内容を調整することができます。
  • 多言語および方言対応中国語、英語、および広東語、重慶方言、北京方言などの様々な中国語方言に対応しています。
  • 低遅延インタラクション低遅延で高品質な音声対話を実現するための、ストリーミング思考に基づいたアーキテクチャを設計する。

GLM-4-Voiceの技術原理

  • エンドツーエンドモデリング従来のカスケード型ソリューション(ASR + LLM + TTS)とは異なり、GLM-4-Voiceは音声の理解と生成を統一されたモデルで完了させ、情報損失を回避します。
  • オーディオトークナイザー教師あり学習による音声トークナイザーを使用して、連続的な音声入力を離散的なトークンに変換し、12.5Hzという低ビットレートで意味情報と副言語的特徴を保持します。
  • 音声デコーダーフローマッチングモデル構造に基づく音声デコーダは、離散的な音声トークンを連続的な音声出力に変換し、生成を開始するために必要なトークンは最低10個で済むため、対話の遅延を低減します。
  • 事前研修と連携GLM-4-Voice-9Bは、GLM-4-9Bに基づいて事前学習およびアライメントされており、離散化された音声トークンを理解および生成します。事前学習には大量の音声データとテキストデータが使用されるため、このモデルは強力な音声理解およびモデリング能力を備えています。
  • ストリーミング推論ストリーミング推論に対応しており、モデルはテキストと音声を交互に出力できます。テキストは応答内容の高品質を確保するための参照として使用され、音声出力はユーザーの音声コマンドに応じてリアルタイムで調整されます。

GLM-4-Voiceプロジェクトのアドレス

GLM-4-Voiceの応用シナリオ

  • スマートアシスタントスマートフォンやスマートホーム機器では、音声による対話を通じて、リマインダーの設定、天気予報の確認、家電製品の操作など、ユーザーがさまざまなタスクを完了できるよう支援するスマートアシスタントとして機能します。
  • 顧客サービスカスタマーサービスセンターでは、仮想カスタマーサービス担当者として、自然言語理解と音声合成技術に基づき、ユーザーへの相談や問題解決サービスを提供しています。
  • 教育と学習教育分野においては、言語学習アシスタントとして機能し、学生が発音、リスニング、スピーキングの練習をするのを支援し、個別の学習提案を提供する。
  • エンターテインメントとメディアエンターテインメント業界では、アニメーション、ゲーム、オーディオブックなどにおいて、自然で表現力豊かな音声出力を実現するための音声合成技術として利用されています。
  • ニュースと放送ニュース放送で使用されるこの技術は、テキストニュースを迅速に音声に変換し、音声情報を必要とするユーザーに提供する。