AB
AiBoss
project

VoxCPM - Facewall Intelligenceと清華大学が共同開発した音声生成モデル

VoxCPMは、Wallfacerと清華大学深圳国際大学院が共同開発した0.5Bパラメータの音声生成モデルです。音声合成の自然さ、音色の類似性、韻律表現力において業界トップレベルを達成しています。VoxC...

VoxCPMとは何ですか?

VoxCPMは、Wallfacerと清華大学深圳国際大学院が共同開発した0.5Bパラメータの音声生成モデルです。音声合成において、自然さ、音色の類似性、韻律表現力において業界トップレベルを達成しています。VoxCPMはエンドツーエンドの拡散自己回帰アーキテクチャを採用し、テキストから連続的な音声表現を直接生成することで、従来の離散的な単語分割の限界を克服しています。階層的な言語モデリングと有限状態量子化制約により、意味と音響の暗黙的な分離を実現し、音声の表現力と生成安定性を大幅に向上させています。VoxCPMはゼロサンプル音声クローニングをサポートしており、参照音声クリップのみで話者の音色、アクセント、感情的なイントネーションなどの特徴を正確に再現し、非常にリアルな音声を生成します。 VoxCPMは極めて高い推論効率を誇り、NVIDIA RTX 4090 GPU上で0.17という低いリアルタイムファクター(RTF)を実現し、リアルタイムアプリケーションのニーズを満たします。中国語と英語のバイリンガル音声複製に対応し、数式や記号の音声合成が可能で、カスタム発音補正も行えます。

VoxCPMの主な機能

  • 文脈認識型音声生成VoxCPMは高度なテキスト理解能力を備えており、テキストの意味に基づいて適切な韻律を推論し、表現力豊かで流暢な自然な音声を生成します。また、テキストの内容に応じて発話スタイルを自律的に調整し、180万時間にも及ぶ膨大なバイリンガルコーパスに基づいて、非常に適切なパーソナライズされた音声表現を生成します。
  • ゼロサンプル音声クローニングVoxCPMは、短い参照音声クリップだけで、正確なゼロサンプル音声クローンを実現します。話者の音色を完璧に再現し、アクセント、感情的な抑揚、リズム、間合いといった微妙な特徴を捉えることで、非常に忠実で自然な音声模倣を生み出します。
  • 高効率合成VoxCPMはストリーミング合成をサポートしており、一般消費者向けNVIDIA RTX 4090 GPUでは、リアルタイム係数(RTF)が0.17と低く、リアルタイムアプリケーションのニーズを容易に満たします。
  • 多言語対応VoxCPMは主に英語と中国語で学習されており、様々な言語環境やアプリケーションシナリオに適した、高品質なバイリンガル(英語と中国語)音声を生成できます。
  • 柔軟なテキスト入力方法VoxCPMは、プレーンテキスト入力と音素入力を含む、複数のテキスト入力方法をサポートしています。ユーザーは、より正確な発音制御のために、必要に応じて異なる入力モードを選択できます。
  • 強力な音声処理機能VoxCPMは、数式、記号、その他の特殊文字を含む複雑なテキストコンテンツを処理し、対応する音声出力を生成できます。また、カスタム発音補正をサポートしており、音素置換によってユーザーが特定の発音ニーズを満たすことができます。

VoxCPMの技術原則

  • エンドツーエンド拡散自己回帰アーキテクチャVoxCPMは、エンドツーエンドの拡散自己回帰アーキテクチャを採用し、テキストから連続的な音声表現を直接生成することで、従来の離散的な単語分割の限界を克服し、より自然な音声連続性の処理を可能にします。
  • 階層型言語モデリングとFSQ制約VoxCPMは、階層型言語モデリングと有限状態量子化(FSQ)制約を用いることで、暗黙的な意味論的・音響的分離を実現し、音声の表現力と生成安定性を大幅に向上させる。
  • ローカル音声符号化モジュール(LocEncモジュール)このモジュールは、入力テキストをエンコードし、その意味情報を抽出し、音声生成に適した中間表現に変換する役割を担います。
  • テキスト意味論的言語モデル(TSLM)TSLMは、テキストの意味論をモデル化し、テキストの内容に関連する意味表現を生成し、後続の音声生成のための意味論的基盤を提供する役割を担っています。
  • 残差音響言語モデル(RALM)RALMはTSLMに基づいて音響特性をさらに洗練させ、音響の詳細を追加することで、生成される音声をより自然でリアルなものにする。
  • 局所拡散生成モジュール(LocDiTモジュール)LocDiTモジュールは、拡散処理を通して連続的な音声特徴を生成し、意味情報と音響情報を融合させることで、最終的に高品質の音声波形を生成します。
  • 因果的VAEコーデックこれは、元の音声波形を低フレームレートの潜在空間に圧縮し、生成された音声表現を波形信号に再構築するために使用され、生成された音声の高品質と安定性を保証します。

VoxCPMプロジェクトのアドレス

  • GitHubリポジトリ: https://github.com/OpenBMB/VoxCPM/
  • ハグ顔モデルライブラリ:  https://huggingface.co/openbmb/VoxCPM-0.5B
  • オンラインでデモを体験してください: https://huggingface.co/spaces/OpenBMB/VoxCPM-Demo

VoxCPMの応用シナリオ

  • 音声アシスタントVoxCPMは、インテリジェントな音声アシスタントに自然で流暢な音声合成機能を提供し、より人間らしい声でユーザーと対話できるようにすることで、ユーザーエクスペリエンスを向上させます。
  • オーディオブックテキストコンテンツを高音質の音声に変換できるため、オーディオブックやオーディオ小説などの制作に適しており、ユーザーにより鮮明な聴覚体験を提供します。
  • 音声放送天気予報、ニュース放送、交通情報放送などの場面で、明瞭で自然な音声放送コンテンツを生成するために使用でき、情報伝達の効率と精度を向上させる。
  • 音声クローンVoxCPMのゼロサンプル音声クローン機能は、仮想キャラクターやインテリジェントなカスタマーサービスに独自の音声特性を与えるなど、パーソナライズされた音声を作成するために使用でき、それらのリアリティと認識性を向上させます。
  • 教育言語学習、オンライン教育、その他の場面において、VoxCPMは標準的な音声例を生成することで、学習者が発音をより効果的に模倣し、習得できるよう支援します。
  • エンターテインメント業界ゲーム、アニメ、映画などのエンターテインメント分野において、VoxCPMは様々なキャラクターの声を生成し、コンテンツの表現力と魅力を高めることができます。