AB
AiBoss
project

VoxCPM1.5 - Wallfacerのオープンソースのエンドツーエンド音声合成モデル

VoxCPM 1.5は、Wallfacer AIが開発した高度なエンドツーエンドのテキスト音声合成(TTS)モデルで、文脈認識型音声生成とリアルな音声クローンに重点を置いています。このモデルは、エンドツーエンドの拡散自己回帰アーキテクチャを使用して、テキストから直接音声を生成します。

Vox CPM1.5とは何ですか?

VoxCPM 1.5は、Mianbi AIが提供する高度なエンドツーエンドのテキスト音声合成(TTS)モデルで、コンテキスト認識型音声生成とリアルな音声クローニングに重点を置いています。このモデルは、エンドツーエンドの拡散自己回帰アーキテクチャを使用してテキストから直接連続音声を生成し、より洗練された結果を得るために44.1kHzの高サンプリングレートの音声クローニングをサポートしています。同時に、モデルの生成効率は2倍になり、1秒間の音声生成に必要なトークン数はわずか6.25個に抑えられ、アーティファクトの低減により安定性が向上しています。VoxCPM 1.5は、LoRAと完全なファインチューニングをサポートする高度なカスタマイズ機能を提供し、開発者がパーソナライズされた音声モデルを作成するのに役立ちます。

VoxCPM1.5の主な機能

  • 高サンプリングレートオーディオクローニング44.1kHzのサンプリングレートに対応しており、高音質オーディオからより詳細なサウンドを複製することができます。
  • 高効率音声合成モデル生成効率が向上し、1秒間の音声生成に必要なトークン数がわずか6.25個となり、速度が2倍になり、品質も向上しました。
  • 文脈認識型音声生成テキストの内容に基づいてトーンとスタイルを自動的に調整し、自然で流暢な話し方を生成します。
  • 高度なカスタマイズ機能開発者が個別のトレーニングや最適化を行えるよう、LoRAと詳細なチューニングスクリプトを追加しました。
  • 安定性を向上させる音声ノイズを低減し、長文テキストにおける音声生成効果を最適化します。

VoxCPM1.5の技術的原理

  • トークナイザー不要のアーキテクチャVoxCPM 1.5は、テキストから連続的な音声信号を直接生成する、マークなしのエンドツーエンドアーキテクチャを採用しており、従来のTTSにおける離散的なトークン化によって課される制約を回避しています。
  • 拡散自己回帰モデル拡散モデルに基づく自己回帰アーキテクチャは、音声信号の連続的な表現を段階的に生成することにより、高品質な音声合成を実現する。
  • 階層型言語モデリングMiniCPM-4言語モデルを組み合わせることで、階層型モデリングを用いて意味と音響の暗黙的な分離を実現し、それによって音声の自然さと表現力を向上させる。
  • FSQ制約音声生成の安定性を最適化し、高品質な音声合成出力を確保するために、フローマッチングなどの技術を活用する。
  • 高効率リアルタイム合成RTF値が0.15という低い値でもストリーミング合成をサポートしており、民生用GPU上で低遅延のリアルタイム音声合成を実現します。

VoxCPM1.5プロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/OpenBMB/VoxCPM
  • ハギングフェイスモデルライブラリ:https://huggingface.co/openbmb/VoxCPM1.5

VoxCPM1.5の適用シナリオ

  • スマートホームスマートスピーカーやスマート家電などのデバイスにおいて、自然でスムーズな音声操作を実現し、ユーザーエクスペリエンスを向上させます。
  • オーディオブックテキストコンテンツを高品質な音声に素早く変換し、オーディオブックやポッドキャストの制作に活用できます。
  • 言語学習音声クローン機能は、学習者がさまざまな言語の発音を真似ることで、言語の発音練習をするのに役立ちます。
  • ゲームキャラクターの声優ゲーム内のキャラクターにパーソナライズされた音声を生成し、没入感を高めます。
  • ブランドプロモーション広告やプロモーションで使用するために、音声クローン技術を用いてブランドアンバサダーの声を生成する。