project
VoxCPM1.5 - Wallfacerのオープンソースのエンドツーエンド音声合成モデル
VoxCPM 1.5は、Wallfacer AIが開発した高度なエンドツーエンドのテキスト音声合成(TTS)モデルで、文脈認識型音声生成とリアルな音声クローンに重点を置いています。このモデルは、エンドツーエンドの拡散自己回帰アーキテクチャを使用して、テキストから直接音声を生成します。
Vox CPM1.5とは何ですか?
VoxCPM 1.5は、Mianbi AIが提供する高度なエンドツーエンドのテキスト音声合成(TTS)モデルで、コンテキスト認識型音声生成とリアルな音声クローニングに重点を置いています。このモデルは、エンドツーエンドの拡散自己回帰アーキテクチャを使用してテキストから直接連続音声を生成し、より洗練された結果を得るために44.1kHzの高サンプリングレートの音声クローニングをサポートしています。同時に、モデルの生成効率は2倍になり、1秒間の音声生成に必要なトークン数はわずか6.25個に抑えられ、アーティファクトの低減により安定性が向上しています。VoxCPM 1.5は、LoRAと完全なファインチューニングをサポートする高度なカスタマイズ機能を提供し、開発者がパーソナライズされた音声モデルを作成するのに役立ちます。
VoxCPM1.5の主な機能
-
高サンプリングレートオーディオクローニング44.1kHzのサンプリングレートに対応しており、高音質オーディオからより詳細なサウンドを複製することができます。
-
高効率音声合成モデル生成効率が向上し、1秒間の音声生成に必要なトークン数がわずか6.25個となり、速度が2倍になり、品質も向上しました。
-
文脈認識型音声生成テキストの内容に基づいてトーンとスタイルを自動的に調整し、自然で流暢な話し方を生成します。
-
高度なカスタマイズ機能開発者が個別のトレーニングや最適化を行えるよう、LoRAと詳細なチューニングスクリプトを追加しました。
-
安定性を向上させる音声ノイズを低減し、長文テキストにおける音声生成効果を最適化します。
VoxCPM1.5の技術的原理
-
トークナイザー不要のアーキテクチャVoxCPM 1.5は、テキストから連続的な音声信号を直接生成する、マークなしのエンドツーエンドアーキテクチャを採用しており、従来のTTSにおける離散的なトークン化によって課される制約を回避しています。
-
拡散自己回帰モデル拡散モデルに基づく自己回帰アーキテクチャは、音声信号の連続的な表現を段階的に生成することにより、高品質な音声合成を実現する。
-
階層型言語モデリングMiniCPM-4言語モデルを組み合わせることで、階層型モデリングを用いて意味と音響の暗黙的な分離を実現し、それによって音声の自然さと表現力を向上させる。
-
FSQ制約音声生成の安定性を最適化し、高品質な音声合成出力を確保するために、フローマッチングなどの技術を活用する。
-
高効率リアルタイム合成RTF値が0.15という低い値でもストリーミング合成をサポートしており、民生用GPU上で低遅延のリアルタイム音声合成を実現します。
VoxCPM1.5プロジェクトのアドレス
- GitHubリポジトリ:https://github.com/OpenBMB/VoxCPM
- ハギングフェイスモデルライブラリ:https://huggingface.co/openbmb/VoxCPM1.5
VoxCPM1.5の適用シナリオ
-
スマートホームスマートスピーカーやスマート家電などのデバイスにおいて、自然でスムーズな音声操作を実現し、ユーザーエクスペリエンスを向上させます。
-
オーディオブックテキストコンテンツを高品質な音声に素早く変換し、オーディオブックやポッドキャストの制作に活用できます。
-
言語学習音声クローン機能は、学習者がさまざまな言語の発音を真似ることで、言語の発音練習をするのに役立ちます。
-
ゲームキャラクターの声優ゲーム内のキャラクターにパーソナライズされた音声を生成し、没入感を高めます。
-
ブランドプロモーション広告やプロモーションで使用するために、音声クローン技術を用いてブランドアンバサダーの声を生成する。