project
VibeVoice - マイクロソフトのオープンソース音声合成モデル
VibeVoiceは、Microsoftが開発した新しいテキスト読み上げ(TTS)モデルで、ポッドキャストなどの表現力豊かで長尺の複数話者による会話音声を生成します。最新のオープンソースモデルであるVibeVoice-Realtime-0.5Bは、わずか5つのリソースしか必要としません。
VibeVoiceとは何ですか?
VibeVoiceは、Microsoftが開発した新しいテキスト読み上げ(TTS)モデルで、ポッドキャストなどの表現力豊かな長尺の複数話者による会話音声を生成します。最新のオープンソースモデルであるVibeVoice-Realtime-0.5Bは、わずか5億個のパラメータで、最初のパケットの遅延が約300ミリ秒という真のリアルタイムストリーミング音声合成を実現します。その中核となる機能は「思考しながら話す」ことで、話者がテキスト生成と同時に話し始め、ポーズ、イントネーションの変化、自然な会話の流れをサポートします。このモデルは、革新的な連続音声トークン化技術と次世代トークン化拡散フレームワークを大規模言語モデル(LLM)と組み合わせることで、高忠実度を維持しながら長尺の音声シーケンスを効率的に処理します。VibeVoiceは最大90分の音声を合成でき、最大4人の異なる話者をサポートすることで、従来のTTSシステムの限界を打ち破り、自然な対話と感情表現のための新たな可能性を提供します。
VibeVoiceの主な機能
- より多くの話し手が支持する最大4人の異なる話者による会話音声を生成でき、ポッドキャスト、オーディオブック、その他の用途に適しています。
- 長い対話最大90分間の連続音声メッセージの生成をサポートし、従来のTTSシステムの長さ制限を打破します。
- 表現力豊かな声テキストの内容に基づいて感情や抑揚のある音声を生成することで、より自然で生き生きとした対話を実現します。
- 多言語対応複数の言語での音声合成をサポートし、異言語間の対話シナリオにも対応できます。
- 高忠実度オーディオ生成される音声は高品質で、自然な人間の話し方に非常に近く、より良いユーザーエクスペリエンスを提供します。
- リアルタイムインタラクションリアルタイムで音声を生成でき、動的な対話やインタラクティブなアプリケーションをサポートする。
VibeVoiceの技術原則
- 連続音声トークン化この手法では、連続音声トークン化技術を用いて音声信号を意味トークンと音響トークンに分解します。トークン化処理は、高い音声忠実度を維持しながら計算効率を向上させるため、極めて低いフレームレート(例:7.5 Hz)で実行されます。意味トークナイザーはテキストコンテンツを処理して意味情報を抽出し、音響トークナイザーは具体的な音声情報を生成します。
- 次世代ラベル拡散フレームワークこれは、拡散モデルに基づいた生成フレームワークであり、テキストの文脈と対話の流れを理解するために大規模言語モデル(LLM)と組み合わされています。拡散モデルは、生成された音声タグを段階的に洗練させることで、高品質の音声信号を生成します。
- 複数スピーカー間の一貫性特定のスピーカー埋め込み技術を用いることで、このモデルは長時間の対話においても、異なる話者の音声特性が一貫して維持されることを保証します。このモデルは複数話者による音声合成をサポートし、話者切り替えや対話の流れを自然に処理できます。
- 高忠実度オーディオ生成高度なボコーダー技術を用いることで、生成されたトークンは高音質の音声信号に変換されます。ボコーダーのパラメータを最適化することで、生成される音声は音質の面で自然な人間の音声に限りなく近いものとなります。
VibeVoiceプロジェクトの住所
- プロジェクト公式サイト:https://microsoft.github.io/VibeVoice/
- GitHubリポジトリ:https://github.com/microsoft/VibeVoice
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/microsoft/vibevoice-68a2ef24a875c44be47b034f
- 技術論文:https://github.com/microsoft/VibeVoice/blob/main/report/TechnicalReport.pdf
VibeVoiceの応用事例
- ポッドキャスト制作最大4人の異なる話者による会話音声の生成と、最大90分間の連続音声に対応しているため、複数のホストによるポッドキャストの作成や、ポッドキャストコンテンツの充実に最適です。
- オーディオブック感情豊かで表現力に富んだ声を生成し、オーディオブックをより生き生きと面白くし、リスナーの読書体験を向上させます。
- バーチャルアシスタント生成される音声は自然で流暢であり、仮想アシスタントとの音声対話に適しており、ユーザーにより人間味のあるサービスを提供し、ユーザーエクスペリエンスを向上させます。
- 教育と訓練模擬授業などの教育場面に適した感情表現機能は、インタラクティブな教材をより生き生きとさせ、学習効果を高めます。
- エンターテインメントとゲーム仮想キャラクターに表情豊かな声を生成し、ゲームやインタラクティブなエンターテイメントアプリケーションの没入感を高め、プレイヤーによりリアルな体験を提供します。