project
ZipVoice - Xiaomiのゼロショット音声合成モデル
ZipVoiceは、Xiaomi AI Labがリリースした高効率ゼロショット音声合成(TTS)モデルです。このモデルはフローマッチングアーキテクチャに基づいており、ZipVoice(単一話者)とZipVoice-Dialog(対話)が含まれています。
ZipVoiceとは何ですか?
ZipVoiceは、Xiaomi AI Labがリリースした高効率ゼロショット音声合成(TTS)モデルです。フローマッチングアーキテクチャをベースとしたこのモデルには、ZipVoice(単一話者)とZipVoice-Dialog(対話音声)の2つのバージョンがあります。Zipformerに基づく効率的なモデリング、平均アップサンプリング戦略、フロー蒸留法などの技術革新により、軽量なモデリングと高速な推論を実現し、既存モデルのパラメータ数の多さや処理速度の遅さといった課題を解決しています。ZipVoice-Dialogは、話者ターン埋め込みベクトルとカリキュラム学習技術により、高速かつ安定した自然な対話音声合成を実現します。
ZipVoiceの主な機能
-
ゼロサンプル音声合成このシステムは、入力テキストと参照音声に基づいて特定の音色を持つ音声を合成するため、学習に大量の対象話者データを必要としません。
-
迅速な推論フロー蒸留などの技術革新により、推論ステップ数が大幅に削減され、音声合成速度が向上し、計算リソースの少ないデバイスでも効率的に動作することが可能になります。
-
高品質な音声生成生成された音声は、迅速な推論を維持しながら、高い自然さ、良好な音声品質、そして話者間の類似性を備えている。
-
対話音声合成ZipVoice-Dialogバージョンは、2人による対話音声を合成でき、自然で正確な話者切り替えをサポートしており、AIポッドキャストなどの対話音声アプリケーションのシナリオに適しています。
-
オープンソースと拡張性モデルファイル、トレーニングコード、推論コード、およびOpenDialog音声対話データセットはオープンソースであるため、開発者は研究を行ったり、アプリケーションを拡張したりするのに便利です。
ZipVoiceの技術原則
-
Zipformerに基づく効率的なモデリング本論文では、音声合成タスクにZipformerアーキテクチャを初めて導入する。マルチスケール高効率構造、畳み込みとアテンション機構の協調処理、およびアテンション重みの複数回再利用を用いることで、音声合成モデルの効率的なモデリングを実現し、モデルパラメータ数を大幅に削減する。
-
平均アップサンプリング戦略本稿では、平均アップサンプリング戦略を提案する。各テキストトークンの長さが同じであると仮定し、テキストトークンをアップサンプリングして音声予測モデルに入力する。これにより、モデルは安定した初期アライメント情報を得ることができ、アライメントの安定性と収束速度が向上する。
-
フロー蒸留加速この手法は、フロー蒸留法に基づいており、事前学習済みモデルと分類器不要のガイダンス技術を組み合わせることで、CFGを使用せずに1ステップの推論によって生徒モデルが教師の予測を近似できるようにし、推論ステップ数を削減し、CFGによって引き起こされる追加の推論オーバーヘッドを回避し、高速な推論を実現します。
-
スピーカーターン埋め込みベクトル対話音声合成において、話者ターン埋め込み法は、モデルにきめ細かく正確な話者識別情報を提供することで、話者切り替えのモデリングの難易度を軽減し、話者切り替えの精度を向上させるために導入された。
-
コース学習戦略このシステムは、単一話者の音声データを用いて事前学習を行い、音声とテキストのアライメント機能を強化し、対話音声データで微調整を行い、話者の役割切り替えや自然な対話音声スタイルを学習し、対話音声における複雑なアライメント問題を解決します。
-
ステレオ拡張ZipVoice-Dialogは、重み初期化、モノラル音声正規化、話者相互排除損失などの技術を用いることで、ステレオ生成を可能にするように拡張され、ステレオ対話の没入感を高めている。
ZipVoiceプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/k2-fsa/ZipVoice
- ハギングフェイスモデルライブラリ:https://huggingface.co/k2-fsa/ZipVoice
- arXiv技術論文:https://arxiv.org/pdf/2506.13053
ZipVoiceのアプリケーションシナリオ
- パーソナルアシスタントスマートフォンやスマートスピーカーなどのデバイスに搭載された音声アシスタントは、ユーザーにより自然でパーソナライズされた音声対話体験を提供する。
- 車載音声システム自動車においては、ナビゲーション、音声制御、その他の機能に使用され、よりスムーズな音声操作を実現する。
- オーディオブックテキストコンテンツを音声に変換し、小説、ニュース、記事などに適した高品質のオーディオブックを生成します。
- 動画吹き替え動画コンテンツのナレーションを自動生成することで、手作業によるナレーションにかかる時間とコストを削減し、コンテンツ制作の効率を向上させます。
- 言語学習音声合成技術を用いて学習者が発音練習を行うのを支援し、標準的な発音例を提供します。