project
IndexTTS2 - Bilibiliの最新オープンソース音声合成モデル
Bilibiliの音声チームが開発した新しいテキスト音声合成(TTS)モデル「IndexTTS2」が正式にオープンソース化されました。このモデルは感情表現と音声再生時間の制御において大きな進歩を遂げており、正確な音声再生時間制御をサポートする初の自己回帰型TTSモデルです。
IndexTTS2とは何ですか?
Bilibiliの音声チームが開発した新しいテキスト読み上げ(TTS)モデル「IndexTTS2」が正式にオープンソース化されました。このモデルは、感情表現と持続時間制御において画期的な進歩を遂げており、正確な持続時間制御をサポートする初の自己回帰型TTSモデルです。ゼロサンプル音声クローニングをサポートし、1つの音声ファイルだけで音色、リズム、話し方を正確に再現します。また、複数の言語に対応しています。IndexTTS2は感情と音色の分離制御を実装しており、ユーザーは音色と感情のソースを個別に指定できます。さらに、マルチモーダルな感情入力機能を備え、感情参照音声、感情説明テキスト、または感情ベクトルによる感情制御をサポートします。
IndexTTS2の主な機能
-
ゼロサンプル音声クローニング参照音声ファイルが1つあれば、その音声、イントネーション、リズムを正確に再現でき、複数の言語に対応し、高度にパーソナライズされた音声合成を実現します。
-
感情と持続時間のコントロールゼロサンプル感情クローニングに対応し、参照音声に基づいて感情をシミュレートできるほか、テキストによる感情表現の制御も可能です。さらに、世界初となる高精度な音声再生時間制御機能を搭載しており、映画の吹き替えやタイムライン同期といった用途に合わせて、生成される音声の長さを設定できます。
-
高忠実度サウンドクオリティ最大48kHzのオーディオサンプリングレートに対応し、ロスレスオーディオ出力をサポートします。最適化されたボコーダーとの組み合わせにより、自然で流暢かつ感情豊かな音声を生成し、機械的なノイズを低減して音質を向上させます。
-
マルチモーダル入力のサポートテキストや音声など、複数の入力方法に対応しています。ユーザーは、テキストによる説明、参照音声、または感情ベクトルを通して、生成される音声のスタイルや感情を制御でき、より柔軟な音声合成体験を実現します。
-
ローカル展開とオープンソース完全なローカライズ展開をサポートし、モデルの重みを公開する計画があり、開発者に強力なツールを提供し、より多くのアプリケーションシナリオを可能にし、TTS技術の普及を促進します。
IndexTTS2の技術的原理
-
モジュール式建築本システムは、テキスト音声変換(T2S)、意味音声メロディー変換(S2M)、およびボコーダーという3つの主要モジュールで構成されています。これらのモジュールが連携して、テキストから高品質な音声への変換を実現します。
-
感情と音色を切り離す勾配反転レイヤーなどの技術を用いることで、感情や音色の特徴をキューから切り離し、ユーザーが感情や音色を独立して制御できるようにすることで、より柔軟な音声合成を実現できる。
-
多段階トレーニング戦略高品質な感情データの不足を克服し、モデルの感情表現能力を高め、音声合成の自然さと感情の豊かさを向上させるために、多段階のトレーニング戦略が採用されている。
-
高サンプリングレートと最適化されたボコーダー最大48kHzのオーディオサンプリングレートと、BigVGAN2などの最適化されたボコーダーを組み合わせることで、高忠実度で自然かつ流暢な音声を生成し、機械的な音を低減して音質を向上させます。
-
ゼロサンプルクローニング技術高度なゼロサンプルクローニング技術により、たった1つの参照音声だけで声、イントネーション、リズムを正確に模倣でき、多言語に対応し、高度にパーソナライズされた音声合成を実現します。
IndexTTS2プロジェクトのアドレス
- プロジェクト公式サイト:https://index-tts.github.io/index-tts2.github.io/
- GitHubリポジトリ:https://github.com/index-tts/index-tts
- ハギングフェイスモデルライブラリ:https://huggingface.co/IndexTeam/IndexTTS-2
- arXiv技術論文:https://arxiv.org/pdf/2506.21619
IndexTTS2およびIndexTTS1.5のアップグレード
-
正確な時間制御機能IndexTTS2は、生成される音声の長さをミリ秒単位で指定できる、高精度な再生時間制御に対応した初の自己回帰型音声合成モデルです。IndexTTS1.5にはこの機能はありません。
-
感情的な音色分離モデリングIndexTTS 2では、感情と音色を別々にモデリングすることで、ユーザーがそれぞれを個別に制御できるようになりました。IndexTTS 1.5では、感情と音色の制御精度はそれほど高くありませんでした。
-
マルチモーダルな感情入力サポートIndexTTS2は、音声感情参照、テキスト感情記述、感情ベクトルなど、さまざまな方法を用いて生成される音声の感情制御をサポートしています。IndexTTS1.5も感情制御をサポートしていますが、その方法は比較的限定的です。
-
より強い感情表現能力IndexTTS 2は感情表現の面で最適化されており、様々な感情状態をより良くシミュレートできる。IndexTTS 1.5も感情表現の面で改善されているが、第2世代にはまだ及ばない。
-
音声の安定性が向上しましたIndexTTS2は、GPT潜在表現やソフトインストラクションメカニズムなどの技術によって、音声生成の安定性を向上させています。IndexTTS 1.5も安定性の面で改善されていましたが、第2世代ではさらに最適化されています。
IndexTTS2の応用シナリオ
-
映画やテレビ番組の吹き替え映画やテレビ番組向けに高品質な吹き替えを提供し、音声の長さや感情を正確に制御し、映像と音声の同期のニーズを満たすことができます。
-
バーチャルキャラクター仮想キャラクターに自然で感情豊かな声を与えることで、インタラクティブな体験とユーザーの没入感を高める。
-
オーディオブック自然で流暢な音声を生成し、オーディオブック制作のための高品質な音声合成を提供するとともに、リスナーの聴覚体験を向上させます。
-
スマートアシスタントインテリジェントアシスタントや音声放送などのシナリオにおいて、自然でスムーズな音声対話を実現し、ユーザーエクスペリエンスを向上させます。
-
広告制作広告制作向けにパーソナライズされた音声合成を提供し、複数の言語と感情表現に対応し、広告の魅力を高めます。
-
教育教育用ソフトウェアやオンラインコースでは、学生の理解と学習を促進するために、分かりやすい音声解説が提供されています。