project
FireRedTTS-2 - 小紅書(Xiaohongshu)が開発したストリーミングテキスト読み上げシステム
FireRedTTS-2は、マルチスピーカー対話生成に特化した、高度な長尺ストリーミングテキスト音声合成(TTS)システムです。12.5Hzのストリーミング音声セグメンテーションとデュアルTransformerアーキテクチャを採用することで、低遅延、高忠実度、マルチスピーカー対話生成を実現しています。
FireRedTTS-2とは何ですか?
FireRedTTS-2は、マルチスピーカー対話生成に特化した、高度な長尺ストリーミングテキスト音声合成(TTS)システムです。12.5Hzのストリーミング音声セグメンテーションとデュアルTransformerアーキテクチャを採用し、低遅延、高忠実度、多言語音声合成を実現しています。英語、中国語、日本語、韓国語、フランス語、ドイツ語、ロシア語など複数の言語に対応し、ゼロサンプルでの言語間音声合成やコードスイッチング音声クローニング機能を備えています。現在、4人の話者による3分間の対話生成に対応しており、学習コーパスを拡張することで対話の長さや話者数をさらに増やすことができます。ポッドキャスト生成やチャットボット統合に優れ、安定した自然な音声出力と、文脈に基づいた感情豊かな音声生成を実現します。
FireRedTTS-2の主な機能
-
長文対話音声生成4人の話者による3分間の対話生成をサポートしており、学習コーパスを拡張することで対話の長さや話者の数を増やすことができます。
-
多言語対応英語、中国語、日本語、韓国語、フランス語、ドイツ語、ロシア語などの言語に対応しており、サンプル数ゼロで言語間およびコードスイッチングの音声クローンを作成する機能を備えています。
-
低遅延かつ高忠実度L20 GPU環境では、初期データパケットの遅延はわずか140ミリ秒と低く、リアルタイムのインタラクティブなシナリオに適していると同時に、高品質なオーディオ出力も保証します。
-
安定した音声出力独白と対話のテストにおいて、生成された音声は目標話者と高い類似性を示し、音声認識エラー率が低く、安定した音質とリズムを維持した。
-
ランダムな音色生成ランダムな特徴を持つ音声を生成できるため、音声認識モデルの学習データを作成したり、音声対話システムに多様なテスト素材を提供したりするのに適しています。
-
感情のリズム生成チャットボットとの連携において、文脈に基づいて感情豊かな音声を生成し、インタラクティブな体験を向上させることができます。
-
リアルタイムストリーミング生成12.5Hzのストリーミング音声セグメンテーションを採用し、高忠実度ストリーミングデコードに対応しており、リアルタイムアプリケーションに適しています。
FireRedTTS-2の技術原理
-
12.5Hz ストリーミング音声セグメンター低フレームレートで動作し、より豊富な意味情報をエンコードでき、音声シーケンスを短縮し、テキストから単語への分割モデリングを安定させ、高忠実度のストリーミングデコードをサポートするため、リアルタイムアプリケーションに適しています。
-
デュアルトランスフォーマーアーキテクチャこの手法は、話者タグ付きテキストと整列された音声セグメントを時系列順に連結するテキスト音声インターリーブ形式を採用し、これを2つのTransformerでモデル化します。大型デコーダはTransformerのみを使用して第1層のセグメントを予測し、小型Transformerが後続の層を完成させます。
-
多言語モデリング多言語事前学習により、複数の言語での音声生成をサポートし、ゼロショットの異言語間音声クローン機能とコードスイッチング機能を備え、異なる言語での対話シナリオに適応できます。
-
低遅延設計モデルアーキテクチャと推論プロセスを最適化することで、L20 GPU環境において初期データパケットの遅延を140ミリ秒まで低減し、リアルタイムインタラクションのニーズを満たすことができるようになりました。
-
長時間の会話のサポート効率的な単語分割とモデリングメカニズムにより、4人の話者による3分間の対話の生成をサポートし、トレーニングコーパスを拡張することで対話の長さと話者の数をさらに延長できます。
-
文脈を考慮した韻律音声生成時、文脈情報に基づいてリズムや感情を調整することで、より自然で表現力豊かな音声出力を実現できる。
FireRedTTS-2プロジェクトの住所
- プロジェクト公式サイト:https://fireredteam.github.io/demos/firered_tts_2/
- GitHubリポジトリ:https://github.com/FireRedTeam/FireRedTTS2
- arXiv技術論文:https://arxiv.org/pdf/2509.02020v1
FireRedTTS-2の応用事例
-
ポッドキャスト生成複数の話者によるポッドキャストコンテンツを生成でき、多言語に対応し、安定した自然な音声出力を提供するため、多言語ポッドキャスト番組の制作に適しています。
-
チャットボットこれはチャットフレームワークに統合することができ、文脈に基づいて感情豊かな音声を生成することで、インタラクティブな体験を向上させ、さまざまなチャットボットアプリケーションに適しています。
-
音声クローンゼロサンプルによる言語間およびコードスイッチング音声クローニングをサポートし、対象話者と高い類似性を持つ音声を生成できるため、音声クローニング関連のアプリケーションに適しています。
-
音声対話システム音声対話システムの構築、多様なテスト素材の提供、ランダムな音色生成のサポート、およびさまざまなシナリオのニーズへの対応に利用できます。
-
音声認識モデルのトレーニングランダムな特徴を持つ音声を生成できるため、音声認識モデルの学習データ構築に適しており、実際の録音データへの依存度を低減できる。
-
多言語音声合成複数の言語での音声合成をサポートしており、国際会議や多言語カスタマーサービスなど、多言語対応を必要とする音声アプリケーションに適しています。