project
dots.tts - 上海交通大学と共同でXiaohongshuがオープンソース化した音声合成基盤モデル。
dots.ttsは、Xiaohongshu dotsチームと上海交通大学X-LANCE Labが共同でオープンソース化した、20億個のパラメータを持つ完全連続自己回帰型音声合成基盤モデルです。このモデルは、連続潜在空間において48kHzの音声をブロックごとに直接生成します。
dots.ttsとは何ですか?
dots.ttsは、上海交通大学のXiaohongshu dotsチームとX-LANCE Labが共同でオープンソース化した、20億パラメータの完全連続自己回帰型音声合成基盤モデルです。このモデルは、連続潜在空間で48kHzの音声をブロックごとに直接生成し、Seed-TTS-Evalなどのベンチマークにおいて最先端の音色類似性とコンテンツ精度を実現しています。ゼロショットクローニング、ストリーミング出力、低遅延の全二重対話に対応しています。このプロジェクトには、完全なオープンソースコードと重みが含まれており、dots.tts.editの精密な音声編集機能を拡張しています。
dots.tts の主な機能
- ゼロサンプル音色クローニングわずか3~10秒の参照音声があれば、その音声を複製してあらゆる新しいテキストを読み上げることができます。言語間のクローニングに対応し、Seed-TTS-Evalベンチマークにおいて、コンテンツの精度と話者の類似性で最先端(SOTA)の性能を実現しています。
- テキスト音声合成これは、ランダムな音色サンプリングから指定された話者への高品質な音声生成を提供し、2Bパラメータの連続自己回帰モデルに基づいて48kHzの音声を直接出力します。
- ストリーミング生成と低遅延インタラクションネイティブでストリーミング出力をサポートしており、テキストプレフィックスを入力すると、ブロックごとに音声を生成できます。1T1Aデュアルストリームモードでは、音声側は上流のLLMから出力される各テキストトークンに即座に応答し、音声の最初のパケット遅延は54.4ミリ秒と低く、リアルタイム音声エージェントや全二重対話に適しています。
- 正確な音声編集既存の録音に対して、テキスト置換、ムード調整、ピッチと速度の変更、一時停止の挿入または削除をサポートし、編集されていない領域は変更されずに、複数の操作を一度に1つのコマンドで実行できます。
- 多言語対応24言語に対応し、MiniMax多言語評価において平均話者類似度83.9を達成、さらに19言語が個別のカテゴリーで1位を獲得している。
- 複数の推論速度ベース、SOAR、MeanFlow(4段階)、2段階sCM、1段階DMDなど、複数のチェックポイントが用意されており、ユーザーは必要に応じて音質と推論速度のどちらかを選択できます。
dots.ttsの技術的原理
- 完全連続自己回帰アーキテクチャdots.ttsのアプローチは、音声を離散的なトークンに量子化する従来の方法を放棄しています。生成チェーン全体が連続的な潜在空間で実行されます。モデルは音響セグメントをブロックごとに自己回帰的に予測し、BigVGANスタイルのデコーダーを通して48kHzの波形に復元します。これにより、離散的な量子化によって引き起こされる情報ボトルネックや音色のディテールの損失を根本的に回避します。
- 意味的連続表現このモデルは、HoliTok に基づく AudioVAE を使用して、元の波形を 25 FPS の連続潜在変数に圧縮します。エンコーダは、意味学習によって再構成の忠実度と潜在空間の構造化のバランスを取り、再構成された話者の類似度が 0.969 に達するようにします。これにより、豊かな音色と音響の詳細が保持され、後続の自己回帰生成に利用されます。
- エラー制御機構連続的な自己回帰において、前のステップでの小さなずれが蓄積・拡散するという固有の問題に対処するため、dots.ttsは因果的意味エンコーダを導入し、生成されたVAEパッチをリアルタイムでコンパクトな意味履歴に圧縮して、大規模な言語モデルにフィードバックします。高分散の局所的な音響的変動を取り除き、長距離の意味的要約のみを保持することで、長いシーケンスの生成におけるエラー伝播、ハウリング、音色のずれを効果的に抑制します。
- 生成プロセス生成プロセスは、Qwen2.5-1.5B に基づいて初期化された大規模言語モデルを中心としており、BPE テキストトークンを直接消費し、各ステップで隠れ状態を出力します。次に、自己回帰ストリームマッチングヘッド (18 層 DiT) が、LLM 隠れ状態と自己回帰プレフィックスの条件の下で次の音響パッチに対してノイズ除去生成を実行し、同時に、凍結された CAM++ スピーカーエンコーダによって提供されるグローバル x-vector を使用して音色の一貫性を確保します。
- トレーニング後の加速研究チームは、SOAR自己修正アライメントを使用して、トレーニング中に実際の推論における偏差をシミュレートし、モデルに報酬を与えることなく自己修正を学習して安定性を向上させるようにしました。また、MeanFlow蒸留を使用して教師のマルチステップ軌跡を平均速度に圧縮し、4ステップで高品質の生成を実現しました。さらに、簡略化された一貫性モデル(sCM)を使用して2ステップに圧縮し、報酬を考慮した分布マッチング蒸留(DMD)とデュアルタイムスケール更新戦略を組み合わせて、自然で明確な高品質のシングルステップモデルを取得しました。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
dots.tts の使い方
-
インストール:埋め込む
pip install dots.tts直接インストールすることも、GitHubからソースコードをクローンしてインストールすることもできます。pip install -e .ローカル開発およびインストールにおいては、SGLang Omniを高並行処理シナリオに追加導入することで、CUDAグラフの高速化と連続バッチ処理のサポートを実現できます。 -
コマンドライン合成:使用
dots.tts入力と指定--model-name-or-path、--textそしてターゲット--prompt-audioそして--prompt-textこれにより、ゼロサンプル音色クローニングが可能になります。省略--prompt-textそして、xベクトルクローンへと退化し、…を省略する。--prompt-audio次に、ランダムな音色サンプリングが行われます。 -
コマンドライン編集:使用
dots.tts.edit入口、--source-audioおよびXMLスタイル--instructionこれにより、既存の録音をテキストの置き換え、雰囲気やリズムの変更など、正確に編集することが可能になります。 -
Python API の基本呼び出し:合格
DotsTtsRuntime.from_pretrained()モデルを読み込んだ後に呼び出しますgenerate()テキストとオプションの参照音声を渡すことで、合成音声テンソルを取得し、ファイルとして保存できます。 -
Python API ストリーミング出力: 電話
generate_stream()オーディオテンソルはブロックごとに取得され、プレーヤーまたはWebSocketにリアルタイムで送信されるため、生成と再生を同時に行う低遅延の体験を実現できます。 -
Python API 2ストリーム対話:使用
DotsTtsRuntimeDoubleStreamingセッションが開始されると、テキストはトークン単位で送信され、音声側は直ちに音声の生成を開始します。最初の音声パケットの遅延は54.4ミリ秒と短く、リアルタイム音声エージェントに適しています。 -
微調整:走る
accelerate launch scripts/train_dots_tts.pyユーザーは独自のデータパスを設定することで、公開されているチェックポイントに基づいて、音色やドメイン適応に関する微調整を行うことができます。 -
蒸留加速:合格
scripts/train_dots_tts_meanflow.pySOARチェックポイントを使用して教師のMeanFlow蒸留を行うことで、さまざまなレイテンシと同時実行要件に対応するために、4ステップ、2ステップ、または1ステップのプロセスで高品質の学生モデルを生成できます。 -
ウェブインターフェース:走る
python apps/gradio/app.pyビジュアルコンポジションインターフェイスを起動するか、実行します...apps/edit_playground/app.pyEdit Playgroundを起動し、ブラウザで音声ファイルをアップロードし、編集領域を指定すると、結果をリアルタイムでプレビューできます。
dots.tts の主な利点
- 完全に連続した隠れた空間のモデリング離散的な音響トークンを放棄し、連続的な潜在空間で自己回帰的に直接生成することで、スペクトルテクスチャや息遣いなどの豊かな音色の詳細を保持し、話者類似度を0.969という高い値で再構築します。
- 最先端の合成品質Seed-TTS-Evalベンチマークの両方で最先端(SOTA)のコンテンツ精度と音色の類似性を達成し、24言語のMiniMaxテストで平均SIM値83.9を達成するなど、その総合的なパフォーマンスは主流のソリューションを凌駕しています。
- ネイティブストリーミング低遅延1T1Aデュアルストリームモードのオーディオファーストパケットは最短54.4ミリ秒で、SGLang OmniシングルカードH100を使用すると、同時16チャンネルのスループットは4.76 req/sに達し、リアルタイム音声エージェントのニーズを満たします。
- 統合編集機能同じプラットフォームをベースとするdots.tts.editは、XML構造の命令を使用してテキスト、ムード、リズム、ポーズを正確に編集することをサポートし、doteBenchベンチマークにおいて他のオープンソースシステムよりも優れた性能を発揮します。
dots.tts のプロジェクトアドレス
- GitHubリポジトリ:https://github.com/studio-dots-ai/dots.tts
- arXivの技術論文:https://arxiv.org/pdf/2608.02673
dots.ttsと類似競合製品との比較
| 比較対象寸法 | dots.tts | CosyVoice 3 |
|---|---|---|
| テクニカルルート | 完全連続型の潜在空間自己回帰モデルであり、離散的なトークンは存在しない。 | 音響トークンを利用した、離散的かつ連続的なハイブリッド表現 |
| パラメータ | 2B | 1.5B |
| シードTTS評価平均WER/CER | 2.95% | 3.06% |
| シードTTS評価平均SIM | 79.2 | 75.3 |
| 多言語評価 | MiniMax 24言語平均SIM 83.919言語で初公開 | 24言語の結果は公表されず、中国語と英語に重点が置かれた。 |
| リアルタイムのインタラクション | ネイティブストリーミング + 1T1A デュアルストリーム、最初のパケットは最低 54.4ms | 並列生成、限定的なレイテンシー最適化 |
| 推論の高速化 | MeanFlow 4ステップ / sCM 2ステップ / DMD シングルステップ | 標準的な複数ステップ生成 |
| オープンソースの範囲 | Apache 2.0のオープンソースコードには、6つのチェックポイントと、完全なトレーニング/微調整/蒸留コードが含まれています。 | モデルと推論コードはオープンソースです。 |
dots.ttsの応用事例
- リアルタイム音声エージェント1T1Aデュアルストリームモードは、最初のパケットの遅延が54.4ミリ秒と非常に短いため、LLM(低遅延モード)を利用したリアルタイムの全二重通信や音声アシスタントに適しています。
- ゼロサンプル音色クローニングわずか数秒の基準音声だけであらゆる音色を再現でき、多言語クローンにも対応しており、オーディオブック、ナレーション、パーソナライズされたコンテンツ制作に適しています。
- 多言語コンテンツ生成24言語に対応し、高い話者類似性を維持することで、グローバル製品に適した多言語音声放送およびローカライズサービスを提供します。
- 正確な音声編集Dots.tts.editを使用すると、既存の録音のテキストを置き換えたり、雰囲気やリズムを調整したり、ポーズを変更したりできます。ポッドキャストのポストプロダクションやオーディオコンテンツの編集に適しています。
- 生中継とリアルタイム報道LLMストリーミング出力と併用することで、同時生成と同時再生が可能となり、ニュース放送、ライブeコマース、リアルタイム情報放送などのシナリオに適しています。