AB
AiBoss
project

TANGOFLUX - NVIDIAがシンガポール工科デザイン大学と共同で開発した、オープンソースのテキスト音声生成モデル。

TANGOFLUXは、シンガポール工科デザイン大学(SUTD)とNVIDIAが共同開発した高効率なテキスト音声生成モデルです。このモデルは約5億1500万個のパラメータを持ち、単一のA40 GPUでわずか3.7秒で最大30秒の音声ファイルを生成できます。

TANGOFLUXとは何ですか?

TANGOFLUXは、シンガポール工科デザイン大学(SUTD)とNVIDIAが共同開発した高性能テキスト音声生成モデルです。約5億1500万個のパラメータを持つこのモデルは、単一のA40 GPU上でわずか3.7秒で30秒間の44.1kHz音声を生成できます。TANGOFLUXは、CLAPランク選好最適化(CRPO)フレームワークを採用し、選好データを反復的に生成・最適化することで、モデルの音声アライメント機能を向上させています。このモデルは、客観的および主観的なベンチマークテストの両方で優れた性能を発揮し、ソースコードとモデルはGitHubなどのプラットフォームでオープンソースとして公開されており、さらなる研究を支援しています。

TANGOFLUXの主な機能

  • 高効率オーディオ生成TANGOFLUXは、高品質なオーディオコンテンツを迅速に生成でき、44.1kHzのオーディオを最大30秒間、わずか3.7秒で生成できます。
  • テキストから音声への変換このモデルは、テキストによる説明を対応する音声出力に直接変換し、テキストから音声への直接変換を実現します。
  • 嗜好の最適化TANGOFLUXは、ユーザーの好みや入力テキストの意図により合致するように音声出力を最適化します。
  • 非独占データを用いたトレーニング非独占的なデータセットで学習を行うことで、モデルのオープン性とアクセス性が向上します。

TANGOFLUXの技術原理

  • 変分オートエンコーダー音声波形はVAEを用いて潜在表現に符号化され、その潜在表現から元の音声が再構築される。
  • テキストと再生時間の埋め込みこのモデルは、テキストエンコーディングと期間エンコーディングを使用して生成される音声の内容と期間を制御することで、制御可能な音声生成を実現します。
  • フラックストランスフォーマーアーキテクチャFluxTransformerブロックをベースに構築されており、Diffusion Transformer(DiT)とMultimodal Diffusion Transformer(MMDiT)を組み合わせて、テキストプロンプトを処理し、音声を生成します。
  • フローマッチング(FM)フローマッチングフレームワークに基づいて、単純な事前分布から複雑な目標分布へのマッピングを学習し、サンプルを生成する。
  • CLAP-Ranked Preference Optimization (CRPO)CRPOフレームワークは、選好データペアを繰り返し生成することで音声アライメントを最適化します。CLAPモデルを代理報酬モデルとして使用し、テキストと音声の結合埋め込みに基づいて音声出力の品質を評価し、それに応じて選好最適化のための選好データセットを構築します。
  • 直接選好最適化TANGOFLUXは、ストリームマッチングにDPOを適用し、一致する音声サンプルと一致しない音声サンプルを比較することで、モデルを最適化し、音声とテキストによる説明の整合性を向上させます。

TANGOFLUXプロジェクトの住所

TANGOFLUXの応用事例

  • マルチメディアコンテンツ制作映画、ゲーム、広告、ビデオ制作において、BGM、効果音、ナレーションの生成に使用され、制作効率の向上とコスト削減に貢献する。
  • オーディオ制作とデザイン音楽プロデューサーやサウンドデザイナーは、新しい楽曲を制作したり、特定の効果音をデザインしたりする。
  • ポッドキャストとオーディオブックポッドキャストやオーディオブックのBGMや効果音を自動生成し、リスナーの聴覚体験を向上させます。
  • 教育と訓練教育分野では、言語学習や専門スキルの訓練を支援するために、現実の状況をシミュレートした音声録音を作成することができる。
  • バーチャルアシスタントとチャットボットこれにより、仮想アシスタントやチャットボットに対して、より自然で豊かな音声応答を提供し、ユーザーとのインタラクション体験を向上させます。