AB
AiBoss
project

F5-TTS - 上海交通大学がオープンソースのテキスト音声合成(TTS)システムを発表

F5-TTSは、上海交通大学がオープンソース化した高性能テキスト音声合成(TTS)システムです。ストリームマッチングを用いた非自己回帰生成方式と、拡散トランスフォーマー(DiT)技術を組み合わせたシステムです。このシステムは…

F5-TTSとは何ですか?

F5-TTSは、上海交通大学がオープンソース化した高性能テキスト音声合成(TTS)システムです。ストリームマッチングに基づく非自己回帰生成手法と、拡散トランスフォーマー(DiT)技術を組み合わせています。ゼロショット学習により、追加の教師なしで、自然で流暢、かつ原文に忠実な音声を高速に生成します。F5-TTSは、中国語や英語を含む多言語合成に対応し、長文テキストからの音声合成も効果的に行えます。また、テキストの内容に基づいて合成音声の感情表現を調整する感情制御機能や、再生速度をユーザーが必要に応じて調整できる速度制御機能も備えています。10万時間もの膨大なデータセットで学習されたこのシステムは、優れた性能と汎化能力を実証しています。F5-TTSは、オーディオブック、音声アシスタント、語学学習、ニュース放送、ゲームのナレーションなど、幅広い用途に対応し、様々な商用・非商用用途に強力な音声合成機能を提供します。

F5-TTSの主な機能

  • ゼロサンプル音源クローニング特定の話し手のデータを用意することなく、誰の声でも模倣できる。
  • 速度制御音声生成速度は全体の再生時間に応じて調整されるため、音声再生速度を正確に制御できます。
  • 感情表現のコントロール合成音声の感情的なトーンを制御することで、機械生成音声はより人間の感情を表現できるようになる。
  • 長文合成長文の連続音声合成に対応しているため、長文コンテンツの読み上げや放送に適しています。
  • 多言語対応中国語や英語を含む複数の言語で音声を処理・生成でき、優れた多言語合成機能を備えている。
  • 大規模データトレーニングモデルの汎化能力と合成音声の自然さを確保するため、10万時間という膨大なデータセットを用いて学習を行った。

F5-TTSの技術原理

  • フローマッチングF5-TTSは、フローマッチングターゲットトレーニングモデルに基づいており、単純な確率分布(標準正規分布など)を、データ分布を近似するより複雑な確率分布に変換できます。これには、フローステップ全体とデータ範囲にわたってモデルをトレーニングし、初期分布からターゲット分布への変換がスムーズに行われるようにすることが含まれます。
  • 拡散変換器(DiT)モデルの基幹ネットワークとして、DiTはシーケンシャルデータを処理し、生成プロセス中にノイズを徐々に除去することで、明瞭な音声信号を生成することができます。
  • ConvNeXt V2F5-TTSはConvNeXt V2に基づいてテキスト表現を改善し、音声の特徴との整合性を高め、音声合成の品質と自然さを向上させます。
  • スウェイサンプリング戦略推論時に使用されるストリーミングステップサンプリング戦略は、特に音声生成の初期段階において、非均一サンプリングに基づいてモデルのパフォーマンスと効率を向上させ、モデルが対象音声の輪郭をより正確に捉えるのに役立ちます。
  • エンドツーエンドのシステム設計F5-TTSシステムの設計は、テキスト入力から音声出力までがシンプルで分かりやすく、音素のアライメントや持続時間の予測といった従来の複雑な設計を省略することで、モデルのトレーニングと推論プロセスを簡素化しています。

F5-TTSプロジェクトの住所

F5-TTSの応用シナリオ

  • オーディオブックとポッドキャスト視覚障害者やオーディオブックを好むユーザーのために、電子書籍や記事をオーディオブックに変換する。
  • 音声アシスタントとチャットボットスマートデバイスやオンラインサービス向けに、自然な音声フィードバックを提供し、ユーザーエクスペリエンスを向上させます。
  • 言語学習と教育これは学習者が発音とリスニングのスキルを練習するのに役立ち、言語学習のための補助ツールを提供する。
  • ニュースとメディアニュース報道の音声版を自動的に生成し、ラジオ局やオンラインニュースプラットフォーム向けにコンテンツの自動制作を提供する。
  • 顧客サービス顧客サービスシステムにおいて、自動音声応答を提供し、顧客体験を向上させるために使用されます。