AB
AiBoss
project

OpenAudio S1 - Fish Audioの次世代音声生成モデル

OpenAudio S1は、Fish Audio社が開発したテキスト音声合成(TTS)モデルで、200万時間以上の音声データで学習されており、13言語に対応しています。デュアル自己回帰(Dual-AR)アーキテクチャを採用し、強化学習と人間のフィードバックを組み合わせています。

OpenAudio S1とは何ですか?

OpenAudio S1は、Fish Audio社が開発したテキスト音声合成(TTS)モデルで、200万時間以上の音声データで学習されており、13言語に対応しています。デュアル自己回帰(Dual-AR)アーキテクチャと人間からのフィードバックを用いた強化学習(RLHF)技術を採用することで、人間の声優演技とほとんど区別がつかないほど自然で流暢な音声を生成します。このモデルは50種類以上の感情表現とイントネーションマーカーをサポートしており、ユーザーは自然言語コマンドで音声表現を柔軟に調整できます。OpenAudio S1はゼロショットおよび少数ショットの音声クローンに対応しており、わずか10秒から30秒の音声サンプルで高忠実度のクローン音声を生成できます。

OpenAudio S1の主な機能

  • 非常に自然な音声出力200万時間以上の音声データを用いたトレーニングに基づいて生成された音声は、人間の声優の演技とほとんど区別がつかないほど自然であり、ビデオの吹き替え、ポッドキャスト、ゲームキャラクターの声優といったプロフェッショナルな用途に適しています。
  • 豊かな感情表現とトーンコントロール50種類以上の感情マーカー(怒り、喜び、悲しみなど)とトーンマーカー(速い声、低い声、叫び声など)をサポートしており、ユーザーは簡単なテキストコマンドで感情や声のトーンを制御できます。
  • 強力な多言語サポート英語、中国語、日本語、フランス語、ドイツ語を含む最大13言語に対応しており、その強力な多言語対応能力を示している。
  • 高効率音声クローニングゼロサンプルおよび少数サンプルでの音声クローンに対応しており、わずか10秒から30秒の音声サンプルで高忠実度のクローン音声を生成できます。
  • 柔軟な導入オプション2つのバージョンが利用可能です。40億個のパラメータを持つフルバージョンのS1と、5億個のパラメータを持つS1-miniです。後者はオープンソースモデルであり、研究および教育用途に適しています。
  • リアルタイムアプリケーションサポート超低遅延(100ミリ秒未満)は、オンラインゲームやライブストリーミングコンテンツなどのリアルタイムアプリケーションに最適です。

OpenAudio S1の技術原理

  • デュアルARアーキテクチャこの手法では、高速トランスフォーマーモジュールと低速トランスフォーマーモジュールを組み合わせることで、音声生成の安定性と効率を最適化します。高速モジュールが音声の初期特徴を迅速に生成し、低速モジュールがこれらの特徴を微調整することで、音声の自然さと流暢さを確保します。
  • グループ化有限スカラーベクトル量子化(GFSQ)技術計算コストを削減し、モデルの効率性を向上させると同時に、高忠実度の音声出力を確保するため、コード処理能力を改善する。
  • 強化学習と人間からのフィードバック(RLHF)オンラインRLHF技術により、このモデルは音声の音色やイントネーションをより正確に捉えることができ、より自然な感情表現を実現します。ユーザーは、(興奮)、(緊張)、(喜び)などの感情をタグ付けすることで、微妙な感情制御を行うことができます。
  • 大規模データトレーニング200万時間以上の音声データセットで学習されたこのモデルは、幅広い言語表現と感情表現を網羅しており、非常に自然で多様な音声を生成することができる。
  • 音声クローン技術ゼロサンプルおよび少数サンプルでの音声クローンに対応しており、わずか10秒から30秒の音声サンプルで高忠実度のクローン音声を生成できます。

OpenAudio S1プロジェクトのアドレス

OpenAudio S1の応用シナリオ

  • コンテンツ作成動画、ポッドキャスト、オーディオブック向けにプロ仕様のナレーションを提供し、制作効率を大幅に向上させます。
  • バーチャルアシスタント多言語対応でユーザーエクスペリエンスを向上させる、パーソナライズされた音声ナビゲーションシステムやカスタマーサービスシステムを開発する。
  • ゲームとエンターテイメントゲームキャラクターのリアルなセリフやナレーションを生成し、プレイヤーの没入感を高める。
  • 教育と訓練多言語学習コンテンツを作成するために使用され、学生がさまざまな言語の発音やイントネーションをよりよく理解し、学習するのに役立ちます。
  • カスタマーサービスとサポート顧客サービスロボットに適しており、迅速かつ正確な音声応答を提供することで、顧客サービスの効率と品質を向上させます。