AB
AiBoss
project

Fish Speech - オープンソースの高効率テキスト音声合成(TTS)ツール

Fish Speechは、Fish Audioが開発したオープンソースのテキスト音声合成(TTS)ツールで、中国語、英語、日本語に対応しています。約15万時間分の多言語データで学習されており、人間とほぼ同等の音声合成結果を実現しています。

魚の言葉とは何ですか?

Fish Speechは、Fish Audioが開発したオープンソースのテキスト音声合成(TTS)ツールで、中国語、英語、日本語に対応しています。約15万時間分の多言語データで学習されており、人間とほぼ同等の音声合成を実現しています。現在はバージョン1.2にアップデートされています。主な特長としては、メモリ要件が低い(わずか4GB)、推論速度が速い、カスタマイズ性が高く柔軟性に富んでいるため、複雑な学習を必要とせずに音声を素早く複製できる点が挙げられます。また、Fish SpeechはVITS2やBert-VITS2など、様々な音声生成モデルに対応しており、インテリジェントアシスタント、自動顧客サービス、言語学習といった用途に適しています。

魚の話し方の特徴

  • 高効率なテキスト音声変換Fish Speechは、高度なアルゴリズムを用いて、入力テキストを自然で流暢な音声に素早く変換します。最適化された音響モデルと言語モデルにより、音声の自然さと正確性を確保し、様々な場面で高品質な音声出力を実現します。
  • 多言語対応Fish Speechは中国語、英語、日本語に対応しており、その多言語機能は言語の壁を克服し、様々な国や地域のユーザーにサービスを提供し、グローバルなアプリケーション展開を促進します。
  • 音声クローン機能ユーザーは、自分自身または他人の音声クリップを参考としてアップロードできます。Fish Speechは、ディープラーニング技術を用いてその音声の特徴を学習・模倣し、パーソナライズされた音声クローンを作成します。この機能は、パーソナライズされた音声アシスタント、オーディオブック制作など、幅広い分野で応用される可能性を秘めています。
  • ビデオメモリの要件が低い動作に必要なビデオメモリはわずか4GBなので、ハードウェアの要件が大幅に緩和され、高価なハードウェアに投資することなく、より多くのユーザーが自分のコンピューターでFish Speechを使用できるようになります。
  • 推論速度が速いFish Speechは推論プロセスを最適化し、待ち時間を短縮し、音声合成の効率を向上させます。ユーザーは短時間で必要な音声出力を得ることができ、全体的なユーザーエクスペリエンスが向上します。
  • 複数の音声生成モデルFish Speechは、VITS2、Bert-VITS2、GPT VITS、MQTTS、GPT Fast、GPT-SoVITSなど、さまざまなモデルをサポートしています。ユーザーはニーズに応じて適切なモデルを選択することで、最適な音声合成効果を得ることができます。
  • 使いやすいFish Speechはユーザーエクスペリエンスを重視して設計されており、インストールと設定プロセスを簡素化しています。ユーザーは高度な技術知識を必要とせず、ワンクリックですぐに使い始めることができるため、導入のハードルが大幅に下がります。
  • 微調整機能LoRaの微調整技術により、ユーザーはモデルを細かく調整して特定の話し方や表現に適応させることができ、より創造的な表現の幅が広がります。
  • パフォーマンス最適化Fish Speechは、勾配チェックポイント、因果サンプリング、フラッシュアテンションなどの高度な技術を採用することで、モデルのトレーニングと推論において大幅な性能向上を実現し、大規模データの処理における効率性と安定性を確保しています。

フィッシュスピーチ公式サイト

Fish Speechのインストール方法と使用方法

動作要件

  • GPUメモリ:4GB(推論用)、16GB(微調整用)
  • システム: Linux、Windows

Windowsの設定

Windows環境の専門家は、コードベースの実行にWSL2またはDockerの利用を検討できます。

非専門家のWindowsユーザー向けに、Linux環境を必要としない基本的な操作方法を以下に示します(モデルコンパイル機能など)。 torch.compile):

  1. プロジェクトアーカイブを解凍してください。
  2. 環境をインストールするには、install_env.bat をクリックしてください。
    • install_env.bat を編集できます。 USE_MIRROR ダウンロードにミラーサイトを使用するかどうかを選択するオプションが選択されています。
    • USE_MIRROR=false 最新の安定版は公式サイトからダウンロードしてください。 torch 環境。USE_MIRROR=true ミラーサイトから最新版をダウンロードするには torch 環境。デフォルトは... true
    • install_env.bat を編集できます。 INSTALL_TYPE このオプションは、ダウンロード時にコンパイル可能な環境を有効にするかどうかを決定します。
    • INSTALL_TYPE=preview コンパイル環境の開発版をダウンロードしてください。INSTALL_TYPE=stable コンパイル環境なしで安定版をダウンロードしてください。
  3. ステップ2のINSTALL_TYPEがpreviewの場合、このステップが実行されます(スキップすることも可能です。このステップはコンパイルモデル環境をアクティブ化するためのものです)。
    1. 以下のリンクからLLVMコンパイラをダウンロードしてください。
    2. 潜在的な.dllファイルの欠落問題を解決するには、Microsoft Visual C++再頒布可能パッケージをダウンロードしてインストールしてください。
    3. MSVC++コンパイラツールを入手し、LLVMヘッダーファイルの依存関係の問題を解決するには、Visual Studio Community Editionをダウンロードしてインストールしてください。
        • Visual Studio のダウンロード
        • Visual Studioインストーラーをインストールした後、Visual Studio Community 2022をダウンロードしてください。
        • 下の画像のようにクリックしてください。修改ボタン、見つける使用C++的桌面开发アイテムを選択し、ダウンロードボックスにチェックを入れてください。
  4. start.batをダブルクリックして、Fish-Speechのトレーニングおよび推論設定WebUIページにアクセスしてください。
    • (オプション)推論ページに直接移動したい場合は、プロジェクトのルートディレクトリを編集してください。 API_FLAGS.txt最初の3行を以下の形式に変更してください。
      --infer
      # --api
      # --listen ...
      ...
    • (オプション)APIサーバーを起動しますか?プロジェクトのルートディレクトリを編集してください。 API_FLAGS.txt最初の3行を以下の形式に変更してください。
      --infer
      # --api
      # --listen ...
      ...
  5. (オプション)ダブルクリック run_cmd.bat このプロジェクトのconda/pythonコマンドライン環境に入ります。

Linuxの設定

# 创建一个 python 3.10 虚拟环境, 你也可以用 virtualenv
conda create -n fish-speech python=3.10
conda activate fish-speech

# 安装 pytorch
pip3 install torch torchvision torchaudio

# 安装 fish-speech
pip3 install -e .

# (Ubuntu / Debian 用户) 安装 sox
apt install libsox-dev