AB
AiBoss
project

ChatTTS - 対話のためのオープンソースの生成型音声合成モデル。

ChatTTSは、会話シナリオに特化して設計されたテキスト音声合成(TTS)モデルで、中国語と英語の両方をサポートしています。約10万時間分の中国語と英語のデータで学習されており、高品質で自然かつ流暢な会話音声を生成できます。

ChatTTSとは何ですか?

ChatTTSは、会話シナリオに特化して設計されたテキスト音声合成(TTS)モデルで、中国語と英語の両方をサポートしています。約10万時間分の中国語と英語のデータで学習されており、高品質で自然かつ流暢な会話音声を生成します。会話タスクに最適化されたChatTTSは、より自然で流暢な音声合成を実現し、複数の話者をサポートし、笑い声や休止などの韻律的特徴を予測・制御するきめ細かな制御機能を備えており、ほとんどのオープンソースTTSモデルを凌駕しています。

ChatTTSの機能

  • テキスト読み上げChatTTSは、ユーザーが入力したテキスト情報をリアルタイムで自然で流暢な音声出力に変換でき、多言語環境に適しています。
  • 多言語対応ChatTTSは中国語に加えて英語のテキストにも対応しているため、より幅広いユーザー層にサービスを提供できます。
  • 感情的およびリズム的な調整ChatTTSはテキストを変換するだけでなく、テキストの内容に応じて音声の感情的なトーンやリズム(話速、イントネーション、間など)を調整し、より自然な人間の話し声のリズムに近づけることができます。
  • 音声キャラクター選択ユーザーは、アプリケーションのシナリオのニーズに応じて、複数のプリセット音声キャラクターの中から最適な音声を選択でき、音声のパーソナライズと表現力を高めることができます。
  • インタラクティブなウェブインターフェース直感的なウェブインターフェースを通して、ユーザーはブラウザに直接テキストを入力し、コードを書くことなく音声出力を受け取ることができます。
  • リアルタイム音声対話ChatTTSはリアルタイム音声合成をサポートしているため、即時のフィードバックを必要とする対話システムやインタラクティブなアプリケーションに最適です。
  • 音声ファイルのエクスポートユーザーは合成音声を一般的な音声ファイル形式にエクスポートできるため、編集、共有、またはマルチメディアコンテンツの一部としての利用が容易になります。
  • 統合と互換性ChatTTSは様々なプラットフォームやアプリケーションへの統合をサポートしており、Webアプリケーション、モバイルアプリケーション、デスクトップソフトウェアなど、複数の環境にシームレスに統合できます。
  • 感情タグ付けシステムChatTTSはテキストに感情マーカーを埋め込むことをサポートしており、ユーザーはテキストに[laugh]マーカーを挿入して笑いをシミュレートするなど、音声出力の感情表現を細かく制御できます。

ChatTTS公式サイトへの入り口

ChatTTSの実行方法

方法1:オンラインでデモを体験する

一般ユーザーは、ModelScopeとHugging Faceのコミュニティが提供するオンラインChatTTS WebUIデモを直接体験できます。

方法2:現地展開と運用

  1. インストール環境お使いのコンピューターにPythonとGitがインストールされていることを確認してください。
  2. SDKのダウンロードModelScopeをインストールし、SDKモデルをダウンロードしてください。
    #安装ModelScope
    pip install modelscope
    #SDK模型下载
    from modelscope import snapshot_download
    model_dir = snapshot_download('pzc163/chatTTS')
  3. ソースコードを取得するGitバージョン管理システムを使用して、ModelScopeのコードリポジトリからChatTTSのソースコードをローカルマシンにクローンします。
    #Git模型下载
    git clone https://www.modelscope.cn/pzc163/chatTTS.git
  4. 依存関係をインストールしますプロジェクトディレクトリに移動し、pipコマンドを使用して必要なPython依存関係をインストールします。
    pip install -r requirement.txt
    pip install Ipython
    pip install soundfile
    
  5. モデル推論Modaコミュニティが提供する無料の計算能力を利用して、モデル推論を完了することができます。
    from ChatTTS import Chat
    from IPython.display import Audio
    #下载模型
    from modelscope import snapshot_download
    
    model_dir = snapshot_download('pzc163/chatTTS')
    
    chat = Chat()
    chat.load_models(source='local', local_path=model_dir)
    
    texts = ["你好,我是ChatTTS,很高兴认识大家",]
    
    wavs = chat.infer(texts, use_decoder=True)
    Audio(wavs[0], rate=24_000, autoplay=True)
    
    # save audio
    import soundfile as sf
    audio_data = wavs[0]
    if len(audio_data.shape) > 1: 
     audio_data = audio_data.flatten()
    
    output_file = './output_audio2.wav'
    sf.write(output_file, audio_data, 24000)
    print(f"Audio saved to {output_file}")
  6. WebUIを構築して実行する
    git clone https://www.modelscope.cn/studios/AI-ModelScope/ChatTTS-demo.git
    cd ChatTTS
    pip install -r requirements.txt
    python app.py

ChatTTSの応用シナリオ

  • バーチャルアシスタントとカスタマーサービスロボットChatTTSは、仮想アシスタントやオンラインカスタマーサービスロボット向けに、自然で流暢な音声出力を提供し、ユーザーエクスペリエンスを向上させます。
  • オーディオブックと電子書籍テキストコンテンツを音声に変換し、オーディオブックや電子書籍に音声読み上げ機能を提供することで、通勤中や家事をしながらでも手軽に聞くことができるようになります。
  • ソーシャルメディアとコンテンツ制作ChatTTSは、ソーシャルメディアプラットフォームやコンテンツ制作において、魅力的な音声コンテンツを生成し、インタラクティブ性と楽しさを向上させることができます。
  • ニュースとポッドキャストプレスリリースやブログ記事を、ポッドキャストやニュース放送用の音声に自動的に変換します。
  • アクセシビリティ視覚障害者や読字困難のあるユーザーに対し、音声による支援を提供することで、聴覚を通して情報を得られるようにする。