project
ChatTTS - 対話のためのオープンソースの生成型音声合成モデル。
ChatTTSは、会話シナリオに特化して設計されたテキスト音声合成(TTS)モデルで、中国語と英語の両方をサポートしています。約10万時間分の中国語と英語のデータで学習されており、高品質で自然かつ流暢な会話音声を生成できます。
ChatTTSとは何ですか?
ChatTTSは、会話シナリオに特化して設計されたテキスト音声合成(TTS)モデルで、中国語と英語の両方をサポートしています。約10万時間分の中国語と英語のデータで学習されており、高品質で自然かつ流暢な会話音声を生成します。会話タスクに最適化されたChatTTSは、より自然で流暢な音声合成を実現し、複数の話者をサポートし、笑い声や休止などの韻律的特徴を予測・制御するきめ細かな制御機能を備えており、ほとんどのオープンソースTTSモデルを凌駕しています。
ChatTTSの機能
- テキスト読み上げChatTTSは、ユーザーが入力したテキスト情報をリアルタイムで自然で流暢な音声出力に変換でき、多言語環境に適しています。
- 多言語対応ChatTTSは中国語に加えて英語のテキストにも対応しているため、より幅広いユーザー層にサービスを提供できます。
- 感情的およびリズム的な調整ChatTTSはテキストを変換するだけでなく、テキストの内容に応じて音声の感情的なトーンやリズム(話速、イントネーション、間など)を調整し、より自然な人間の話し声のリズムに近づけることができます。
- 音声キャラクター選択ユーザーは、アプリケーションのシナリオのニーズに応じて、複数のプリセット音声キャラクターの中から最適な音声を選択でき、音声のパーソナライズと表現力を高めることができます。
- インタラクティブなウェブインターフェース直感的なウェブインターフェースを通して、ユーザーはブラウザに直接テキストを入力し、コードを書くことなく音声出力を受け取ることができます。
- リアルタイム音声対話ChatTTSはリアルタイム音声合成をサポートしているため、即時のフィードバックを必要とする対話システムやインタラクティブなアプリケーションに最適です。
- 音声ファイルのエクスポートユーザーは合成音声を一般的な音声ファイル形式にエクスポートできるため、編集、共有、またはマルチメディアコンテンツの一部としての利用が容易になります。
- 統合と互換性ChatTTSは様々なプラットフォームやアプリケーションへの統合をサポートしており、Webアプリケーション、モバイルアプリケーション、デスクトップソフトウェアなど、複数の環境にシームレスに統合できます。
- 感情タグ付けシステムChatTTSはテキストに感情マーカーを埋め込むことをサポートしており、ユーザーはテキストに[laugh]マーカーを挿入して笑いをシミュレートするなど、音声出力の感情表現を細かく制御できます。
ChatTTS公式サイトへの入り口
- 公式GitHubソースコードリポジトリ:https://github.com/2noise/ChatTTS
- ハグフェイスモデルの住所:https://huggingface.co/2Noise/ChatTTS
- ModelScopeモデルアドレス:https://www.modelscope.cn/models/pzc163/chatTTS/summary
ChatTTSの実行方法
方法1:オンラインでデモを体験する
一般ユーザーは、ModelScopeとHugging Faceのコミュニティが提供するオンラインChatTTS WebUIデモを直接体験できます。
- ModelScope バージョン デモ:https://www.modelscope.cn/studios/AI-ModelScope/ChatTTS-demo/summary
- ハグ顔デモ:https://huggingface.co/spaces/Dzkaka/ChatTTS
方法2:現地展開と運用
- インストール環境お使いのコンピューターにPythonとGitがインストールされていることを確認してください。
- SDKのダウンロードModelScopeをインストールし、SDKモデルをダウンロードしてください。
#安装ModelScope pip install modelscope#SDK模型下载 from modelscope import snapshot_download model_dir = snapshot_download('pzc163/chatTTS') - ソースコードを取得するGitバージョン管理システムを使用して、ModelScopeのコードリポジトリからChatTTSのソースコードをローカルマシンにクローンします。
#Git模型下载 git clone https://www.modelscope.cn/pzc163/chatTTS.git - 依存関係をインストールしますプロジェクトディレクトリに移動し、pipコマンドを使用して必要なPython依存関係をインストールします。
pip install -r requirement.txt pip install Ipython pip install soundfile - モデル推論Modaコミュニティが提供する無料の計算能力を利用して、モデル推論を完了することができます。
from ChatTTS import Chat from IPython.display import Audio #下载模型 from modelscope import snapshot_download model_dir = snapshot_download('pzc163/chatTTS') chat = Chat() chat.load_models(source='local', local_path=model_dir) texts = ["你好,我是ChatTTS,很高兴认识大家",] wavs = chat.infer(texts, use_decoder=True) Audio(wavs[0], rate=24_000, autoplay=True) # save audio import soundfile as sf audio_data = wavs[0] if len(audio_data.shape) > 1: audio_data = audio_data.flatten() output_file = './output_audio2.wav' sf.write(output_file, audio_data, 24000) print(f"Audio saved to {output_file}") - WebUIを構築して実行する
git clone https://www.modelscope.cn/studios/AI-ModelScope/ChatTTS-demo.git cd ChatTTS pip install -r requirements.txt python app.py
ChatTTSの応用シナリオ
- バーチャルアシスタントとカスタマーサービスロボットChatTTSは、仮想アシスタントやオンラインカスタマーサービスロボット向けに、自然で流暢な音声出力を提供し、ユーザーエクスペリエンスを向上させます。
- オーディオブックと電子書籍テキストコンテンツを音声に変換し、オーディオブックや電子書籍に音声読み上げ機能を提供することで、通勤中や家事をしながらでも手軽に聞くことができるようになります。
- ソーシャルメディアとコンテンツ制作ChatTTSは、ソーシャルメディアプラットフォームやコンテンツ制作において、魅力的な音声コンテンツを生成し、インタラクティブ性と楽しさを向上させることができます。
- ニュースとポッドキャストプレスリリースやブログ記事を、ポッドキャストやニュース放送用の音声に自動的に変換します。
- アクセシビリティ視覚障害者や読字困難のあるユーザーに対し、音声による支援を提供することで、聴覚を通して情報を得られるようにする。