project
VideoChatは、オープンソースのリアルタイムデジタル人間対話システムで、最初のパケットの遅延はわずか3秒です。
VideoChatは、音声入力とリアルタイム会話をサポートするオープンソースのリアルタイムデジタルヒューマン対話システムです。ユーザーはデジタルヒューマンの外見と声をカスタマイズでき、トレーニングなしで音声クローンも可能です。最初のパケットの遅延は3秒と短く、以下のような用途に適しています。
ビデオチャットとは何ですか?
VideoChatは、音声入力とリアルタイム会話をサポートするオープンソースのリアルタイムデジタルヒューマン対話システムです。ユーザーはデジタルヒューマンの外見と声をカスタマイズでき、トレーニングなしで音声クローンを作成できます。最初のパケットの遅延はわずか3秒で、ライブストリーミング、ニュース放送、チャットアシスタントなど、さまざまなリアルタイム音声対話シナリオに適しています。このシステムはGLM-4音声をサポートし、ASR-LLM-TTS-THGとMLLM-THGの2つの生成方式を提供します。VideoChatはGradoフレームワークを使用してインタラクティブなアプリケーションを構築し、ストリーミングビデオ出力をサポートし、迅速な展開と開発を容易にします。
ビデオチャットの主な機能
- リアルタイム音声対話音声を使って、ユーザーがデジタルヒューマンとリアルタイムで会話することを可能にする。
- 外観とトーンをカスタマイズするユーザーは、デジタルヒューマンの外見や声を選択またはデザインすることで、パーソナライズされたインタラクションを実現できます。
- 音声入力とテキスト出力このシステムは、ユーザーの音声入力をテキストに変換し、大規模な言語モデルに基づいて応答テキストを生成します。
- 口の動きが同期するデジタルヒューマンが話すとき、唇の動きは発する音と同期しており、リアリティを高めている。
- ストリーミングビデオ出力Gradoフレームワークをベースにしており、ストリーミングビデオ出力に対応しているため、よりスムーズな操作が可能です。
ビデオチャットの技術的原則
- 自動音声認識(ASR)FunASRのようなツールを使用して、ユーザーの音声入力をテキストに変換します。
- 大規模言語モデル(LLM)同義千問などのモデルに基づいて、入力テキストに応じて対応する応答テキストが生成されます。
- テキスト読み上げ(TTS)GPT-SoVITSなどのツールを使用して、テキスト返信を音声に変換する。
- スピーカー生成(THG)MuseTalkなどのソリューションを使用して、音声に基づいて口パクのデジタルヒューマン動画を生成します。
- ストリーミング出力並列パイプライン並列処理技術に基づき、推論と再生を同時に実行することで、応答速度を向上させています。
- グラデーションフレームワークGrado 5を使用すれば、ストリーミングビデオ出力が可能になり、インタラクティブなアプリケーションの展開と構築が容易になります。
VideoChatのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/Henry-23/VideoChat
- オンラインでデモを体験してください:https://www.modelscope.cn/studios/AI-ModelScope/video_chat
ビデオチャットの応用シナリオ
- 顧客サービス仮想カスタマーサービスプロバイダーとして、24時間365日の相談サービスを提供し、ユーザーからの質問に答え、企業の人件費を削減します。
- オンライン教育仮想教師として、語学学習やコース説明などのサービスを提供し、学習のインタラクティブ性と楽しさを高めます。
- ニュース放送ニュース業界では、デジタル人間という形でニュースを放送するために利用でき、ニュース放送の効率性と魅力を向上させることができる。
- ライブストリーミング業界バーチャルアンカーとして、商品を紹介したり、ライブ配信を通じて商品を販売したり、ライブ配信のインタラクティブ性を高めたり、視聴者の視聴体験を向上させたりすることができます。
- エンターテイメントと交流ゲームやバーチャルコンサートといったエンターテインメント分野では、より豊かでインタラクティブな体験を提供する。