AB
AiBoss
project

VideoChatは、オープンソースのリアルタイムデジタル人間対話システムで、最初のパケットの遅延はわずか3秒です。

VideoChatは、音声入力とリアルタイム会話をサポートするオープンソースのリアルタイムデジタルヒューマン対話システムです。ユーザーはデジタルヒューマンの外見と声をカスタマイズでき、トレーニングなしで音声クローンも可能です。最初のパケットの遅延は3秒と短く、以下のような用途に適しています。

ビデオチャットとは何ですか?

VideoChatは、音声入力とリアルタイム会話をサポートするオープンソースのリアルタイムデジタルヒューマン対話システムです。ユーザーはデジタルヒューマンの外見と声をカスタマイズでき、トレーニングなしで音声クローンを作成できます。最初のパケットの遅延はわずか3秒で、ライブストリーミング、ニュース放送、チャットアシスタントなど、さまざまなリアルタイム音声対話シナリオに適しています。このシステムはGLM-4音声をサポートし、ASR-LLM-TTS-THGとMLLM-THGの2つの生成方式を提供します。VideoChatはGradoフレームワークを使用してインタラクティブなアプリケーションを構築し、ストリーミングビデオ出力をサポートし、迅速な展開と開発を容易にします。

ビデオチャットの主な機能

  • リアルタイム音声対話音声を使って、ユーザーがデジタルヒューマンとリアルタイムで会話することを可能にする。
  • 外観とトーンをカスタマイズするユーザーは、デジタルヒューマンの外見や声を選択またはデザインすることで、パーソナライズされたインタラクションを実現できます。
  • 音声入力とテキスト出力このシステムは、ユーザーの音声入力をテキストに変換し、大規模な言語モデルに基づいて応答テキストを生成します。
  • 口の動きが同期するデジタルヒューマンが話すとき、唇の動きは発する音と同期しており、リアリティを高めている。
  • ストリーミングビデオ出力Gradoフレームワークをベースにしており、ストリーミングビデオ出力に対応しているため、よりスムーズな操作が可能です。

ビデオチャットの技術的原則

  • 自動音声認識(ASR)FunASRのようなツールを使用して、ユーザーの音声入力をテキストに変換します。
  • 大規模言語モデル(LLM)同義千問などのモデルに基づいて、入力テキストに応じて対応する応答テキストが生成されます。
  • テキスト読み上げ(TTS)GPT-SoVITSなどのツールを使用して、テキスト返信を音声に変換する。
  • スピーカー生成(THG)MuseTalkなどのソリューションを使用して、音声に基づいて口パクのデジタルヒューマン動画を生成します。
  • ストリーミング出力並列パイプライン並列処理技術に基づき、推論と再生を同時に実行することで、応答速度を向上させています。
  • グラデーションフレームワークGrado 5を使用すれば、ストリーミングビデオ出力が可能になり、インタラクティブなアプリケーションの展開と構築が容易になります。

VideoChatのプロジェクトアドレス

ビデオチャットの応用シナリオ

  • 顧客サービス仮想カスタマーサービスプロバイダーとして、24時間365日の相談サービスを提供し、ユーザーからの質問に答え、企業の人件費を削減します。
  • オンライン教育仮想教師として、語学学習やコース説明などのサービスを提供し、学習のインタラクティブ性と楽しさを高めます。
  • ニュース放送ニュース業界では、デジタル人間という形でニュースを放送するために利用でき、ニュース放送の効率性と魅力を向上させることができる。
  • ライブストリーミング業界バーチャルアンカーとして、商品を紹介したり、ライブ配信を通じて商品を販売したり、ライブ配信のインタラクティブ性を高めたり、視聴者の視聴体験を向上させたりすることができます。
  • エンターテイメントと交流ゲームやバーチャルコンサートといったエンターテインメント分野では、より豊かでインタラクティブな体験を提供する。