AB
AiBoss
project

SOLAMI - 南洋理工大学が開発したVRベースの3DロールプレイングAIシステム

SOLAMIは、南洋理工大学の研究チームが開発した革新的なVRベースの3DロールプレイングAIシステムです。ソーシャルビジョン・言語・行動モデルに基づき、音声や身振り手振りを用いて仮想キャラクターと没入感のあるインタラクションを行うことができます。

SOLAMIとは何ですか?

SOLAMIは、南洋理工大学の研究チームが開発した革新的なVRベースの3DロールプレイングAIシステムです。音声と身振り手振りを用いて、仮想キャラクターと没入感のあるインタラクションを楽しむことができます。ソーシャルビジュアル・ランゲージ・ビヘイビアモデルに基づき、従来のテキストや音声によるやり取りを超越した、自然なコミュニケーション体験を提供します。エンドツーエンドのVLAモデルによって駆動されるSOLAMIは、ユーザーの身振り手振りを認識して反応することができ、ダンスやゲームなど、様々なキャラクターとのインタラクションをサポートします。SOLAMIは、AIロールプレイングゲームに新たなレベルの没入体験をもたらします。

SOLAMIの主な機能

  • 没入型インタラクションユーザーは、音声や身振り手振りを使って、VR環境内の3D仮想キャラクターと自然にやり取りすることができる。
  • マルチモーダルな対応このシステムは、ユーザーの音声入力と動作入力に基づいて、対応するキャラクターの音声と動作応答を生成することができます。
  • 役割の多様性スーパーヒーロー、ロボット、アニメキャラクターなど、さまざまなキャラクターに対応しており、豊かなインタラクティブ体験を提供します。
  • インタラクティブゲームじゃんけんのような、キャラクターを使った簡単なインタラクティブゲームをサポートします。

SOLAMIの技術原則

  • 社会的視覚言語行動モデル(Social VLA)エンドツーエンドのVLAモデルを使用し、ユーザーの音声と動作の入力を処理して、キャラクターの反応を生成します。
  • マルチモーダル入力処理モーション・トークナイザーとスピーチ・トークナイザーに基づいて、ユーザーの音声と動作は、モデルが理解できるトークンに変換されます。
  • LLMベース大規模言語モデル(LLM)をベースとして、入力トークンを処理し、自己回帰的な方法でキャラクターの音声トークンと動作トークンを出力する。
  • 動作表現ユーザーの動作はSMPL-Xでは3D回転で表現され、VQ-VAEを使用してエンコードされます。
  • 音声処理ユーザーの音声はRVQ-VAE構造を用いてエンコードされ、SoundStormを用いてデコードされることで、音声の複製が実現される。
  • トレーニングプロセスこれには、マルチタスク事前学習と指示の微調整学習が含まれており、モデルが動作、音声、テキスト間の関係を学習し、複数ターンのマルチモーダル対話を処理できるようになります。

SOLAMIのプロジェクト住所

SOLAMI アプリケーションシナリオ

  • バーチャルソーシャルユーザーは仮想環境内でAIキャラクターと交流し、現実の会話や非言語コミュニケーションをシミュレートすることができる。
  • インタラクティブゲームVRゲームでは、NPC(ノンプレイヤーキャラクター)がプレイヤーとより自然に交流できるため、ゲーム体験が向上します。
  • 教育と訓練これは教師や生徒の役割をシミュレートし、言語学習や社会性訓練といった教育的なシナリオを提供する。
  • 心理療法仮想現実空間でセラピストの役割をシミュレーションすることで、社会恐怖症に対する心理療法や曝露療法を行うユーザーを支援する。
  • エンターテイメントとパフォーマンスユーザーはバーチャルな歌手、ダンサー、俳優と交流し、没入感のあるエンターテイメント体験を楽しむことができます。