project
SOLAMI - 南洋理工大学が開発したVRベースの3DロールプレイングAIシステム
SOLAMIは、南洋理工大学の研究チームが開発した革新的なVRベースの3DロールプレイングAIシステムです。ソーシャルビジョン・言語・行動モデルに基づき、音声や身振り手振りを用いて仮想キャラクターと没入感のあるインタラクションを行うことができます。
SOLAMIとは何ですか?
SOLAMIは、南洋理工大学の研究チームが開発した革新的なVRベースの3DロールプレイングAIシステムです。音声と身振り手振りを用いて、仮想キャラクターと没入感のあるインタラクションを楽しむことができます。ソーシャルビジュアル・ランゲージ・ビヘイビアモデルに基づき、従来のテキストや音声によるやり取りを超越した、自然なコミュニケーション体験を提供します。エンドツーエンドのVLAモデルによって駆動されるSOLAMIは、ユーザーの身振り手振りを認識して反応することができ、ダンスやゲームなど、様々なキャラクターとのインタラクションをサポートします。SOLAMIは、AIロールプレイングゲームに新たなレベルの没入体験をもたらします。
SOLAMIの主な機能
- 没入型インタラクションユーザーは、音声や身振り手振りを使って、VR環境内の3D仮想キャラクターと自然にやり取りすることができる。
- マルチモーダルな対応このシステムは、ユーザーの音声入力と動作入力に基づいて、対応するキャラクターの音声と動作応答を生成することができます。
- 役割の多様性スーパーヒーロー、ロボット、アニメキャラクターなど、さまざまなキャラクターに対応しており、豊かなインタラクティブ体験を提供します。
- インタラクティブゲームじゃんけんのような、キャラクターを使った簡単なインタラクティブゲームをサポートします。
SOLAMIの技術原則
- 社会的視覚言語行動モデル(Social VLA)エンドツーエンドのVLAモデルを使用し、ユーザーの音声と動作の入力を処理して、キャラクターの反応を生成します。
- マルチモーダル入力処理モーション・トークナイザーとスピーチ・トークナイザーに基づいて、ユーザーの音声と動作は、モデルが理解できるトークンに変換されます。
- LLMベース大規模言語モデル(LLM)をベースとして、入力トークンを処理し、自己回帰的な方法でキャラクターの音声トークンと動作トークンを出力する。
- 動作表現ユーザーの動作はSMPL-Xでは3D回転で表現され、VQ-VAEを使用してエンコードされます。
- 音声処理ユーザーの音声はRVQ-VAE構造を用いてエンコードされ、SoundStormを用いてデコードされることで、音声の複製が実現される。
- トレーニングプロセスこれには、マルチタスク事前学習と指示の微調整学習が含まれており、モデルが動作、音声、テキスト間の関係を学習し、複数ターンのマルチモーダル対話を処理できるようになります。
SOLAMIのプロジェクト住所
- プロジェクト公式サイト:solami-ai.github.io
- arXiv技術論文:https://arxiv.org/pdf/2412.00174
SOLAMI アプリケーションシナリオ
- バーチャルソーシャルユーザーは仮想環境内でAIキャラクターと交流し、現実の会話や非言語コミュニケーションをシミュレートすることができる。
- インタラクティブゲームVRゲームでは、NPC(ノンプレイヤーキャラクター)がプレイヤーとより自然に交流できるため、ゲーム体験が向上します。
- 教育と訓練これは教師や生徒の役割をシミュレートし、言語学習や社会性訓練といった教育的なシナリオを提供する。
- 心理療法仮想現実空間でセラピストの役割をシミュレーションすることで、社会恐怖症に対する心理療法や曝露療法を行うユーザーを支援する。
- エンターテイメントとパフォーマンスユーザーはバーチャルな歌手、ダンサー、俳優と交流し、没入感のあるエンターテイメント体験を楽しむことができます。