project
LifeSim - 復旦大学と上海イノベーションアカデミーが立ち上げた、長期的なユーザーライフシミュレーションフレームワーク
LifeSimは、復旦大学と上海創新起研究所が共同開発した、パーソナライズされたAIアシスタントを評価するための初の長期ユーザーライフシミュレーションフレームワークです。このフレームワークはBDI認知モデルに基づいており、ユーザーの内的認知(信念、欲求、意図)もモデル化しています。
LifeSimとは何ですか?
LifeSimは、復旦大学と上海創新起研究所が共同開発した、パーソナライズされたAIアシスタントを評価するための初の長期ユーザーライフシミュレーションフレームワークです。BDI認知モデルに基づき、このフレームワークはユーザーの内的認知(信念、欲求、意図)と外的環境(時間、場所、天候)を同時にモデル化することで、一貫性のあるライフ軌跡と複数ターンにわたるインタラクションを生成します。LifeSimは、1200のシナリオと8つのライフドメインにわたるLifeSim-Evalベンチマークを通じて、明示的および暗黙的な意図を処理し、長期的な嗜好をモデル化するモデルの能力を評価し、既存の評価が現実世界のシナリオから乖離しているという問題に対処します。
LifeSimの主な機能
-
長距離ライフ軌跡シミュレーションこれは、実際の旅行データに基づいて、時間、場所、天候などの外部環境制約を考慮した、一貫性のある一連のユーザーライフイベントを生成します。
-
複数ターン相互作用挙動シミュレーションユーザーとAIアシスタント間の自然な会話をシミュレートし、記憶の競合検出、感情推論、動的な行動選択をサポートする。
-
個別能力評価LifeSim-Evalベンチマークモデルは、明示的および暗黙的な意図を特定し、長期的な嗜好を再構築および整合させる能力を評価する。
-
プライバシーとセキュリティに関するデータ統合これは、数百万もの多様なユーザープロファイルの生成をサポートし、パーソナライズされたアシスタントのトレーニングのための高品質な合成データを提供する。
LifeSimの技術原則
-
信念エンジン長期的なユーザープロファイルと短期的な状況認識(身体的/心理的/環境的状態)を統合する。
-
Wish Engine需要データベースから候補となる購買意欲を取得し、ユーザーの信念と外部環境に基づいてそれらを並べ替える。
-
イベントエンジンイベント発生の確率は、現実世界の出来事が現実世界の時空間的制約に適合するように、論理関数に基づいて制御されます。
-
ビヘイビアエンジンユーザーの反応は、記憶認識(過去の対立の検出)、感情推論(GoEmotionsによる分類)、および行動選択という3つの段階を経て生成されます。
LifeSimの使い方
- オンラインデモ体験:
- 公式ウェブサイトをご覧くださいビジュアルインターフェースには、http://fudan-disc.com/lifesim/ から直接アクセスできます。
-
プリセットデモシステムに組み込まれているユーザーを選択し、マップのタイムライン上の任意の時点をクリックして、その時点のシーンを表示し、シミュレーションされたユーザーと会話してください。
-
リアルタイム生成年齢、職業、性格特性などを入力してプロフィールをカスタマイズし、BDIエンジンによって生成されるリアルタイムのライフイベントを視聴したり、それらと交流したりできます。
- ローカル展開評価:
- 環境準備Pythonの依存関係をインストールし、ユーザープロファイルとライフイベントデータを準備します。
- モデル構成ユーザーシミュレーションモデル(Qwen3-32Bなど)とテスト対象のアシスタントモデルを接続します(ローカルvLLMまたはOpenAI/DeepSeekなどのAPIをサポート)。
- シミュレーションを実行する単一シーンモード(独立した対話)または長期モード(履歴記憶付きの複数ターンの対話)を選択した場合、システムは自動的に対話ログを生成します。
- 自動評価LLM-as-Judgeアルゴリズムは、意図認識、潜在的ニーズの充足、プロファイルの整合性など、7つの側面を自動的に評価するために使用されます。
LifeSimの重要な情報と使用要件
- 位置現実世界の動的なシナリオにおいて、パーソナライズされたAIアシスタントの能力を評価するために使用される、初の長期ユーザーライフシミュレーター。
- コアテクノロジーBDI認知モデル(信念・欲求・意図)に基づき、ユーザーの行動は、外部環境(時間/場所/天候)と内部認知状態(性格/好み/記憶)を統合することによって生成される。
- データスケール数百万件のユーザープロファイル、3,374件の実際の軌跡データ、および1,200件の評価シナリオ(8つの主要な生活領域を網羅)からなるデータベース。
- 評価の焦点明示的な意図(直接的なニーズ)と暗黙的な意図(ユーザープロファイルとコンテキストに基づく推論が必要)を区別し、長距離対話(最大16,000トークンの履歴コンテキスト)をサポートする。
- 所属復旦大学データサイエンス学部と上海イノベーションアカデミーが共同開発しました。
LifeSimの主な利点
- 現実世界のシナリオにおけるギャップを埋める既存の静的かつ短期的な評価の限界を打破し、数日から数週間にわたる長期的な生活軌跡シミュレーションを初めて実現することで、AIアシスタントの評価を「ジャービス」のような継続的なサービスシナリオに真に近づける。
- BDI認知アーキテクチャ深層モデリング単純なロールプレイングとは異なり、このシステムは信念・欲求・意図という心理モデルに基づいており、ユーザーがどのように「考える」(認知状態)かをシミュレートし、一貫性のある人格に基づいた合理的な行動連鎖を生成します。
- 明示的意図と暗黙的意図の二重テスト(天気、場所、過去の嗜好から推測する必要がある)暗黙の意図は、現在のLLMにおける長期的なユーザー理解において20ポイント以上のパフォーマンスギャップを露呈する。
- 物理的環境と認知的環境の統合このシステムは、実際の地理的な軌跡(3,374)、時間や天候などの物理的な制約、動的な心理的感情や記憶の忘却などの認知メカニズムを独自に組み合わせることで、現実的な合理性を持つ出来事を生成します。
LifeSimプロジェクトの住所
- GitHubリポジトリ:https://github.com/dfy37/lifesim
- arXiv技術論文:https://arxiv.org/pdf/2603.12152
- オンラインでデモを体験してください:http://fudan-disc.com/lifesim/
LifeSimの競合製品比較
| 比較対象寸法 | LifeSim | Generative Agents (Smallville) |
AgentBench |
|---|---|---|---|
| コアポジショニング | パーソナライズドAIアシスタントの長期能力評価ベンチマーク | 仮想ソーシャルサンドボックス行動観察プラットフォーム | LLMエージェントツールの呼び出し機能評価 |
| 時間次元 | 長期間にわたる連続的な情報(数日から数週間に及び、最大16,000トークンのコンテキスト情報を含む) | 連続時間(明確な上限なし) | 短時間タスク(1ラウンドまたは数ラウンド) |
| 環境モデリング | 実際の物理的環境(時間+天候+地理的軌跡)+認知状態 | 仮想2Dサンドボックス環境(ゲーム化されたインタラクション) | 仮想ツール環境(OS/ウェブページ/データベース) |
| ユーザーモデリング | BDI認知モデル(信念・願望・意図+ビッグファイブ性格特性+動的な感情) | 記憶の流れ+反映(出現する行動を観察する) | なし(エージェント自身の機能のみをテストする) |
| 評価の焦点 | 明示的および暗黙的な意図の認識、長期的な嗜好の整合、およびプロファイルの再構築 | 社会現象の出現と集団相互作用のパターン | ツールの精度と作業完了効率 |
| インタラクションモード | ユーザーとAIアシスタント間の敵対的対話(サードパーティ製モデルの評価も可能) | AIエージェント間の自由な相互作用(観察型) | 仮想環境と相互作用するAI(タスク指向型) |
| データスケール | 数百万件のユーザープロファイル、1,200種類の標準評価シナリオ | 25個のインテリジェントエージェント、限定された既成シナリオ | 8つの環境、数千のテストケース |
| 再現性 | 標準化されたシードシーン + 自動スコアリング(水平モデルベンチマークに対応) | 開放観察(結果は非常にランダムで再現が困難です) | 固定テストセット(複製可能) |
| 主な利点 | 現実のシナリオ、心理学的理論による裏付け、そして潜在的な意図を定量化する能力 | 群知能の出現、視覚的社会シミュレーション | 豊富なツールエコシステムと明確なタスク境界 |
| 主な制限事項 | 単一ユーザーとアシスタント間の二者間インタラクションに限定されています(マルチエージェント社会はまだサポートされていません)。 | 標準化された評価指標がないため、異なるモデルの長所を比較することが難しい。 | ユーザーの認知モデリングが欠けており、パーソナライズされた長期的なサービスも提供していない。 |
LifeSim アプリケーションシナリオ
- AIアシスタントの能力評価とベンチマークこれは、GPT-4o、Claude、DeepSeekなどのモデル向けに標準化された「長距離パーソナライズ」テスト環境を提供し、暗黙の意図理解、長期記憶保持、ユーザープロファイルの整合性といった分野におけるモデルの能力の限界を正確に特定します。
- 合成データ生成:数百万人のシミュレーションユーザーから生成された大規模で多様な長期対話データに基づいて、実際のユーザーデータの不足やプライバシーに関する懸念といった問題を解決し、パーソナライズされたアシスタントの微調整や強化学習のトレーニングに活用できる。
- インテリジェントな顧客サービスとコンパニオンAIの事前トレーニング仮想環境で極端なシナリオや稀なシナリオ(例えば、ユーザーが数日間連続して不安な状態で助けを求めるなど)をシミュレートすることで、顧客サービスシステムの感情的サポート能力と長期的な状況の一貫性をテストし、サービス開始後に実際のユーザーでテストを行うリスクを回避します。
- ヒューマンコンピュータインタラクション(HCI)に関する学術研究これは、認知科学や社会心理学において、さまざまな性格特性(ビッグファイブ性格特性など)がAIアシスタントに対するユーザーの受容度や信頼構築のプロセスにどのように影響するかを研究するための、制御可能な実験プラットフォームを提供する。
- パーソナライズされた推薦アルゴリズムの検証食事、フィットネス、子育てなど、生活の8つの主要分野において、レコメンデーションシステムがユーザーの長期的な好みやリアルタイムの状況(雨の日やフィットネス習慣など)に基づいて動的に調整できるかどうかを検証します。