project
Muse - マイクロソフトリサーチが開発した生成型AIモデル
Museは、マイクロソフト初のゲームアイデア生成のための生成型AIモデルであり、「ワールド・アンド・ヒューマン・アクション・モデル」(WHAM)に基づいています。Museは、人間のゲームプレイから学習することで、ゲームのビジュアルやコントローラーの動作を生成できます。
Museとは何ですか?
Museは、Microsoft初のゲームアイデア生成のための生成型AIモデルであり、World and Human Action Model(WHAM)に基づいています。Museは、人間のプレイヤーから学習したゲームデータ(画像や入力コマンドなど)に基づいて、リアルなゲームプレイシーケンスをシミュレートすることで、ゲームのビジュアルとコントローラーの動作を生成します。その主要な機能には、一貫性のあるゲームビジュアルの生成、多様なゲームパスの提示、生成されたコンテンツへのユーザーによる変更の統合などが含まれます。Museは、WHAM Demonstratorに基づいたインタラクティブなインターフェースを提供し、創造的な探求と反復作業をサポートします。Microsoftは、ゲームアイデア生成における研究とイノベーションを促進し、将来のAI主導型ゲーム開発を支援するために、Museの重みとサンプルデータをオープンソース化しました。
Museの主な機能
- 一貫性のあるゲームビジュアルとゲームプレイ体験を生み出す初期ゲーム画面とコントローラー操作に基づいて、実際のゲーム展開をシミュレートするために、数分間続く連続したゲームプレイシーケンスが生成されます。
- 多様なゲーム展開に対応同じ初期設定を与えても、さまざまなゲームプレイや視覚効果を生み出し、行動面と視覚面における豊かな多様性を示す。
- 永続的なユーザーによる変更ユーザーが行ったゲームビジュアルの変更(キャラクターの追加など)を生成コンテンツに統合し、その後のゲームプレイが適切に行われるようにする。
- クリエイティブな反復サポートWHAM Demonstratorのインターフェースをベースに、ユーザーは初期画面を読み込み、生成されたコンテンツを調整し、コントローラーを使用してキャラクターを操作することで、アイデアの迅速な反復を実現できます。
ミューズの技術的原則
- VQ-GANVQ-GANは、ゲーム画面などのゲームビジュアルを離散的な表現にエンコードするために使用されます。量子化に基づいて画像を離散的なトークンに変換することで、モデルが処理しやすくします。
- トランスフォーマーアーキテクチャモデルの中核となるネットワークは、次のラベルを予測するために使用されます。Transformerは、離散的な視覚的および操作的シーケンスを処理し、それらの間の複雑な関係を捉えることができます。
- 自己回帰生成このモデルは、与えられた初期キュー(ゲームの初期画面やコントローラーの操作など)に基づいて、視覚的および動作的なシーケンスを段階的に生成します。各ステップの出力は先行するコンテキストに依存するため、生成されるシーケンスは一貫性と整合性が保たれます。
- トレーニングデータMuseは、ゲーム『Bleeding Edge』のプレイヤー操作データとビジュアルデータを用いて学習されます。データには、プレイヤーのコントローラー入力とそれに対応するゲームビジュアルが含まれており、モデルはこのデータから学習して新しいゲームシーケンスを生成します。
ミューズのプロジェクトアドレス
- プロジェクト公式サイト:https://www.microsoft.com/en-us/research/blog/introducing-muse
- ハギングフェイスモデルライブラリ:https://huggingface.co/microsoft/wham
- 技術論文:https://www.nature.com/articles/s41586-025-08600-3
Museの応用事例
- ゲーム創造の探求開発者が新しいアイデアを検証するのに役立つ、ゲームプレイとレベルデザインを迅速に生成します。
- 自動ゲームテストゲームの脆弱性を検出し、ユーザーエクスペリエンスを最適化するために、多様なテストシーケンスを生成する。
- コンテンツ生成ゲームコンテンツを充実させるために、新しいレベル、マップ、またはキャラクターのアクションを自動的に生成します。
- プレイヤーの行動予測プレイヤーの行動をシミュレーションし、行動パターンを分析し、ゲームデザインを最適化する。
- AIを活用した体験ゲームのパーソナライズと没入感を高めるために、ダイナミックなストーリー展開とAI対戦相手を開発する。