AB
AiBoss
project

Game-TARS - ByteDanceが開発した汎用ゲームAIエージェント

Game-TARSは、ByteDanceのSeedチームが開発した汎用ゲームインテリジェンスエージェントです。統一されたキーボード・マウス操作空間トレーニングモデルに基づいており、オペレーティングシステム、ウェブページ、シミュレーション環境などで大規模に事前学習が可能です。5000億を超えるデータを活用し、

Game-TARSとは何ですか?

Game-TARSは、ByteDanceのSeedチームが開発した汎用ゲームエージェントです。統一されたキーボードとマウスの操作空間に基づいてトレーニングされており、オペレーティングシステム、Webページ、シミュレーション環境で大規模に事前学習が可能です。5,000億を超えるラベル付きマルチモーダルトレーニングデータポイントを活用し、スパース推論と減衰型パーシステンス損失を組み合わせることで、エージェントのスケーラビリティと汎化性能を大幅に向上させています。Game-TARSの核となるイノベーションは、キーボードとマウスを使って人間のように操作できるようにし、人間の操作をシミュレートすることでゲーム内のあらゆるアクションを完了させ、人間のユーザーの物理的な操作方法と直接的に一致させる点にあります。FPS、オープンワールド、Webゲームなどのタスクにおいて、GPT-5、Gemini-2.5-Pro、Claude-4-Sonnetを凌駕する性能を発揮します。

Game-TARSの主な機能

  • クロスプラットフォームゲーム運営Game-TARSは、統一されたキーボードとマウスの操作空間を通じて、異なるプラットフォーム(PC、Web、エミュレーション環境など)でのゲーム操作を可能にし、各プラットフォームごとに専用のスクリプトを作成する必要がないため、クロスプラットフォームの自動テストとゲームインタラクションを実現します。
  • マルチモーダルデータの事前学習ゲームの軌跡やグラフィカルユーザーインターフェースの操作など、さまざまなデータタイプを網羅する5000億件以上のラベル付きマルチモーダルデータを用いた事前学習に基づいて、このインテリジェントエージェントは高い汎化能力と適応性を備えており、さまざまな複雑なゲームタスクを処理することが可能です。
  • 効率的な推論と簡潔な思考この手法は、重要な意思決定ポイントでのみ深い推論を実行する疎な推論戦略を採用し、これを棄却微調整技術と組み合わせることで、推論プロセスを最適化し、推論効率と行動の操作性を向上させ、エージェントが複雑な環境においてより正確な意思決定を行えるようにします。
  • 長期記憶と短期記憶を組み合わせるこのシステムは二層構造のメモリ機構を採用しています。短期記憶には最新の画像情報が保存され、長期記憶には洗練された簡潔なテキスト情報が保持されます。これにより、エージェントは長期タスク中に重要な情報を記憶し続け、タスク完了率と対話型インテリジェンスが向上します。
  • ゼロサンプル転送機能大規模な事前学習の後、Game-TARSは未知の3Dウェブゲームにおいてゼロショット転移学習を実現し、追加の学習なしに新しい環境に迅速に適応してタスクを完了することができ、高い汎化能力を示す。
  • 指示遵守と行動の意味理解キーバインドをランダムに置き換えることで、インテリジェントエージェントの指示に従う能力が向上し、システムプロンプトに基づくアクションの意味を理解し、タスク指示を正確に実行し、さまざまなゲーム環境における適応性と操作精度を向上させることが可能になります。

Game-TARSの技術的原理

  • 統合行動空間人間の入力方法に合わせたネイティブのキーボード・マウス入力操作を採用しています。mouseMovemouseClickそしてkeyPressこれにより、インテリジェントエージェントの動作命令セットを特定のアプリケーションやオペレーティングシステムから切り離すことが可能になり、クロスプラットフォームの汎用性を実現できます。
  • マルチモーダルデータの事前学習事前学習は、ゲームの軌跡、グラフィカルユーザーインターフェースの操作、コード生成、科学研究タスクなど、さまざまなデータタイプを含む5000億を超えるラベル付きマルチモーダルデータに対して実行され、インテリジェントエージェントの汎化能力と適応性を向上させます。
  • スパース推論戦略スパース思考技術を用いることで、重要な意思決定ポイントにおいてのみ深層推論を実行し、拒否の微調整と組み合わせることで、推論プロセスを最適化し、推論効率と行動の操作性を向上させる。
  • ビジュアル言語モデルの統合視覚認識、戦略的推論、行動実行、長期記憶を単一の視覚言語モデル(VLM)に統合することで、ゲームごとに個別のコードやルールを作成する必要がなくなります。エージェントは操作を学習し、タスクを自律的に完了できます。
  • 継続的な事前トレーニングフレームワーク本研究では、すべてのデータソースを統合してモデルの大規模な事前学習を行う、統一された単段階連続事前学習手法を採用しています。同時に、事後学習段階では、特定のタスクにおけるエージェントの実行能力と対話型インテリジェンスをさらに強化します。
  • 長期記憶と短期記憶のメカニズムこのシステムは二層構造のメモリ機構を採用している。短期記憶には最新の画像情報が保存され、長期記憶には洗練された疎な思考テキストが保持される。これにより、エージェントは長期タスクにおける重要な情報を記憶しやすくなり、タスク完了率と対話型インテリジェンスが向上する。

Game-TARSプロジェクトのアドレス

  • プロジェクト公式サイト:https://seed-tars.com/game-tars/
  • arXiv技術論文:https://arxiv.org/pdf/2510.23691

Game-TARSの応用シナリオ

  • ゲームの自動テストGame-TARSは、FPS(ファーストパーソン・シューティング)ゲーム、オープンワールドゲーム、ウェブゲームなど、さまざまなゲームのテストを自動化するために使用でき、開発者がゲームの問題を迅速に特定し、テストの効率と品質を向上させるのに役立ちます。
  • クロスプラットフォーム互換性テストGame-TARSは統一されたアクション空間設計を採用しているため、PC、モバイル、ウェブなど様々なプラットフォームで適応テストを実施でき、複数のプラットフォーム間でのゲームの互換性と一貫性を確保できます。
  • 複雑なタスクの実行Game-TARSは、Minecraftでの建築や探索といった複雑なゲームタスクを処理できるだけでなく、未知の3Dウェブゲームにおいてもゼロサンプル転送を実現し、高い汎化能力を発揮する。
  • 異常事態への対処Game-TARSは、エラー回復メカニズムを備えており、障害事例から自己教師あり学習によって学習し、ゲーム内の異常なシナリオを処理し、エージェントの堅牢性を向上させることができます。
  • ゲーム開発支援Game-TARSはテスト機能に加え、ゲーム開発も支援できます。例えば、ゲーム設計段階でインタラクティブなプロトタイプテストを提供することで、開発者がゲームデザインとユーザーエクスペリエンスを最適化できるようサポートします。
  • 研究と教育Game-TARSはオープンソースであるため、研究や教育にとって貴重なリソースとなります。研究者は人工知能や機械学習などの分野の研究にそのフレームワークを活用でき、教育機関は学生の実践的なスキルを育成するための教材として利用できます。