AB
AiBoss
project

Qwen-AgentWorld - Tongyi Qianwen氏が発表したネイティブ言語の世界モデル

Qwen-AgentWorldは、同義千文チームが発表した初の言語世界モデルです。MCP、検索、端末、ソフトウェアエンジニアリング、Android、Web、オペレーティングシステムなど、7つのインテリジェントエージェント環境を、長い思考連鎖推論を通してシミュレートします。

Qwen-AgentWorldとは何ですか?

Qwen-AgentWorldは、同義千文チームが発表した初の言語世界モデルです。MCP、検索、端末、ソフトウェアエンジニアリング、Android、Web、オペレーティングシステムという7つのインテリジェントエージェント環境を、長い思考連鎖推論を通してシミュレートします。このモデルは、1,000万件を超える実世界のインタラクション軌跡に基づいており、3段階のトレーニング(CPT→SFT→RL)を経て構築されています。環境シミュレーションとインテリジェントエージェントトレーニングにおける優れた性能を検証するために、AgentWorldBenchベンチマークが公開されています。

Qwen-AgentWorldの主な機能

  • 7領域統合環境シミュレーションこれは、MCPツール呼び出し、検索エンジン、Linuxターミナル、ソフトウェアエンジニアリング(SWE)、Android GUI、Webブラウザ、オペレーティングシステムという7つの主要な対話型環境を対象としており、状態遷移を表すために統一されたテキスト形式を使用しています。
  • 思考連鎖状態予測現在の状態とエージェントの行動を入力すると、モデルは長いCoT推論を通じて、次の画面UI、端末出力、エラーメッセージなど、正確な環境フィードバックを予測します。
  • 操作可能な戦闘シミュレーション「検索結果の一部を非表示にする」や「ディスク容量不足エラーをシミュレートする」といった特定のシミュレーションコマンドを挿入することで、実際の環境ではまれなエッジケースを体系的に生成できます。
  • 4. エージェント強化学習トレーニングこれは、分離型環境シミュレーターとして機能し、Sim Agentic RLをサポートし、4000以上の実際のOpenClaw環境でスケーラブルなラウンドベースのトレーニングを可能にします。
  • 統合エージェント基本モデル世界モデルのトレーニングは、エージェントのトレーニングのための「ウォーミングアップ」として機能し、「内省」に似た先見的な思考モードを内面化することで、下流タスクのパフォーマンスを向上させることができる。

Qwen-AgentWorldの技術原則

  • 統一軌道モード7つの異種環境の状態表現を統一して (system_prompt, action, observation) シーケンスsystem_promptは、タスクの説明、アクション空間、初期状態、デモンストレーション例、シミュレーション手順の5つの部分から構成されます。
  • 3段階のトレーニングパイプライン
    • CPT(継続的事前研修)状態遷移のダイナミクスを組み込み、専門的なコーパスを強化することで、汎用的な世界モデリング能力を確立する。
    • SFT(教師ありファインチューニング)「次の状態を予測する」推論連鎖モードをアクティブにします。
    • RL(強化学習)シミュレーションの精度は、ルーブリックベースとルールベースのハイブリッド採点システムを用いることで向上する。
  • ハイブリッド報酬フレームワーク端末コマンドの実行やファイルシステムの変更など、検証可能な決定論的機能については、ルールベースの検証器が設計されており、オープン領域シミュレーションの品質を評価するために5次元のスコアリング基準が使用される。
  • 環境表現戦略テキストフィールドはテキスト出力を直接予測しますが、GUIフィールドは生のピクセルではなく、アクセシビリティツリーとUIビュー階層を使用して状態を表します。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

Qwen-AgentWorldの使い方

  • 環境シミュレーターとして(分離型)実際の環境を置き換えるモデルをデプロイし、API経由でデータを受信する。 (state, action) 戻る next_stateこれは、サンドボックスや仮想マシンを必要とせずに、大規模なラウンドベースの強化学習を行うために使用されます。
  • インテリジェントエージェントの基礎モデルとして(統合型)Qwen-AgentWorldは、インテリジェントエージェントの基盤として直接使用できます。内蔵されたワールドモデリング機能は、行動選択を支援し、Terminal-Bench、SWE-Bench、Claw-Evalなどのベンチマークですぐに使用できます。
  • モデル取得HuggingFace / ModelScope のウェイトをダウンロードします (Qwen-AgentWorld-35B-A3B 待って)

Qwen-AgentWorldの主な利点

  • 初のネイティブマルチドメイン言語ワールドモデルCPT段階から、環境モデリングは、一般的な大規模言語モデルを事後的に適応させるのではなく、明確な目標としてエンドツーエンドでトレーニングされる。
  • 主要な基準値を大幅に上回るAgentWorldBenchでは、バージョン397B-A17B(58.8ポイント)がClaude Opus 4.8(56.6)、GPT-5.4(58.2)、Gemini 3.1 Pro(54.6)、DeepSeek-V4-Pro(53.0)、Qwen3.6-Plus(50.8)を上回ります。
  • 拡張性と制御性 実際のインフラストラクチャを必要とせずにラウンドレベルで環境を拡張でき、敵対的サンプルを生成するための精密な摂動をサポートします。制御可能なシミュレーションによる強化学習は、実際の環境のみで訓練された強化学習を大幅に上回ります。
  • ドメイン横断的な一般化とウォームアップ移行LWMトレーニングはエージェントのウォームアップとして機能し、7つのベンチマーク(そのうち3つはトレーニングセットに全く含まれていない)に適用でき、エージェントタスクの強化学習の微調整なしで強力な汎化性能を示す。
  • プレーンテキストオーバーレイの視覚環境GUIドメインはアクセシビリティツリー/HTML/UI階層タグを使用して状態を表現し、視覚的なインタラクション環境はプレーンテキストによるワールドモデリングでカバーできます。

Qwen-AgentWorldプロジェクトのアドレス

  • プロジェクト公式サイト:https://qwen.ai/blog?id=qwen-agentworld
  • GitHubリポジトリ:https://github.com/QwenLM/Qwen-AgentWorld
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Qwen/qwen-agentworld
  • arXiv技術論文:https://arxiv.org/pdf/2606.24597

Qwen-AgentWorldと類似の競合製品との比較

寸法 Qwen-AgentWorld WebWorld
位置 7領域統合言語世界モデル(ネイティブLWM) 大規模Webエージェントトレーニングの世界モデル
環境報道 7つの主要ドメイン:MCP、検索、ターミナル、SWE、Web、Android、OS 単一ドメイン:Webブラウザ環境
国家代表 統合テキストモード:アクセシビリティツリーXML、HTML、UI階層マークアップ、シェル出力、コード実行結果 複数のフォーマット状態:アクセシビリティツリー、HTML、XML、Markdown、自然言語(5つのフォーマットは適応的に保持されます)
トレーニング方法 CPT → SFT → RL の3段階エンドツーエンドのネイティブトレーニング。1000万以上の実際の軌跡を使用。 2段階のコース:広範な事前トレーニング(Webの動態に関する基礎知識)+因果推論の活性化(明示的な状態遷移推論)
モデルサイズ 35B-A3B / 397B-A17B 14B / 32B
コンテキストウィンドウ 長いコンテキストをサポートします(正確な長さは指定されていませんが、複数のラウンドにわたる長い軌跡をカバーします)。 256K tokens
シミュレーションされた深度 長連鎖思考(CoT)推論は次の状態を予測し、制御された敵対的シミュレーションをサポートする。 30ステップ以上の連続したステップと一貫した状態追跡による複数ラウンドのシミュレーションをサポートします。
アクションスペース 各ドメイン固有のアクション形式(シェルコマンド、ツール呼び出し、UI操作など) 統一された Python スタイルの関数呼び出し (click(bid)fill(bid, text)goto(url) 待って)
評価基準 自作のAgentWorldBench(2170サンプル/7ドメイン/5次元スコアリング+ルール検証) WebArena、Mind2Web、およびその他のプラットフォームに基づいたWebエージェントのベンチマーク。
中核的な利点 ドメイン横断的な統合、7つのドメインからなるネイティブアーキテクチャ、制御可能な敵対的機能、シミュレーションエージェント型強化学習+統合基本モデルデュアルパラダイム ウェブドメインの特化、マルチフォーマット互換性、アクションスペースの標準化、256Kの長文コンテキスト。

Qwen-AgentWorldの応用シナリオ

  • インテリジェントエージェントのトレーニングインフラストラクチャAIエージェントに、低コストで拡張性と制御性に優れた仮想トレーニング環境を提供し、高価なサンドボックスや実際のAPI呼び出しに代わるものです。
  • エッジケースと敵対的テストエージェントの堅牢性をテストするために、ネットワークタイムアウト、権限拒否、リソース不足など、実際の環境でまれに発生するエラー状態を生成します。
  • ソフトウェアエンジニアリング支援コードの実行、テストのフィードバック、およびGit操作の結果をシミュレートすることで、開発者が自身の行動の結果を予測できるように支援します。
  • 自動UIテストAndroid/Web/デスクトップアプリケーションの操作をシミュレートし、クリック/入力後のページ状態の変化を予測し、自動テストスクリプトの生成に使用されます。
  • ツールの使用とMCPエコシステムMCPサーバーの応答と複数のツールチェーンのオーケストレーションをシミュレートすることで、開発者は実際のサービスをデプロイすることなく、複雑な呼び出しロジックをデバッグできます。