project
WebWorld - アリババのQwenチームがオープンソース化した、大規模なウェブワールドモデルのシリーズ。
WebWorldは、アリババのQwenチームがオープンソース化した大規模なWebワールドモデルシリーズです。Qwen3プラットフォームでトレーニングされており、8B、14B、32Bバージョンがあります。このモデルは、シミュレートされたブラウザ環境内でWebページの状態を予測します。
WebWorldとは何ですか?
WebWorldは、アリババのQwenチームがオープンソース化した大規模なWebワールドモデルシリーズです。Qwen3プラットフォームでトレーニングされており、8B、14B、32Bバージョンがあります。シミュレーションされたブラウザ環境でWebページの遷移状態を予測することで、Webエージェント向けに高品質なトレーニングデータと推論環境を提供し、実際のWebページトレーニングに伴うネットワーク遅延、レート制限、セキュリティリスクを回避します。このモデルは、A11y Tree、HTML、XML、Markdown、自然言語など、複数の状態表現形式をサポートし、30ステップ以上の長期にわたる一貫したシミュレーションを実現でき、明示的な連鎖推論機能を備えています。
WebWorldの主な機能
-
ウェブページのステータス予測現在のページ状態(A11yツリー/HTML/XMLなど)とエージェントのアクションに基づいて、次の時点での完全なページ状態を予測し、実際のブラウザの動作をシミュレートします。
-
長期複数ラウンドシミュレーション30ステップ以上の連続的な対話型シミュレーションをサポートし、状態の一貫性を維持するため、複雑な複数ステップのWebページタスクに適しています。
-
マルチフォーマットによるステータス表現A11y Treeをネイティブにサポートしており、HTML、XML、Markdown、自然言語による説明も処理できるため、モデルの汎化能力が向上します。
-
推論能力が発動しました2段階のトレーニングプログラムを通して、まずウェブページからの大規模な動的知識が注入され、次に少量のCoTデータを使用して明示的な因果推論が活性化される。
-
ドメイン横断的な一般化コード環境、GUIデスクトップ、ゲーム環境において、優れた移植性を発揮します。
-
軌跡データ合成これはデータ合成器として使用でき、下流のエージェント向けに大規模で高品質なトレーニング軌跡を生成することで、実世界のタスクにおけるパフォーマンスを向上させることができる。
WebWorldの技術原則
- 回帰型ブラウザシミュレーターのモデリングWebWorldは、ブラウザ環境を自己回帰的なシーケンス生成タスクとして形式化し、因果言語モデルに基づいて条件付き確率分布を学習する。 与えられたタスク指示書では およびインタラクション履歴 実行される行動を予測する場合 次のページのステータス エンドツーエンドのトレーニングは、最尤推定法を用いて完全な軌跡データに対して実行されます。
- 3段階のデータ収集パイプライン閉鎖環境におけるデータボトルネックを克服するため、WebWorldは拡張可能な3層構造のデータ収集戦略を構築しました。第1層「ランダムクローリング」では、事前学習コーパスに対応するWebサイトに対してランダムな操作を実行し、広範データの43.3%を取得します。第2層「自律探索」では、LLMエージェントを展開してターゲットを生成し、Webサイトを探索することで、実際の長期軌跡の20.4%を生成します。第3層「タスク指向実行」では、シードタスクに基づいて多様なバリエーションを合成し、エージェントによって実行することで、高品質のタスク軌跡の16.1%を取得します。これら3層を組み合わせることで、106万件を超える実際のオープンWebページインタラクションデータが得られます。
- A11yツリーマスター状態表現とマルチフォーマット拡張本モデルは、Playwrightによって抽出されたA11y Treeを主要な状態表現として使用します。これは、WebページとGUI間での普遍性、高い情報密度、およびLLMに適した構造を備えているためです。同時に、後処理変換によって軌跡をHTML、XML、Markdownなどの複数の形式に拡張し、自然言語によるページ記述を導入し、モデルが単一の表現に過学習したり、壊滅的な忘却に陥ったりするのを防ぐために、5次元の指示ファインチューニングデータセットを構築します。
- 2層データフィルタリングと品質管理データクリーニングでは、ルールベースのヒューリスティックとLLMスコアリングを組み合わせた2段階のメカニズムを採用しています。まず、Webサイトのアクセシビリティを検証し、スクリプトを使用してセンシティブなキーワードをフィルタリングし、元のURLの15.7%のみを残します。次に、LLMがアクセシビリティ、コンテンツの適切性、インタラクティブ性、エンジニアリング品質の4つの側面でデータをスコアリングし、スコアの低いサイトを削除します。軌跡レベルでは、状態変化のない無効な遷移がさらに剪定され、30ラウンドまたは3万トークンを超える過度に長いサンプルは破棄されます。このプロセス全体を通して、モデル特有の帰納的バイアスは一切導入されません。
- 2段階のコーストレーニング戦略
- このトレーニングは、「まず知識を注入し、次に推論を活性化する」というカリキュラム設計に従っています。最初の段階では、106万の軌跡に対して大規模な動的モデリングを行い、モデルが幅広いウェブページの遷移パターンを習得できるようにします。2番目の段階では、微調整のために1,000個の合成CoTサンプルのみを使用し、モデルが予測を行う前にページ構造、ユーザーの意図、状態変化の明示的な分析を出力することを要求し、それによって暗黙的な推論能力を解釈可能な連鎖的な思考パターンとして外部化します。
- WebWorld-Bench多次元評価システム
- シミュレーションの品質を包括的に測定するために、チームは9つの評価項目を含む内部ベンチマークを構築しました。事実スコアはLLMを使用して、予測された状態がアクションの機能的な因果効果を正しく反映しているかどうかをポイントごとに判断します。Webチューリングスコアは、敵対的ペアワイズ比較を使用して、シミュレーションされた状態と実際のWebページとの区別不可能性をテストします。これら2つの指標を組み合わせることで、客観的な正確さと主観的なリアリズムの両面から、ワールドモデルの能力を定量化します。
WebWorldの使い方
- 環境準備リポジトリをクローンした後に実行してください
pip install -r requirements.txtそして、データパケットを解凍します。 - モデル読み込み中HuggingFace を介してモデルを読み込む (例)
Qwen/WebWorld-8B)、使用AutoModelForCausalLM協力するtrust_remote_code=True初期化。 - 単一ステップ予測システムプロンプト(Webワールドモデルとして宣言)とユーザーメッセージ(初期ページ状態+アクション)を含むダイアログを構築し、呼び出します。
model.generate次のページの状態を予測してください。 - 複数ラウンドのシミュレーション最初のラウンドでは初期状態と最初のアクションが提供され、以降のラウンドでは固定された継続プロンプトが使用されます。
CONTINUE_PROMPT過去の予測状態を履歴として保持し、生成を継続するための新しいアクションを入力し、30回以上のサイクルを繰り返すことができます。 - エージェントトレーニング私たちはWebWorldを用いて軌跡データを合成し、抽象化とインスタンス化の戦略を通して多様なタスク軌跡を生成します。これにより、ベースモデルを微調整して、下流のエージェントベンチマークのパフォーマンスを向上させることができます。
- ベンチマーク評価内部評価にはWebWorld-Benchを使用するか、MiniWob++やWebArenaなどの外部ベンチマークを使用してエージェントのトレーニング効果を検証してください。
WebWorldの主な利点
-
規模でリードトレーニングは、100万件を超える実際の公開ウェブページの軌跡に基づいており、データ量は従来の研究の100倍で、電子商取引、ソーシャルメディア、ニュースなど、多様な分野を網羅しています。
-
オープンソースモデルの重みとトレーニングデータ(WebWorldData)はどちらもApache 2.0ライセンスの下でオープンソースとして公開されており、完全かつ再現可能な技術ロードマップを提供しています。
-
総合評価システム私たちは、シミュレーションの品質を「事実性」と「Webチューリング」という2つの側面と9つの副側面から包括的に評価する独自の内部ベンチマーク「WebWorld-Bench」を開発しました。
-
優れたトレーニング効率強力な推論能力を活性化するには、わずか1000個のCoTサンプルで十分であり、推論活性化のための大規模動的事前学習の有効性が証明された。
-
エージェントのトレーニングにおける著しい成果Qwen3-8Bは、WebWorldの合成データを用いて微調整を行った結果、WebArenaで10.9%の改善を示し、バージョン14BはGPT-4oのレベルに近づいた。
WebWorldのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/QwenLM/WebWorld
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/Qwen/WebWorldData
- arXiv技術論文:https://arxiv.org/pdf/2602.14721
WebWorldの競合比較
| 比較対象寸法 | WebWorld | WebEvolver | UI-Simulator |
|---|---|---|---|
| 開発チーム | アリババ・クウェンチーム | Fang et al. | Wang et al. |
| テクニカルルート | 大規模公開ウェブページ事前トレーニング+2段階コース微調整 | 共進化(世界モデルとエージェントの交互に微調整を行う) | 検索機能強化シミュレーション(RAG + 独自ヒントLLM) |
| 環境範囲 | 実際の公開ウェブページ(数百万のドメイン名) | 閉鎖型ベンチマーク環境 | 閉鎖環境/管理された環境 |
| データスケール | 106万件以上のリアルタイム追跡データ | エージェントがデータを返すことに依存するため、拡張性に限界がある。 | 独自のトレーニングデータがない場合は、APIを呼び出してリアルタイムで生成します。 |
| モデルフォーム | オープンソース専用ワールドモデル(8B/14B/32B) | トレーニング専任ワールドモデル | ヒント:世界的なモデルとしての一般的なLLM |
| 長期シミュレーション | 30ステップ以上の連続シミュレーションをサポート | 限定 | 限定 |
| 明示的な推論 | CoTの活性化は状態遷移を説明できる。 | 明確な理由付けなし | 基本モデルに基づく暗黙的推論 |
| オープンソースの状況 | Apache 2.0 (モデル + データ) | オープンソースではない | オープンソースではない(独自のAPIに依存している) |
| 根本的な違い | オープンなウェブページに基づき、データ駆動型のスケーリング | 共進化閉ループ最適化、環境制約あり | 標的合成と回収機能を強化したが、コストはAPIによって制限される。 |
WebWorldアプリケーションシナリオ
-
ウェブエージェントのトレーニングと評価これは、自動化されたウェブページ操作エージェント向けに、低コストで高スループットのシミュレーション訓練環境を提供し、高価な実際のウェブページ操作に取って代わるものです。
-
データ拡張とデータ合成ラベル付きデータが不足しているウェブタスク向けに、教師あり微調整や強化学習のための大規模な合成軌跡を生成する。
-
推論中の計画と探索エージェントの実行中、エージェントは「世界モデル」として機能し、行動の先読みシミュレーションを実行して、最適な行動シーケンスの選択を支援します。
-
分野横断的な世界モデル研究その技術パラダイムは、GUIの自動化、コード環境のシミュレーション、ゲームの状態予測など、より幅広いデジタル世界のモデリングタスクに応用できる。
-
ブラウザの自動テストウェブページの機能テスト、互換性検証、ユーザーエクスペリエンスのプレビューのために、ユーザー操作の経路をシミュレートします。