project
AReaL 2.0 - Ant Financialおよびその他のオープンソース企業によって開発された、エージェント向けオンライン強化学習インフラストラクチャ。
AReaL 2.0は、Ant Financialが香港科技大学および清華大学と共同で開発した、オープンソースのエージェントベースのオンライン強化学習インフラストラクチャです。これにより、展開されたエージェントは現実世界の相互作用の軌跡に基づいて継続的に進化することができます。
AReaL 2.0とは何ですか?
AReaL 2.0は、Ant Financialが香港科技大学および清華大学と共同で開発した、エージェント向けのオープンソースのオンライン強化学習インフラストラクチャです。これにより、展開されたエージェントは、現実世界のインタラクション軌跡から継続的に進化することができます。AReaL 2.0は、軌跡データプロトコル、エンタープライズグレードのデータエージェント、および進化制御プレーンという3つの柱を通して、本番環境のセッションストリームを学習可能な経験に変換します。これにより、エージェントの書き換えやビジネスシステムの全面的な見直しが不要になります。PyTorch Foundationに追加され、Ascend NPUの適応をサポートしています。
AReaL 2.0の主な機能
- オンライン強化学習閉ループエージェントの実際のインタラクションの軌跡を自動的に学習可能な経験に変換し、実行から学習までのクローズドループを実現します。
- 軌跡データの収集ATDPプロトコルは、観察結果、行動、結果、メタデータなど、意思決定プロセス全体を段階的に記録します。
- エンタープライズレベルのデータガバナンスデータプロキシは、トレーニング前にコンプライアンス処理が完了することを保証するため、傍受、無感作化、アクセス制御、および軌跡の永続化を担当します。
- 進化制御プレーン軌道統計、故障クラスター、ユーザー修正率などの多次元信号に基づいて、モデル更新、メモリ書き込み、ツール調整などの修復開始点を決定します。
- マイクロサービスアーキテクチャトレーニング、推論、および重み更新のプロセスは、ゲートウェイ、ルーター、データプロキシなどの独立して展開可能なコンポーネントに分割されています。
AReaL 2.0の技術的原則
- Agent Trajectory Data Protocol (ATDP)学習指向のエージェント軌跡プロトコルは、複雑なタスクを追跡可能で再現可能な学習サンプルに分解します。エージェントの観測結果、内部状態、行動選択、行動結果、報酬フィードバック、およびモデルバージョン、ツールバージョン、テナント、コストなどのメタデータを段階的に記録し、「どの検索またはツール呼び出しがタスクの成功または失敗に影響を与えたか」といった重要な質問に答えます。
- Agentic Data Proxyこれは、モデル、ツール、検索システム、人間からのフィードバックチャネルといった主要な境界に配置される学習データ層です。傍受、収集、匿名化、アクセス制御、軌跡の永続化、報酬の収集、リプレイ管理を担当します。データガバナンスは、トレーニングキューに入る前に完了し、可視フィールド、トレーニング適格性データ、デバッグと監査のみに使用されるデータを区別します。
- Agent Evolution Control Planeインテリジェントエージェント進化制御プレーンは、「更新するかどうか、どこで更新するか」という問題を、制御可能なシステム的な意思決定へと変換します。軌跡統計、ユーザー修正率、ツール障害クラスター、評価スコア、コストシグナル、セキュリティ制約、分布ドリフトに基づいて、進化をモデル強化学習、選好最適化、メモリ書き込み、ツールルーティング調整のどのレベルで実施すべきかを判断し、リプレイ評価、回帰テスト、カナリアリリース、バージョン追跡をサポートします。
- オンラインRLマイクロサービスランタイム既存のRLインフラストラクチャは、エージェントサービスからのトラフィックを処理するオンラインシステムに変換されます。ゲートウェイはリクエストを受信するエントリポイントとして機能し、ルーターはセッションとデータプロキシ間のバインディング関係を維持して、複数ラウンドのインタラクションコンテキストの継続性を確保します。データプロキシはセッションの状態と軌跡を管理し、エージェントコンピューティングワーカーは推論、サンプリング、トレーニング計算を実行し、コントローラーはスケジューリング、スケーリング、ヘルスチェックを担当します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
AReaL 2.0の使い方
-
プロジェクトのホームページをご覧くださいソースコードとドキュメントを入手するには、GitHubリポジトリ(https://github.com/areal-project/AReaL)を開いてください。
-
インフラストラクチャをインストールするAREAL 2.0のゲートウェイ、ルーター、データプロキシ、コントローラーなどのマイクロサービスコンポーネントをデプロイします。
-
推論エントリポイントを切り替える: 既存のエージェントの LLM API 呼び出しバックエンド (base_url/api_key) を AREAL 2.0 によって管理されるゲートウェイに向けます。
-
トラックプロトコルの設定ATDPを有効にして、エージェントの観測結果、アクション、ツール呼び出し、および結果を段階的に記録できるようにします。
-
データブローカーをデプロイするデータプロキシを設定して、データ傍受、データマスキング、アクセス制御、および永続的な追跡を実行できるようにします。
-
トレーニングのクローズドループを開始します収集した実際の軌跡をトレーニングサービスにインポートし、オンライン強化学習を開始して、エージェントが相互作用から継続的に学習できるようにします。
AReaL 2.0の主な利点
-
侵入の少ないアクセスLLM推論バックエンドを切り替えるだけで済みます。エージェントのプランニング、ツール呼び出し、サンドボックス、メモリモジュールを書き直す必要はありません。
-
実際の軌道駆動実際のオンラインインタラクティブデータを用いた直接的なトレーニングは、オフラインのシミュレーション環境と実際の行動との間のギャップを埋める。
-
エンタープライズレベルのセキュリティガバナンスデータ匿名化、アクセス制御、およびコンプライアンス境界は、トレーニングの前に完了しており、複数テナントおよび複数事業部門のシナリオに対応しています。
-
説明可能でロールバック可能各進化段階は、リプレイ評価、回帰テスト、およびバージョン追跡を経ており、問題が発生した場合に迅速なロールバックが可能となっている。
-
豊富なオープンソースエコシステムPyTorch Foundationに加盟しており、コミュニティはAscend NPUへの適応とLoRA低計算能力ソリューションを提供している。
AReaL 2.0プロジェクトのアドレス
- プロジェクト公式サイト:https://areal-ai.io/en/intro.html
- GitHubリポジトリ:https://github.com/areal-project/AReaL
- arXiv技術論文:https://arxiv.org/pdf/2607.01120
AReaL 2.0 競合製品比較
| 比較対象寸法 | AReaL 2.0 | OpenRLHF |
|---|---|---|
| 製品ポジショニング | エージェントベースのオンライン強化学習インフラストラクチャは、サービス側へと継続的に進化している。 | 汎用的なLLM RLHFトレーニングフレームワークであり、モデル導入後のトレーニングを対象としている。 |
| データソース | 実際の展開環境におけるオンラインセッションのトレース | オフラインで構築された選好データセットとシミュレーション環境 |
| アクセス方法 | マイクロサービスアーキテクチャにより、統合のために推論バックエンドを低侵襲的に切り替えることが可能になります。 | トレーニングプロセスは、特定のモデル構造に合わせて再構築する必要がある。 |
| データガバナンス | エンタープライズグレードのデータプロキシを内蔵しており、トレーニング前にデータの匿名化とアクセス制御を可能にします。 | 追加のデータクレンジングおよびガバナンスプロセスを構築する必要がある。 |
| 建築設計 | ゲートウェイ、ルーター、ワーカーの各マイクロサービスは疎結合されており、セッションの永続性と水平スケーリングをサポートしています。 | 分散コンピューティングの効率性を重視した、集中型トレーニングアーキテクチャ |
| 適用可能なシナリオ | 展開されたエージェントは、現実世界での相互作用に基づいて継続的に自己改善を行う。 | RLHF後のトレーニングと新しいモデルのアライメント最適化 |
AReaL 2.0の応用シナリオ
-
ソフトウェアエンジニアリング インテリジェントエージェント: コーディングエージェントを訓練して、実際の問題解決、コードレビュー、プルリクエスト生成などの戦略を継続的に改善します。例えば、Claudeコード型エージェントのエンドツーエンドの強化学習トレーニングなどです。
-
エンタープライズカスタマーサービスアシスタントユーザーとの対話、満足度に関するフィードバック、および手動による修正に基づいて、対応戦略、ツールへのアクセス経路、および知識検索の精度を最適化する。
-
研究助手文献検索、実験計画、データ分析の全プロセスを記録し、複数のツールとクロスプラットフォーム操作機能の配置を最適化する。
-
複雑なタスクスケジューリングエージェント複数回のやり取りと複数のツール呼び出しを伴うワークフローにおいては、ツールの選択、ルーティング戦略、およびエラー回復メカニズムを継続的に改善する。
-
マルチテナントSaaSインテリジェントエージェント異なる事業分野や権限範囲を持つエージェント向けに、個別の軌跡収集とカスタマイズされたオンライン学習サービスを提供します。