project
MagicAgent - Honorと復旦大学が共同で開発した基本的なインテリジェントエージェントモデル
MagicAgentは、Honorと復旦大学が共同開発した基本的なインテリジェントエージェントモデルです。32Bの高密度アーキテクチャと30B-A3BのMoEアーキテクチャにより、100億パラメータ内で最高のパフォーマンスを実現します。
MagicAgentとは何ですか?
MagicAgentは、Honorが復旦大学と共同開発した基盤となるエージェントモデルです。32Bの高密度アーキテクチャと30B-A3BのMoEアーキテクチャを採用し、100億パラメータの範囲内で最高のパフォーマンスを実現しています。軽量な合成データフレームワークにより、タスク分解、ツールプランニング、マルチ制約スケジューリングという5つの主要シナリオに対応しています。マルチタスクの競合を解決するために「SFT + 多目的強化学習」の2段階トレーニングアプローチを採用し、探索と利用のバランスを取る革新的なχPOアルゴリズムを提案しています。WorfbenchやBFCL-v3などのベンチマークにおいて、GPT-5.2やKimi-K2といった数百億パラメータを持つモデルを凌駕する性能を発揮します。あらゆるシナリオで汎用的なプランニングをサポートする業界初のエージェントモデルであり、Honor Magicシリーズのスマートフォンに搭載されています。
MagicAgentの主な機能
-
階層的タスク分解このモデルは、複雑なユーザー指示を実行可能なサブタスクのシーケンスに分解することができ、複数ステップの依存関係や並列実行をサポートします。
-
ツール強化計画推論と行動のループを通じて、リアルタイム情報や外部機能を必要とするタスクを完了するために、外部APIやツールを動的に呼び出します。
-
複数制約スケジューリング時間、空間、資源など複数の制約条件を考慮した計画立案(旅程計画や会議手配など)の処理。
-
プログラムロジック構成このモデルは、条件分岐やループ構造を含むワークフローを理解して実行でき、タスク間の複雑な依存関係を維持できる。
-
長期的なツール実行数十回のやり取りを通して状態追跡を維持し、複数のツールチェーン呼び出しを必要とする長期タスクを安定的に完了させる。
MagicAgentの技術原則
- 合成データ生成MagicAgentは、ツールごとに依存関係グラフとパラメータ共有グラフを構築し、最小のセマンティック単位としてアトミックプランを定義し、連結、集約、グループ化などの操作を通じて複雑な軌跡を合成します。これにより、高コストなサンドボックスシミュレーションが不要になり、厳密なデータロジックと多様なシナリオの網羅が保証されます。
- 2段階トレーニングパラダイム第1段階では、新規性サンプリングに基づく教師あり微調整を用いて、複数のタスク間でデータ分布のバランスを取ります。第2段階では、フォーマットの正確さとタスクの意味的正確さを組み合わせた統一的な多目的報酬関数を導入し、オフラインGRPOとオンラインχPOによる強化学習を通して汎化能力を段階的に向上させます。
- χPOアルゴリズムこのアルゴリズムは、報酬が疎な環境向けに3層構造のメカニズムで設計されています。トークンレベルのエントロピー正則化は語彙の多様性の探索を促進し、思考と行動の分離エントロピー平滑化は推論段階での不確実性を高めつつ意思決定段階を制約し、情報ボトルネックは冗長な推論を圧縮して重要な意思決定情報を保持することで、探索と利用の動的なバランスを実現します。
- MoE負荷分散マイクロバッチ制約をグローバルバッチ統計に置き換えることで、タスク次元におけるエキスパートの自然な差別化をサポートします。また、z-lossと組み合わせることでルーティングロジットの極端な値を抑制し、マルチタスクトレーニングにおけるエキスパートの崩壊やパラメータの遊休といった問題を解決し、推論効率とモデル容量の分離を維持します。
MagicAgentプロジェクトのアドレス
- arXiv技術論文:https://arxiv.org/pdf/2602.19000
MagicAgentの応用シナリオ
-
インテリジェントデバイス制御ユーザーは自然言語コマンドを使ってスマートフォンを操作し、「美団で西湖周辺のホテルを予約し、近くの高評価レストランを探す」といった複雑な操作を実行できます。このモデルはタスクを自動的に分解し、対応するアプリのインターフェースを呼び出して実行します。
-
エンタープライズプロセス自動化顧客サービスシナリオでは、在庫状況の自動照会、支払い情報の確認、返金処理の開始、ユーザーが提供した注文番号と返金理由に基づく同時通知など、システム間連携の業務を処理します。
-
パーソナライズされた旅行プランニングユーザーが指定した時間帯、予算制約、および好みのタグを組み合わせることで、「直行便、特定の都市での滞在日数、連続旅行」など、複数の制約を満たす完全な旅行プランを自動的に生成します。
-
マルチエージェントタスクオーケストレーションこれは、上位レベルの担当者の意図を分析し、「製品発売の準備」を会場、資材、ゲストなどの並行するサブタスクに分解し、それらを専門的なインテリジェントエージェントに分配して実行させ、結果を統合するための中心的なノードとして機能することができます。
-
長距離インタラクティブ意思決定このモデルは、数十回の対話を通じて状態を継続的に追跡し、「まずフライトを確認し、次にホテルを予約し、最後にレンタカーを借りる」といった連鎖的に依存するタスクを処理し、中間結果に基づいて後続の計画を動的に調整することができる。