AB
AiBoss
project

Optima - 清華大学と北京郵電大学が共同で、コミュニケーション効率と業務効果を最適化するための研修フレームワークを発表。

Optimaは、清華大学が開発した、大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)の最適化フレームワークです。生成、ランキング、選択、トレーニングという反復的なパラダイムに基づき、通信効率とタスクパフォーマンスを大幅に向上させます。

Optimaとは何ですか?

清華大学が開発したOptimaは、大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)の最適化フレームワークです。反復的な生成、ランキング、選択、トレーニングのパラダイムに基づき、通信効率とタスクパフォーマンスを大幅に向上させます。Optimaは、タスクパフォーマンス、トークン効率、通信可読性のバランスを取り、様々な強化学習アルゴリズムを探求し、モンテカルロ木探索を統合して高品質なトレーニングデータを生成します。マルチエージェントタスクにおいて、Optimaはシングルエージェントベースラインや従来のMASを上回るパフォーマンスを発揮し、トークン使用量を削減しながら最大2.8倍のパフォーマンス向上を実現します。Optimaの効率向上は、より効率的な推論計算と推論時間延長ルールの改善に新たな可能性をもたらします。

Optimaの主な機能

  • コミュニケーション効率の向上:O は、マルチエージェントシステム (MAS) 内のエージェント間の通信を最適化し、タスクを完了するために必要なトークンの数を削減し、通信効率を向上させます。
  • タスクパフォーマンスの向上反復学習と報酬関数のバランスに基づいて、非対称な質問応答や複雑な推論タスクを含む複雑なタスクにおけるインテリジェントエージェントの性能を向上させる。
  • 拡張性これにより、MASはより大規模で複雑なタスクを処理する際にも効果的に機能し続け、システムの拡張性を向上させることができる。
  • 推論時間延長ルールの改善トークンの使用量を削減することで、推論時間のスケーリングルールを改善することが可能になり、より低い計算コストでより高いパフォーマンスを実現するのに役立ちます。

オプティマの技術原理

  • 反復トレーニングパラダイム生成、ランキング、選択、トレーニングという反復的なパラダイムに基づいて、エージェントの挙動は徐々に最適化される。
  • 報酬関数タスクのパフォーマンス、トークン効率、およびコミュニケーションの可読性のバランスが取れた報酬関数を設計し、エージェントがコミュニケーション効率を維持しながらタスクを完了できるように導く。
  • 強化学習アルゴリズムエージェントの行動を最適化するために、教師あり微調整(SFT)、直接選好最適化(DPO)、ハイブリッド手法など、さまざまな強化学習アルゴリズムを探求します。
  • モンテカルロツリー検索(MCTS)MCTSヒューリスティックを統合することで、対話のターンをツリーノードとして扱い、多様な相互作用経路を探索し、高品質なDPOトレーニングデータを生成します。
  • 多目的最適化報酬関数に基づいて複数の目標が同時に考慮されるため、コミュニケーション効率と出力の解釈可能性に重点を置きながら、タスクのパフォーマンスが向上します。

Optimaのプロジェクトアドレス

Optimaの応用シナリオ

  • 情報非対称性に関する質疑応答質問応答システムにおいて、質問への回答に複数の情報源からの情報を統合する必要がある場合、エージェント間の通信を最適化することで、回答の精度と応答速度を向上させることができる。
  • 複雑な推論タスク法的事例分析や科学的問題解決など、複数の段階を経る推論を必要とする問題において、インテリジェントエージェントがより効果的に連携し、正しい結論に到達するのに役立つ。
  • ソフトウェア開発ソフトウェア開発においては、異なる機能モジュールの開発を調整し、開発プロセスを最適化し、インテリジェントエージェント間の効果的なコミュニケーションに基づいてコード品質を向上させることが極めて重要である。
  • 意思決定支援システムビジネス上の意思決定や政策決定において、複数の意思決定者や関係者が情報を共有し、解決策を議論し、合意に達するのに役立ちます。
  • マルチエージェントゲーム複数のプレイヤーやエージェント間の協力が必要なゲームでは、プレイヤー間のコミュニケーション戦略を最適化して、チームワークの効率性を向上させる。