AB
AiBoss
project

ReSum - Alibaba Tongyi のオープンソース WebAgent 推論パラダイム

ReSumは、Alibaba Tongyiが発表した新しいWebAgent推論パラダイムであり、Tongyi DeepResearchファミリーに属しています。これは、WebAgentが長期的事実把握タスクで直面するコンテキスト長制限の問題を、インタラクション履歴を定期的に精緻化することで解決します。

ReSumとは何ですか?

アリババ傘下の同義が発表した、Webエージェントの新たな推論パラダイムであるReSumは、同義深層研究ファミリーに属します。ReSumは、Webエージェントが長期的事実把握タスクで直面するコンテキスト長制限の問題に対処するため、対話履歴を定期的に要約し、増え続ける対話内容をコンパクトな推論状態に圧縮することで、過去の発見を認識しながら無限の探索を可能にします。ReSumの中核は、GRPOアルゴリズムを統合したReSum-GRPOスキームであり、エージェントが要約ベースの条件付き推論を巧みに習得できるようにします。実験結果によると、ReSumは複数のタスクで非常に優れた性能を発揮し、従来のReActメソッドと比較して平均で4.5%の絶対性能向上を実現しています。この革新的なメカニズムは、複雑なタスクにおけるWebエージェントの応用可能性を広げます。

ReSumの主な機能

  • コンテキストの長さ制限を破る定期的な要約メカニズムを用いることで、長い対話は簡潔な推論状態に圧縮され、文脈の長さの制限という問題を効果的に解決する。
  • 無限の探検を実現するReSumにより、WebAgentは無制限の探索を実行し、推論状態を動的に更新し、すべての決定が最新の情報に基づいていることを保証できます。
  • 推論能力を向上させるReSumは、ReSum-GRPOスキームを統合しており、生成、検索、計画、最適化という4つのステップを通じて、インテリジェントエージェントの推論能力を大幅に向上させます。
  • 実験的検証実験結果によると、ReSumは従来のReAct方式と比較して平均で4.5%の絶対的な改善を達成し、長い対話や複雑なタスクにおいて非常に優れた性能を発揮することが示されています。

ReSumの技術原則

  • 定期的な状況要約ReSumは、対話履歴を定期的に要約することで、長文の対話をコンパクトな推論状態に圧縮し、文脈の長さによる制約を克服しつつ、その後の推論を支える重要な情報を保持します。
  • ReSum-GRPOアルゴリズムReSumはReSum-GRPOスキームに基づいており、GRPO(グループ相対ポリシー最適化)アルゴリズムを統合しています。生成、検索、計画、最適化の4つのステップを通して、エージェントの意思決定プロセスを最適化し、複雑なタスクにおけるパフォーマンスを向上させます。
  • 動的推論状態の更新ReSumは推論状態を動的に更新できるため、エージェントは各ステップで最新の情報に基づいて推論を行うことができ、効率的な多段階推論を実現します。
  • 強化学習フレームワークReSumは強化学習フレームワーク内で学習されます。オンポリシー学習とカスタマイズされたGRPOアルゴリズムにより、学習信号が常にモデルの現在の能力に関連するようにすることで、学習の安定性と効率性を向上させます。

ReSumプロジェクトの住所

  • GitHubリポジトリ:https://github.com/Alibaba-NLP/DeepResearch/tree/main/WebAgent/WebResummer
  • arXiv技術論文:https://arxiv.org/pdf/2509.13313

ReSumの応用事例

  • 学術研究複雑な学術文献や多段階の推論タスクを効率的に処理することで、研究者が重要な情報を迅速に見つけ出し、研究効率を向上させるのに役立ちます。
  • 法律調査判例を体系的に検索し、関連法規を相互参照することで、法律専門家向けに正確な法律調査支援を提供する。
  • 旅行計画ReSumは、特定の観光スポットやペット同伴可能なホテルを含む、複数日間のロードトリップルートなどの複雑な旅行プランを作成し、ユーザーにパーソナライズされた旅行提案を提供します。
  • 医療相談患者の医療記録と最新の研究成果を統合することで、医師に包括的な医療情報を提供し、治療計画の策定を支援する。
  • 財務分析膨大な量の金融データと市場動向を分析し、投資家に対し詳細な市場分析と投資アドバイスを提供する。