AB
AiBoss
project

Tongyi DeepResearch - アリババのオープンソース深層研究インテリジェントエージェント

Tongyi DeepResearchは、アリババが開発したオープンソースの深層学習エージェントで、特に長期にわたる深層情報検索タスク向けに設計されています。300億個のパラメータを誇り、セッションごとに30億個のパラメータをアクティブ化し、ReActモードと深層学習をサポートしています。

DeepResearchとは、一般的にどのようなものですか?

Tongyi DeepResearchは、アリババが開発したオープンソースの深層学習エージェントで、長期にわたる深層情報検索タスク向けに特別に設計されています。300億個のパラメータを持ち、毎回30億個のパラメータがアクティブ化されます。ReActモードとHeavyモードをサポートしており、後者はIterResearchを通じて複雑な推論能力を強化します。このエージェントは、完全に合成されたデータソリューションを採用し、人間の介入なしに高品質のデータセットを生成し、エージェントの能力の限界を押し広げます。トレーニングプロセスには、Agentic CPT、Supervised Fine-tuning (SFT)、およびReinforcement Learning (RL)が含まれ、完全なエンドツーエンドのトレーニングチェーンを形成します。Tongyi DeepResearchは、高徳地図のAIネイティブ旅行エージェントや法律分野の「Tongyi FaRui」など、アリババ社内の複数のアプリケーションですでに活用されています。

Tongyi DeepResearchの主な機能

  • 長期的な深層情報検索複雑で長期間にわたる情報検索タスク向けに特別に設計されており、多段階の推論と計画を処理でき、学術研究、市場分析、政策立案などのシナリオに適しています。
  • マルチモーダル推論支援ReActモードとHeavyモードに対応しています。ReActモードは「考える・行動する・観察する」というサイクルを厳密に踏襲し、モデルのコア機能を評価するのに適しています。Heavyモードは、反復的な研究パラダイムを通じて複雑な推論能力を向上させます。
  • 全プロセス合成データ生成本システムは、独自開発のエンドツーエンドの合成データソリューションを採用しており、人間の介入なしに高品質なデータセットを生成できるため、インテリジェントエージェントの能力の上限を突破し、事前学習から微調整、強化学習までの完全なトレーニングチェーンをサポートします。
  • エンドツーエンド強化学習カスタマイズされた強化学習アルゴリズム(グループ相対方策最適化、GRPOなど)を使用することで、エージェントの行動が上位の目的と一致することを保証でき、それによって動的な環境におけるモデルの適応性と安定性を向上させることができます。
  • 実践的な応用を可能にするこの技術は、アリババ社内の複数のシナリオ、例えば高徳地図のAIネイティブ旅行代理店や法律分野の「同義法瑞」などに適用され、高い実用性と価値を実証している。
  • オープンソースコラボレーションこのプロジェクトは完全にオープンソースであり、完全なコード、モデル、データを提供することで、開発者が共同構築に参加することを奨励し、深層研究インテリジェントエージェントの開発と革新を促進します。

同義深層研究の技術原理

  • エンドツーエンドの合成データソリューション人間の介入なしに高品質なデータセットを自動的に生成し、事前学習から微調整、強化学習までの完全なトレーニングチェーンをサポートし、インテリジェントエージェントの能力の上限を打ち破ります。
  • 反復型研究パラダイム複雑なタスクは複数の調査ラウンドに分割され、各ラウンドで作業空間が動的に再構築・効率化されます。「思考・統合・行動」のプロセスを通じて、複雑な推論能力と意思決定の質が向上します。
  • エンドツーエンド強化学習グループ相対方策最適化(GRPO)などのカスタマイズされた強化学習アルゴリズムを採用することで、学習信号がモデルの現在の能力と正確に一致するようにし、動的な環境におけるモデルの適応性と安定性を向上させます。
  • 大規模な継続的事前トレーニング継続的に更新される知識文書、クロールされたデータ、知識グラフなどを利用してオープンワールドの知識メモリを構築し、マルチスタイル(質問、回答)ペアを生成し、モデルの機能を継続的に拡張します。
  • 自動データ管理トレーニングの動態に基づいてリアルタイムでデータを最適化し、完全自動のデータ合成とデータファネルを通じてトレーニングセットを動的に調整することで、トレーニングの安定性とパフォーマンスの向上を確保します。
  • 安定性と効率性に優れたツールサンドボックス並行処理や障害に対応し、ツール呼び出しの安定性と信頼性を確保し、インテリジェントエージェント向けに高速かつ堅牢なインタラクション環境を提供する、統一されたサンドボックス環境を開発する。

同義深研究プロジェクトの住所

  • プロジェクト公式サイト:https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
  • GitHubリポジトリ:https://github.com/Alibaba-NLP/DeepResearch
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Alibaba-NLP/Tongyi-DeepResearch-30B-A3B

Tongyi DeepResearchファミリーメンバー

  • WebWalkerウェブページの移動タスクに焦点を当て、ウェブページナビゲーションにおける言語モデルのパフォーマンスを評価するために使用されます。
  • WebDancer同社は、自律的な情報探索能力の実現と、情報検索におけるインテリジェントエージェントの自律性の促進に尽力している。
  • WebSailor複雑なウェブ環境をナビゲートしたり、インテリジェントエージェントの超人的な推論能力を高めたりするために使用されます。
  • WebShaper情報探索を形式化することで、エージェントデータを統合し、データ品質とモデル性能を向上させることができる。
  • WebWatcher視覚と言語の能力を組み合わせることにより、視覚言語知能エージェントの新たな領域を開拓し、詳細な研究を行う。
  • WebResearcher長期サイクル型インテリジェントエージェントの無限の推論能力を解き放ち、複雑なタスクにおけるパフォーマンスを向上させます。
  • ReSum文脈を要約することで、長期的な検索インテリジェンスを解き放ち、インテリジェントエージェントの情報管理能力を最適化することができます。
  • WebWeaver動的に構造化されたネットワーク概要の規模に関する証拠を活用し、自由形式の詳細な研究を支援する。
  • WebSailor-V2合成データとスケーラブルな強化学習を用いることで、独自のエージェントとの差を縮めることができる。

汎用ディープリサーチの応用シナリオ

  • 学術研究文献レビューを迅速に整理できるため、研究者が複雑な学術研究課題を効率的に完了させ、研究効率を向上させるのに役立ちます。
  • 市場分析競合他社分析、業界動向レポート、その他企業が的確な市場戦略を策定するのに役立つ情報を提供する。
  • 法律調査法律分野では、「同義法瑞」のようなアプリケーションが、法律条項、類似事例、判例を自動的に検索し、詳細な分析を行うことで、法律専門家に強力な生産性向上ツールを提供している。
  • 旅行計画Amap社との提携により、リアルタイムデータを活用してユーザーに正確な旅行プランや提案を提供する、AIネイティブの旅行代理店サービスを開始しました。
  • 複雑な情報検索これは、学際的な研究や政策立案など、多段階の推論と計画を必要とする複雑な情報検索タスクに適しており、ユーザーが情報を迅速に取得・統合するのに役立ちます。