project
Step-DeepResearch - Step-Leap Starが開発した深層学習AIモデル。
Step-DeepResearchは、Step-Leap Star Technologyが開発した32億パラメータの深層学習AIモデルです。複雑な研究タスクを単一の推論反復で完了し、専門的なレポートを生成できます。このモデルは、プランニング、深層探索、逆推論を活用したモノリシックアーキテクチャ設計を採用しています。
ステップディープリサーチとは何ですか?
Step-Leap Starが開発した32億パラメータの深層研究AIモデル「Step-DeepResearch」は、複雑な研究タスクを1回の推論反復で完了し、専門的なレポートを生成できます。このモデルはモノリシックアーキテクチャを採用し、計画、深層検索、検証、レポート作成という4つのコア機能を通じて、非常に効率的かつ低コストの研究ループを実現しています。ResearchRubricsベンチマークでは61.42点を獲得し、トップレベルのクローズドソースモデルに匹敵する性能を示しながら、レポート1件あたりのコストはわずか0.5人民元です。このモデルのユニークな特徴は、トレーニングの途中段階で意思決定能力を強化できる点にあり、金融や医療などの専門分野で特に威力を発揮します。また、絞り込み検索やユーザー選択の情報源といった機能をサポートしており、業界調査、学術分析、その他のシナリオにも適しています。
Step-DeepResearchの主な機能
-
原子兵器能力の統合複雑な研究課題は、計画立案、情報検索、リフレクションとクロスバリデーション、専門的なレポート作成といった、学習可能な最小単位の機能に分解され、単一の推論において閉ループのリフレクションと動的な修正を保証するために、モデルレベルで深く内部化される。
-
段階的なトレーニングプロセスエージェントの中期トレーニングから教師ありファインチューニング(SFT)および強化学習(RL)に至るまでの完全な最適化パスを確立し、トレーニング目標を「次の最小動作を決定する」ように再構築し、モデルの適応性と汎化性能を向上させる。
-
あらゆるモデル規模において優れた性能を発揮わずか320億個のパラメータで、Scale AI Research Rubricsテストにおいて61.4%のスコアを獲得し、OpenAI Deep ResearchやGemini Deep Researchと同等の性能を示しました。ADR-Benchの専門家評価では、Eloスコアにおいて大規模モデルを大きく上回りました。
-
優れた費用対効果高度な調査能力を維持しながら、導入コストと推論コストを極めて低く抑えているため、業界で最も費用対効果の高いディープリサーチプロキシソリューションとなっています。
-
高品質なデータ合成原子レベルの能力に基づくデータ合成戦略を採用することで、詳細な推論軌跡を持つ「博士課程レベル」の訓練データが生成され、研究データの不足という課題を克服する。
-
信頼できる情報取得と処理私たちは、厳選された権威あるインデックス戦略を採用し、600以上の権威あるドメインを分離することで、事実に基づいた情報提供を保証しています。知識集約型の検索により、段落レベルでの単一トークンの情報密度を最大化し、意味的関連性が同程度の場合は、信頼性の高い情報源を優先します。
-
動的二重循環型認知アーキテクチャこのシステムは、「動的計画法と階層的合成」という二重ループのワークフローを構築する。プランナーエージェントが最初に研究概要を生成した後、強化学習アルゴリズムを用いて新たな発見に基づいて研究経路を継続的に最適化する。
-
プロフェッショナルなレポート作成「業界テンプレートライブラリ+動的知識ベース」に基づき、フォーマット要件を満たす業界特化型文書を生成します。レポート内の重要な見解には明確な情報源の引用があり、専門的な調査に基づく信頼性を備えています。
Step-DeepResearchの技術的原理
-
シングルエージェントアーキテクチャとダイナミックループ単一エージェントアーキテクチャに基づき、ReActパラダイムに従って、高度な研究タスクは動的な推論・行動・観察サイクルへと再構築されます。計画と考察、ツール実行、フィードバックと相互検証といった主要な段階を経て、専用のツールセットを用いて包括的な研究レポートが生成されます。
-
原子力能力の構築と訓練このアプローチでは、複雑な研究課題を、計画立案、情報検索、リフレクションとクロスバリデーション、専門的なレポート作成といった、学習可能な最小単位の機能に分解します。データは、長期推論におけるエラーリフレクションループの設計など、特定の閉ループプロセスを通じて生成され、モデルの堅牢性とクロスバリデーション性能を向上させます。
-
段階的なトレーニング戦略トレーニングプロセスは段階的なアプローチを採用しており、中程度の長さのコンテキストを用いた中期トレーニング、長いコンテキストを用いた中期トレーニング、そして強化学習フェーズが含まれます。コンテキストの長さを段階的に拡張し、モデルのアトミック機能を最適化することで、複雑なタスクにおけるモデルのパフォーマンスが向上します。
-
データ合成と強化学習原子レベルの機能に基づいたデータ合成戦略を採用し、詳細な推論軌跡を持つ「博士レベル」の訓練データを生成する。強化学習アルゴリズムを通して、専門家の判断基準に沿った尺度評価を二値報酬信号に変換することで、モデルが専門家の行動基準に沿った挙動へと収束する速度を加速させる。
-
信頼できる情報取得と処理私たちは、厳選された権威あるインデックス戦略を採用し、600以上の権威あるドメインを分離することで、事実に基づいた情報提供を保証しています。知識集約型の検索により、段落レベルでの単一トークンの情報密度を最大化し、意味的関連性が同程度の場合は、信頼性の高い情報源を優先します。
-
動的計画法と最適化このシステムは、「動的計画法と階層的合成」という二重ループのワークフローを構築する。プランナーエージェントが最初に研究概要を生成した後、強化学習アルゴリズムを用いて新たな発見に基づいて研究経路を継続的に最適化する。
Step-DeepResearchプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/stepfun-ai/StepDeepResearch
- arXiv技術論文:https://arxiv.org/pdf/2512.20491
Step-DeepResearchの応用シナリオ
-
学術研究これは研究者が文献レビュー、研究計画、予備研究報告書を迅速に作成するのに役立ち、学術研究プロセスを加速させる。
-
ビジネス分析これは、ビジネスアナリストに対し、市場動向分析、競合他社調査、業界レポート作成などの機能を提供し、ビジネス上の意思決定を支援する。
-
政策決定政策立案者が政策の背景調査、影響評価、政策提言報告書の作成を行う際に支援し、政策策定の科学的かつ合理的な性質を裏付ける。
-
技術開発技術分野においては、新技術の研究、技術動向分析、実現可能性調査報告書の作成などに活用され、技術革新の促進に貢献している。
-
教育これは、教師と学生のカリキュラム研究、プロジェクト設計、学術論文執筆を支援し、それによって教育の質と研究能力を向上させる。
-
健康管理医療研究者が疾病研究、治療法の評価、医学文献のレビューを行うことを支援し、それによって医療技術の発展を促進する。