project
AtomThink - Huawei Noah's Arkと複数の大学が共同開発した、マルチモーダルな数学的推論フレームワーク。
AtomThinkは、中山大学、香港科技大学、上海交通大学、香港大学、およびファーウェイ・ノアズアーク・ラボの研究者らが共同開発したマルチモーダルな数学的推論フレームワークです。このフレームワークは、思考の長い連鎖(CoT)を構築するという概念に基づいています。
AtomThinkとは何ですか?
AtomThinkは、中山大学、香港科技大学、上海交通大学、香港大学、およびファーウェイ・ノアズアーク研究所の研究者らが共同開発したマルチモーダル数学推論フレームワークです。このフレームワークは、大規模なマルチモーダル言語モデル(MLLM)が思考の長い連鎖(CoT)に基づいて複雑な推論を実行できるように支援し、自動CoTアノテーションエンジン、アトミックステップの微調整、および様々な探索戦略を備えています。AtomThinkはアトミックステップの品質を向上させることで、数学的問題を解決する際のMLLMの推論能力を大幅に向上させ、汎用的な低速思考モデルの開発に新たな方向性を示します。
AtomThinkの主な機能
- CoTアノテーションエンジン視覚的な数式データの品質不足という問題を解決するため、高品質な思考連鎖(CoT)注釈を自動的に生成します。
- 原子ステップ微調整戦略: マルチモーダル大規模言語モデル(MLLM)とポリシー報酬モデル(PRM)を共同で最適化し、段階的推論を実現する。
- 検索戦略PRMと組み合わせて複雑な推論タスクを完了するために使用できる、4つの異なる検索戦略を提供します。
- データセットの構築我々は、モデルのトレーニングと評価のために、長いCoTを含む大規模なマルチモーダルデータセットであるAtomMATHを提案する。
- 原子力能力評価各原子ステップを生成する際のMLLMの能力を評価するために、結果監視型の原子能力評価手法を設計する。
AtomThinkの技術原則
- スローシンキングフレームワークAtomThinkフレームワークの中核となる考え方は「スローシンキング」であり、これはMLLMが高速かつ直接的な予測に頼ることなく、長いCoTを段階的に構築することで複雑な推論を実行するように導くものです。
- 動的なプロンプト戦略動的なプロンプト戦略に基づき、MLLMは状態推論パスを反復的に構築するように駆動されます。各パスノードは、前の段階、現在の状態、および可能なアクションを含む推論ステップを表します。
- 短期CoT強化LLMに基づいて、既存の短いCoTアノテーションセマンティクスは複数の個別のステップに分割され、推論プロセスにおける個々の原子的な問題の解決に焦点を当てています。
- マルチモーダルデータセットAtomMATHデータセットは、複数のデータソースから数学データをサンプリングし、動的なプロンプトと短いCoT拡張機能に基づいて多段階の推論パスを生成することによって構築されます。
- 原子レベルの微調整AtomMATHデータセットを用いた微調整により、MLLMは原子レベルのステップに基づいた推論パターンを学習できるようになる。
AtomThinkのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/Quinn777/AtomThink
- arXiv技術論文:https://arxiv.org/pdf/2411.11930
AtomThinkの応用シナリオ
- 教育支援このシステムは、高度な個別指導システムとして、数学の問題に対する段階的な解答と解説を生徒に提供します。
- 自動テストと評価オンライン試験システムにおいて、数学のテスト問題を自動生成し、採点する。
- 学術研究これは、研究者が複雑な数学的問題を探求し解決するのを支援する。
- ソフトウェア開発これは、開発者が数学的計算に関連するコードを自動的に生成およびデバッグするのに役立ちます。
- インテリジェントな顧客サービスと技術サポート数学的な計算や推論を必要とする顧客サービス場面において、サポートを提供する。