AB
AiBoss
project

360 GPT2-O1 - 360社が独自開発のAI大型モデルを発表。複数のテストでGPT-4Oを上回る性能を発揮。

360gpt2-o1は、360が独自開発したAIモデルであり、推論能力が大幅に向上し、特に数学的および論理的推論タスクにおいて優れた性能を発揮します。このモデルは、合成データ、ポストトレーニング、および「スローシンキング」パラダイムを通じて最適化されています。

360gpt2-o1とは何ですか?

360gpt2-o1は、360が独自開発したAIモデルで、推論能力が大幅に向上しており、特に数学的および論理的推論タスクで優れた性能を発揮します。このモデルは、合成データの最適化、ポストトレーニング、および「スローシンキング」パラダイムを通じて技術的なブレークスルーを達成し、数多くの権威ある評価で優れたパフォーマンスを実現しています。基本的な数学評価(MATHや全国大学入学共通試験数学など)や権威ある数学コンテスト(AIME24やAMC23など)において、360gpt2-o1は前身の360gpt2-proを上回り、GPT-4oモデルを凌駕しています。数学コンテストの評価では、360gpt2-o1はアリババの最新のオープンソースo1シリーズモデルであるQWQ-32B-previewを上回っています。

360gpt2-o1の主な機能

  • 推論能力の向上360gpt2-o1は、数学的および論理的推論タスクにおいて非常に優れた性能を発揮し、特に推論能力において顕著な向上が見られました。
  • 合成データ最適化指示合成や品質・多様性スクリーニングなどの手法を用いることで、質の高い数学的・論理的推論データの不足という問題が解決され、トレーニングデータセットが効果的に拡張された。
  • モデルのトレーニング後2段階のトレーニング戦略を採用する。まず、小型モデルを用いて多様な推論経路を生成し、次に大型モデルを用いてRFTトレーニングと強化学習トレーニングを行い、モデルの推論能力、反射能力、およびエラー修正能力を向上させる。
  • 「スローシンキング」パラダイムモンテカルロ木探索に基づいて多様な解を探索し、エラー検証と訂正のためにLLMを導入し、段階的な推論と反省という人間のプロセスをシミュレートし、最終的に反省、検証、エラー訂正、バックトラッキングを含む長い思考連鎖を形成します。

360gpt2-o1の技術原理

  • データ合成とフィルタリング360gpt2-o1は、合成データ最適化を通じて、モデルトレーニングに不可欠な高品質のトレーニングデータを生成およびフィルタリングすることができます。
  • 2段階トレーニング戦略第1段階では、小型モデルを用いて推論経路を生成し、第2段階では、大型モデルを用いて学習を行うことで、推論の多様性を維持しながら、推論の精度と深さを向上させることができる。
  • モンテカルロ木探索とLLMの組み合わせモンテカルロ木探索により、モデルは複数の可能な解を探索することが可能になり、さらにLLMの導入により、モデルにエラー検証および修正機能が付与され、モデルの堅牢性が向上します。

360gpt2-o1の使い方

  • アクセス360スマートブレイン現在、360gpt2-o1は360 Smart Brain APIオープンプラットフォーム上で公開されています。
  • 体験アドレス:https://ai.360.com/playground/?model=360gpt2-o1?src=weixinmp

360gpt2-o1の応用シナリオ

  • 数学的問題解決360gpt2-o1は、基礎数学の評価(MATHや全国大学入学共通試験数学など)や権威ある数学コンテスト(AIME24やAMC23など)において目覚ましい成果を上げており、数学の問題を解く能力の高さを証明しています。
  • 論理的推論このモデルは、「スローシンキング」技術を用いて、人間が段階的に推論や熟考を行うプロセスをシミュレートし、複雑な論理問題を解決する能力を備えている。
  • プログラミングの問題数学、プログラミング、その他の分野において、O1に匹敵するか、あるいはそれを上回る性能を発揮し、360GPT2-O1はプログラミング問題の解決を支援します。
  • 複雑な問題解決360gpt2-o1は、自己反省や誤りの修正能力を含む、高度な論理的推論能力を必要とする複雑な問題を処理できます。
  • 教育と学術このモデルを教育分野における数学的および論理的な問題に適用することで、教育や学術研究を支援できる。
  • 企業意思決定支援360gpt2-o1は、論理的推論とデータ分析を通じて、企業が複雑な意思決定プロセスにおいて論理的なサポートを提供することを支援します。