project
Skywork-OR1 - Kunlun Wanweiによってオープンソース化された高性能推論モデルシリーズ。
Skywork-OR1(Open Reasoner 1)は、Kunlun Techが発表したオープンソースの高性能推論モデルシリーズです。これらのモデルは、論理推論や複雑なタスクの解決において、大規模モデルの限界を克服します。Skywork-OR1には3つのモデルが含まれています。
Skywork-OR1とは何ですか?
Skywork-OR1(Open Reasoner 1)は、Kunlun Wanweiが発表したオープンソースの高性能推論モデルシリーズです。これらのモデルは、論理推論や複雑なタスクの解決において、大規模モデルの限界を克服しています。Skywork-OR1には3つのモデルがあります。Skywork-OR1-Math-7Bは、強力な数学的問題解決能力を備えた数学的推論モデルです。Skywork-OR1-7B-Previewは、数学的機能とコーディング機能の両方を備えた汎用モデルです。Skywork-OR1-32B-Previewは、より複雑なタスクに適した、さらに強力な推論能力を備えたフラッグシップバージョンです。パフォーマンスの面では、Skywork-OR1シリーズは複数のベンチマークテストで優れたパフォーマンスを発揮しています。例えば、AIME24とAIME25の数学データセットでは、Skywork-OR1-Math-7Bはそれぞれ69.8%と52.3%という高いスコアを達成し、同規模の主流モデルをはるかに凌駕しています。競技プログラミングのタスクにおいて、Skywork-OR1-32B-PreviewはLiveCodeBenchデータセットでDeepSeek-R1(671Bパラメータ)とほぼ同等の性能を示し、優れたコストパフォーマンスを発揮します。
Skywork-OR1の主な機能
- 論理的推論能力強力な論理推論能力を備えており、複雑な論理関係や複数段階の推論タスクを処理することが可能です。
- プログラミングタスクのサポート高品質なコード生成をサポートし、複数のプログラミング言語に対応しています。
- コードの最適化とデバッグコードの可読性と実行効率を向上させるために、コードを最適化およびデバッグする。
- 複数領域にわたるタスク適応汎用的な推論能力を備えており、他の分野における複雑なタスクの処理を支援する。
- 複数ターンにわたる対話とインタラクション複数ターンの対話に対応し、文脈情報に基づいて問題を段階的に解決し、より一貫性のある推論プロセスを提供する。
Skywork-OR1の技術原理
- 高品質なデータセットNuminaMath-1.5(約89万6000問)などの高品質な数学データセットを基に、AIMEやオリンピックを含む難易度の高い問題のサブセットが選定され、合計約11万問の数学問題が抽出されました。LeetCodeとTACOのデータセットが主な情報源となり、厳密なスクリーニングと重複排除の後、完全な単体テストと検証済みの問題のみが残され、1万3700問の高品質なコード問題が作成されました。
- データ前処理とフィルタリング各質問は複数回のサンプリングと回答検証を経て、「すべて正解」または「すべて不正解」の質問が除外され、無効なデータが学習に与える影響を回避します。意味不明瞭な質問、情報が不完全な質問、書式が不適切な質問、または無関係な内容の質問は、人間のレビューとLLMベースの自動質問判定メカニズムを組み合わせてクリーンアップします。
- トレーニング戦略モデルの学習はGRPOに基づいており、多段階学習によってコンテキストウィンドウの長さを段階的に増加させることで、モデルの長連鎖思考能力を高めています。学習前と学習中にオフラインおよびオンラインのフィルタリングを実行し、無効なサンプルを動的に除去することで、学習データの妥当性と難易度を確保しています。強化学習のサンプリング時には、適応型エントロピー制御メカニズムに基づき、高いサンプリング温度(τ=1.0)を使用することで、モデルの探索能力を高め、局所最適解に陥ることを回避しています。
- 損失関数の最適化トレーニング中はKL損失項を削除し、モデルが推論能力を十分に探索・最適化できるようにします。最適化プロセスの一貫性と安定性を向上させるため、トレーニングバッチ内のすべてのトークンにわたってポリシー損失を平均化します。
- 多段階トレーニングトレーニングプロセスでは、多段階トレーニングを通じてコンテキストウィンドウの長さを段階的に拡張することで、モデルが限られたトークン数内で効率的にタスクを完了し、複雑な長連鎖思考能力を徐々に習得できるようにします。多段階トレーニングの初期段階では、特定の戦略を用いて切り詰められたサンプルを処理することで、モデルが次の段階に進む際にパフォーマンスが迅速に向上するようにします。
スカイワークOR1のパフォーマンス
- 数学的推論課題:
- 汎用モデルであるSkywork-OR1-7B-PreviewとSkywork-OR1-32B-Previewは、AIME24およびAIME25データセットにおいて、同じパラメータサイズで最高のパフォーマンスを達成し、強力な数学的推論能力を実証しました。
- 専門モデルであるSkywork-OR1-Math-7Bは、AIME24とAIME25でそれぞれ69.8と52.3という高得点を獲得し、現在の主流である7Bレベルのモデルをはるかに凌駕し、高度な数学的推論における専門的な優位性を際立たせた。
- Skywork-OR1-32B-Previewは、すべてのベンチマークにおいてQwQ-32Bを上回り、AIME25ではR1とほぼ同等の性能を発揮します。
- 競技プログラミング課題:
- 汎用モデルであるSkywork-OR1-7B-PreviewとSkywork-OR1-32B-Previewは、LiveCodeBenchデータセットにおいて、同じパラメータサイズで最高のパフォーマンスを発揮します。
- Skywork-OR1-32B-Previewのコード生成および問題解決能力はDeepSeek-R1(パラメータスケール671B)に匹敵し、モデルサイズを圧縮しながら優れたコスト効率を実現しており、その高度なトレーニング戦略を実証している。
- Skywork-OR1-Math-7B パフォーマンス:
- AIME24における学習精度曲線は、安定した性能向上を示しています。このモデルは、AIME24で69.8%、AIME25で52.3%の精度を達成し、OpenAI-o3-mini(low)を上回り、現在のモデルサイズにおける最先端の性能に到達しました。
- Livecodebenchでのパフォーマンスは37.6%から43.6%に向上し、ベースラインモデルと比較して大幅な改善が見られ、このトレーニング方法の優れた汎化能力が実証されました。
Skywork-OR1プロジェクトの住所
- プロジェクト公式サイト:https://capricious-hydrogen-41c.notion.site/Skywork-Open-Reasoner
- GitHubリポジトリ:https://github.com/SkyworkAI/Skywork-OR1
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Skywork/skywork-or1
Skywork-OR1の応用シナリオ
- 数学教育それは生徒が問題を解決するのを助け、アイデアや手順を提供し、教師の授業準備を支援する。
- 研究支援これは、研究者が複雑なモデルを探求し、推測を検証し、公式を導き出すのに役立ちます。
- プログラミング開発コードフレームワークを生成し、コードを最適化し、デバッグを支援し、開発効率を向上させます。
- データ分析これは、金融、商業、その他の分野における意思決定を支援し、トレンドを予測し、リスクを評価する。
- AI研究研究プラットフォームとして、推論モデルのアーキテクチャとアルゴリズムの改善を推進する。