AB
AiBoss
project

Light-R1 - 360 Brainのオープンソース長連鎖推論モデル

Light-R1は、360 AIが開発したオープンソースのAIモデルで、数学における長連鎖推論、特にLight-R1-32Bに焦点を当てています。このモデルはQwen2.5-32B-Instructをベースにしており、70,000個の数学的データポイントと2段階の学習プロセス(SF...)を使用しています。

Light-R1とは何ですか?

Light-R1は、360 AIが開発したオープンソースのAIモデルで、数学における長連鎖推論、特にLight-R1-32Bに焦点を当てています。Qwen2.5-32B-Instructをベースに、70,000個の数学データポイントと2段階学習プロセス(SFT+DPO)を用いてトレーニングを行い、DeepSeek-R1-Distill-Qwen-32Bをゼロから構築した場合よりも優れたパフォーマンスを実現しました。AIME24テストでは、Light-R1は76.6ポイントを獲得し、DeepSeek-R1-Distillの72.6ポイントを大きく上回りました。トレーニングコストは低く、約1,000ドルで6時間稼働するH800マシン12台のみで済みます。モデル、データセット、トレーニングフレームワーク、評価コードを含む完全なオープンソースモデルであり、オープンソースコミュニティの発展に貢献するとともに、特殊モデルの低コストトレーニングの参考資料となります。

Light-R1の主な機能

  • 効率的な数学的問題解決代数、幾何学、確率論をはじめとする様々な分野において、複雑な数学問題を迅速かつ正確に解くことができる。
  • 推論能力の向上論理的思考能力が高く、思考プロセスが長い問題にも対応できる。
  • 一般化能力これは、他の分野(論理的推論や言語理解など)における一般化能力を示すものである。
  • 低コストの訓練と展開極めて低コストで高いパフォーマンスを発揮するため、限られたリソースしか持たないユーザーや企業が迅速に導入・適用するのに適しています。

Light-R1の技術原理

  • 基本モデルと出発点このモデルはQwen2.5-32B-Instructをベースに開発され、性能がゼロからDeepSeek-R1-Distillを上回るレベルまで向上しました。
  • コース学習
    • SFT(Supervised Fine-Tuningデータは難易度別に分類され、教師あり微調整が2段階で実施された。第1段階では7万個のデータポイントを使用し、第2段階では最も難易度の高い3,000個のデータポイントを選択してさらに微調整を行った。
    • DPO(Direct Preference Optimization)SFTに基づき、複数回のサンプリングと選好ペアの構築によって、モデルの出力品質が最適化される。
  • データ処理と重複排除トレーニングデータは、複数のオープンソースの数学データセット(OpenR1-Math-220k、OpenThoughts-114kなど)から取得され、テストデータの漏洩がモデルのパフォーマンスに与える影響を回避するために、厳密なデータ重複排除処理が施されています。
  • モデル融合最終的なLight-R1-32Bは、SFTステージ2、DPO、および別のDPOバージョンのモデルを融合することによって得られます。これにより、モデルの性能と安定性がさらに向上します。
  • トレーニングフレームワークと最適化360-LLaMA-Factoryのトレーニングフレームワークは、シーケンス並列処理と効率的な分散トレーニングをサポートしています。最適化されたトレーニングプロセスに基づき、Light-R1は12台のH800マシン上でわずか6時間でトレーニングを完了できます。

Light-R1プロジェクトの住所

Light-R1の応用事例

  • 教育数学学習ツールとして、複雑な問題を解くのに役立ち、解法の手順やアイデアを提供し、数学コンテストや日々の学習に適しています。
  • 科学研究と学術これは、数学研究や、物理モデリングや工学最適化といった学際的な問題解決を支援する。
  • エンタープライズアプリケーションこれは、データ分析、リスク評価、サプライチェーン最適化といった複雑な問題を解決するために使用されます。
  • ソフトウェア統合これはスマートアシスタントや数学ソフトウェアに統合することで、推論能力や問題解決能力を向上させることができる。
  • オープンソースと開発者開発者がモデルをカスタマイズおよび拡張するのを支援し、オープンソースコミュニティの発展を促進します。