AB
AiBoss
project

Klear-Reasoner - Kuaishou のオープンソース推論モデル

Klear-Reasonerは、KuaishouがQwen3-8B-Baseをベースに開発した推論モデルで、数学的推論能力とコード推論能力の向上に重点を置いています。このモデルは、ロング思考連鎖教師ありファインチューニング(long CoT SFT)と強化学習(RL)によって学習されます。

Klear-Reasonerとは何ですか?

Klear-Reasonerは、KuaishouがQwen3-8B-Baseをベースに開発した推論モデルで、数学的推論能力とコード推論能力の向上に重点を置いています。このモデルは、ロング思考連鎖教師ありファインチューニング(long CoT SFT)と強化学習(RL)によって学習されます。その核となる革新はGPPOアルゴリズムで、剪定された勾配情報を保持することで、従来の手法における探索の限界やネガティブサンプルへの収束の遅さといった課題を克服しています。AIMEやLiveCodeBenchなどのベンチマークにおいて、8Bモデルの中でトップクラスの性能を実現しています。Klear-Reasonerの学習の詳細とワークフロー全体は公開されており、推論モデル開発のための重要な参考資料および再現パスを提供しています。

Klear-Reasonerの主な機能

  • 数学的推論Klear-Reasonerは複雑な数学的問題を解くことに優れており、非常に難易度の高い数学コンテストの問題も解くことができます。
  • コード生成と推論高品質なコードを生成でき、LiveCodeBench V5およびV6テストではそれぞれ66.0%および58.1%の精度を達成しています。
  • 長連鎖推論Klear-Reasonerは、複雑で長い思考連鎖タスクを処理できます。長い思考連鎖の教師ありファインチューニング(long CoT SFT)と強化学習(RL)トレーニングによって、多段階推論におけるモデルのパフォーマンスを向上させます。
  • データ品質最適化トレーニング中、Klear-Reasonerは、モデルが正確な推論パターンを学習できるように、高品質のデータソースを優先的に使用し、モデルの探索能力を向上させるために、一部の誤ったサンプルも保持します。

クリアリーズナーの技術原理

  • Long CoT SFT(教師ありファインチューニング)高品質なデータソースを用いた教師ありファインチューニングにより、モデルは正確な推論パターンを学習します。低品質データによるノイズを避けるため、少数の高品質なデータソースを優先的に使用します。特に難易度の高いタスクにおいては、一部の誤ったサンプルを保持することで、モデルの探索能力が向上します。
  • 強化学習(RL)強化学習は、特に数学的およびコーディングタスクにおいて、モデルの推論能力をさらに向上させるために使用されます。報酬の偏りを軽減し、トレーニング効率を向上させるために、テストケースの合格率に基づいて報酬を与えるソフト報酬メカニズムが使用されます。問題のあるテストケースを含むデータはフィルタリングされ、高品質のトレーニングデータが確保されます。
  • GPPO(勾配保存型クリッピングポリシー最適化)アルゴリズム従来のPPOおよびGRPOアルゴリズムでは、クリップ操作によってエントロピーの高いトークンの勾配が破棄されるため、モデルの探索能力が制限され、負のサンプルでは収束が遅延します。一方、GPPOは、ストップ勾配操作に基づいて、クリップ操作を勾配の逆伝播から切り離し、すべてのトークンの勾配を保持します。エントロピーの高いトークンについては、GPPOは勾配を保持し、一定の範囲内に制約します。負のサンプルトークンについては、GPPOは勾配を保持し、一定の範囲内に制約することで、エラー訂正を高速化します。
  • ソフト報酬メカニズムコードタスクの強化学習において、ソフト報酬メカニズム(テストケースの合格率に基づいて報酬を与える)は、ハード報酬(完全合格でスコア、不合格でゼロ)よりも効果的です。ソフト報酬メカニズムは、報酬のスパース性の問題を軽減し、トレーニング信号の密度を高め、勾配推定の分散を低減し、モデルの学習プロセスをより安定かつ効率的にすることができます。

Klear-Reasonerプロジェクトの住所

  • GitHubリポジトリ:https://github.com/suu990901/KlearReasoner/
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Suu/Klear-Reasoner-8B
  • arXiv技術論文:https://arxiv.org/pdf/2508.07629

Klear-Reasonerの応用事例

  • 教育高度な数学チューターとして、このツールは生徒に詳細な問題解決手順と推論プロセスを提供し、ユーザーが数学の知識をより深く理解し、習得できるよう支援します。
  • ソフトウェア開発開発者が機能モジュールを迅速に実装できるよう、高品質なコードスニペットを自動的に生成するだけでなく、コードレビューの提案も提供して、コードの品質と開発効率の向上を支援します。
  • フィンテック財務データを分析してリスク評価や予測を行うことは、金融機関にとって論理的な推論の根拠となり、より正確な意思決定を促進する。
  • 科学研究とデータ分析Klear-Reasonerは、複雑なデータ分析や科学計算タスクを処理でき、研究者に論理的な推論とモデル解釈を提供することで、研究効率の向上に貢献します。
  • インテリジェントな顧客サービス複雑なユーザーの質問に迅速かつ正確に回答し、明確な推論プロセスを提供することで、ユーザーエクスペリエンスと問題解決効率を向上させることができます。