project
AReaL-boba - Ant Financialと清華大学が共同でオープンソース化した強化学習トレーニングフレームワーク。
AReaL-bobaは、アリ研究所と清華大学が共同開発したオープンソースの強化学習トレーニングフレームワークです。AReaL-bobaはAReaLのアップグレード版であり、強化学習トレーニングへの参入障壁を下げ、ユーザーが推論モデルを容易にトレーニングできるようにします。
AReaL-bobaとは何ですか?
AReaL-bobaは、Ant Research Instituteと清華大学が共同で開発したオープンソースの強化学習トレーニングフレームワークです。AReaLのアップグレード版であるAReaL-bobaは、強化学習トレーニングへの参入障壁を下げ、ユーザーが推論モデルを容易にトレーニングできるようにします。このフレームワークは、高速なトレーニング速度、多様なコンピューティングリソースのサポート、革新的な最適化によるトレーニングスループットの大幅な向上を誇ります。その7Bモデルは、数学的推論において優れた性能を発揮し、AIMEスコアの新記録を樹立しました。AReaL-bobaは、オープンソースのトレーニングデータ、スクリプト、モデルを提供し、わずか200のデータポイントと32Bモデルで200ドルのコストでQwQ-32Bの推論性能を再現することで、強化学習技術の民主化を促進します。
AReaL-bobaの主な機能
- 高効率トレーニング最適化および改良されたSGLang推論フレームワークに基づき、トレーニングのスループットを大幅に向上させ、小規模から大規模までの分散トレーニングをサポートします。
- 推論能力の向上数学的推論などのタスクにおいて非常に優れた性能を発揮し、7BモデルはAIMEベンチマークテストにおいて同規模のモデルの中で新記録となるスコアを樹立した。
- 低資源トレーニング革新的なデータ蒸留技術に基づき、QwQ-32Bの推論性能を200個のデータポイントで再現できるため、トレーニングコストを削減できます。
- 完全オープンソース再現性を確保し、開発者の利用と改善を容易にするために、完全なコード、データセット、トレーニングスクリプト、評価スクリプトを提供します。
AReaL-bobaの技術原理
- 強化学習強化学習は、報酬信号に基づいてモデルの動作を最適化し、環境との相互作用を通じて最適な戦略を学習します。言語モデルにおいては、強化学習はモデルの生成能力を最適化するために用いられ、特定のタスクにおけるパフォーマンス向上につながります。
- SGLang推論フレームワークの統合AReaL-bobaは、SGLang推論フレームワークを完全に統合した初のオープンソース学習システムです。SGLangは効率的な推論機能を提供し、学習プロセスにおける計算効率を最適化します。
- エンジニアリング最適化トレーニング処理において、並列計算やメモリ管理など、複数のエンジニアリング最適化を実施し、トレーニングのスループットを向上させた。その結果、様々なモデルサイズにおいて、トレーニング速度の大幅な改善が達成された。
- データ蒸留技術革新的なデータ抽出手法に基づき、大量のデータから重要な情報を抽出し、トレーニングデータを効率化する。
AReaL-bobaプロジェクトの住所
- GitHubリポジトリ:https://github.com/inclusionAI/AReaL
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/inclusionAI/areal-boba
AReaL-bobaの応用シナリオ
- 数学的推論と教育生徒が複雑な数学的問題を解決するのに役立つ、高度な教育ツールを開発する。
- 自然言語処理タスクテキスト生成、質問応答システム、機械翻訳などの性能を向上させる。
- インテリジェントエージェント開発ゲームやロボット制御などの分野におけるインテリジェントエージェントの訓練に用いられる。
- 低リソースモデルのトレーニングデータリソースが限られた環境に適しており、効率的なモデル学習を可能にする。
- 学術研究と地域社会との連携研究ツールとして、学術交流と技術共有を促進する。