project
アブソリュートゼロ ― 清華大学などが開発した言語モデル推論訓練手法。
Absolute Zeroは、清華大学LeapLabチームが北京総合人工知能研究所(NLCo)およびペンシルベニア州立大学と共同で開発した、新しい言語モデル推論トレーニング手法です。Absolute Zeroは、モデルに基づいています...
絶対零度とは何ですか?
Absolute Zeroは、清華大学のLeapLabチーム、北京総合人工知能研究所(NLCo)の研究室、およびペンシルベニア州立大学による共同プロジェクトです。Absolute Zeroは、斬新な言語モデル推論トレーニング手法を提案します。この手法により、モデルは自律的にタスクを提案・解決し、人間がラベル付けしたデータや事前定義されたタスクに頼ることなく、自己進化的な学習を実現します。モデルは、タスクを提案することで学習可能な報酬を、タスクを解決することで解決報酬を受け取り、環境との相互作用を通じて推論能力を継続的に最適化します。Absolute Zeroの中核は、推論モデルを人間による監視型学習から環境による監視型学習へと移行させることにあります。これにより、モデルは現実世界の環境からのフィードバックに基づいて検証可能なタスクを生成し、パフォーマンスを向上させることができます。
絶対零度の主な機能
- タスクの自己生成このモデルは、単純すぎず複雑すぎない学習可能なタスクを自律的に提案し、モデルに効果的な学習シグナルを提供する。
- 課題の自己解決このモデルはソルバーとして機能し、提案または生成したタスクを解決しようと試み、環境からのフィードバックに基づいて解決策の正しさを検証する。
- 推論能力の向上課題が継続的に提案され解決されるにつれて、モデルの推論能力(帰納、演繹、アブダクションなど)は継続的に向上する。
- ドメイン横断的な一般化このモデルは、自己学習によって獲得した汎用的な推論能力を活用し、新たなタスクや領域へと応用する。
- データゼロトレーニングこれは、手動でラベル付けされたデータや人間の設計に依存するのではなく、環境との相互作用とフィードバックに基づいて学習するタスクです。
絶対零度の技術的原理
- 二つの役割を担う模範的人物このモデルは、タスク提案者とタスク解決者の両方の役割を同時に果たします。提案者がタスクを生成し、解決者がそのタスクを解決しようとします。両者はモデルパラメータを共有し、同期的に最適化を行います。
- 環境フィードバック機構このモデルは、タスクの解決可能性に関するフィードバックを提供する環境(コード実行環境など)と相互作用します。提案されたタスクは、タスクの難易度とモデルの解決成功率に基づいて学習可能性報酬を受け取り、解決されたタスクは、解決の正しさに基づいて解決報酬を受け取ります。
- 強化学習の最適化強化学習アルゴリズム(TRR++など)を用いてモデルパラメータを最適化し、学習可能性報酬と解決報酬を組み合わせることで、複数のタスクの下で自己進化学習を実現する。
- 推論モードのサポート本モデルは、演繹、アブダクション、帰納という3つの基本的な推論モードをサポートしています。それぞれの推論モードは異なるタスクタイプに対応しており、モデルはこれらのタスクを解決することで特定の推論能力を向上させます。
- 自己ゲーム閉ループこのモデルは、環境からのフィードバックに基づいて戦略を更新しながら、新しい課題を継続的に提案・解決し、閉ループ型の自己学習プロセスを形成します。この閉ループ機構により、外部データによるサポートを必要とせずに、モデルの能力を継続的に最適化することが可能になります。
アブソリュートゼロのプロジェクトアドレス
- プロジェクト公式サイト:https://andrewzh112.github.io/absolute-zero-reasoner/
- GitHubリポジトリ:https://github.com/LeapLabTHU/Absolute-Zero-Reasoner
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/andrewzh/absolute-zero-reasoner
- arXiv技術論文:https://www.arxiv.org/pdf/2505.03335
絶対零度の応用シナリオ
- 汎用人工知能(AGI)モデルの自律的な学習と進化を促進し、徐々に人間の知能レベルに近づけることを目指す。
- コード生成効率的なコードを自動生成し、複雑なプログラミング問題を解決し、開発効率を向上させます。
- 数学的推論数学的問題に対するモデルの一般化能力を高め、数学教育と研究を支援する。
- 自然言語処理(NLP)自己学習を通じて言語理解力と言語生成能力を向上させ、テキスト生成システムと質問応答システムを最適化します。
- 安全と倫理システムの安全性と倫理的遵守を確保しながら、AIの自律的な進化における行動パターンを研究する。