project
TinyR1-Preview - Qihoo 360と北京大学が共同開発した推論モデル。
TinyR1-Previewは、北京大学コンピュータサイエンス学部と360 Security Technology Inc.が共同開発した32バイトの推論モデルです。パラメータのわずか5%を使用するだけで、Deepseek-R1-671Bの性能に匹敵します。TinyR1-Previewは、数学分野において大きな利点を持っています。
TinyR1-Previewとは何ですか?
TinyR1-Previewは、北京大学コンピュータ科学技術学部と360 Security Technology Inc.が共同開発した32バイトの推論モデルです。パラメータのわずか5%を使用するだけで、Deepseek-R1-671Bの性能に匹敵します。数学領域(AIMEスコア78.1)では、TinyR1-PreviewはオリジナルのR1(79.8ポイント)に近く、70バイトのDeepseek-R1-Distill-Llama(70.0ポイント)をはるかに上回ります。TinyR1-Previewは、「分割統治融合」戦略に基づいており、数学、プログラミング、科学の3つの垂直領域ごとにモデルを個別にトレーニングします。その後、Mergekitツールを使用してインテリジェントな融合を実現し、性能の限界を突破します。
TinyR1-Previewの主な機能
- 優れた数学的推論能力複雑な数学問題(AIME 2024など)に優れており、非常に難しい数学問題を迅速かつ正確に解くことができます。
- 非常に効率的なプログラミング支援ツールコード生成とデバッグをサポートしており、開発者が問題を迅速に解決し、プログラミング効率を向上させるのに役立ちます。
- 科学的な質問への回答複雑な科学的問題の処理を支援し、正確な回答と説明を提供します。
- 軽量展開必要なパラメータはわずか32バイトであるため、大規模モデルと比較して推論コストが低く、リソースが限られた状況に適しています。
TinyR1-Previewの技術的原理
- 分割統治戦略DeepSeek-R1によって生成された膨大なドメインデータに基づいて、数学、プログラミング、科学などの垂直ドメイン向けにサブモデルがトレーニングされ、各サブモデルは特定のドメイン内のタスクに焦点を当てています。
- インテリジェントな統合ArceeチームのMergekitツールをベースに、異なるドメインのサブモデルをインテリジェントに統合することで、単一モデルのパフォーマンス限界を打破し、複数のタスクにわたるバランスの取れた最適化を実現します。
- 蒸留技術モデル蒸留法に基づき、大規模モデルからの知識をより小規模なモデルに転送することで、元のR1モデルの95%以上の性能を、わずか5%のパラメータで達成する。
- トレーニングを最適化するTinyR1-Previewは、ドメインデータのトレーニングとインテリジェントな融合に基づいて、軽量性を維持しながら推論効率とパフォーマンスを大幅に向上させ、迅速な展開とアプリケーションに適しています。
TinyR1-プレビュープロジェクトのアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/qihoo360/TinyR1-32B-Preview
TinyR1-Previewのアプリケーションシナリオ
- 教育問題解決戦略とコード生成機能を提供することで、数学学習とプログラミング教育を支援します。
- 科学研究と学術これは、研究者が科学的な疑問に答え、実験を設計し、データを分析するのに役立ちます。
- ソフトウェア開発コードの生成、アルゴリズムの最適化、開発効率の向上を実現します。
- エンタープライズアプリケーションデータ分析とプロセス最適化をサポートし、企業の意思決定を支援します。
- 私生活インテリジェントアシスタントとして、知識検索と学習支援を提供します。