MiniCPM 4.0 - Wallfacer Intelligence社製のオープンソースで超効率的な大規模エッジモデル
MiniCPM 4.0は、Wallfacer社が開発した大規模なエッジサイドモデルです。このモデルは、8Bと0.5Bの2つのパラメータスケールで提供されます。8Bのライトニングスパースバージョンは革新的なスパースアーキテクチャを採用し、長文テキスト処理を効率的に行うことができます。一方、0.5Bバージョンは少ない計算リソースで動作します。
MiniCPM 4.0とは何ですか?
MiniCPM 4.0は、Mianbi Intelligenceが発表した超高効率のエッジサイド大規模モデルです。このモデルは、8Bと0.5Bの2つのパラメータスケールで提供されます。8Bの高速スパースバージョンは革新的なスパースアーキテクチャを採用し、長文テキスト処理を効率的に行うことができます。一方、0.5Bバージョンは、計算リソースの消費量が少なく、高いパフォーマンスを発揮します。独自開発のCPM.cu推論フレームワークは、極端なシナリオでは最大220倍、通常の条件下では5倍の高速化を実現します。MiniCPM 4.0は、vLLM、SGLang、LlamaFactoryなどのオープンソースフレームワークへの展開をサポートし、Intel、Qualcomm、MTK、Huawei Ascendなどの主要チップと互換性があります。
MiniCPM 4.0 オープンソースモデルコレクション
MiniCPM4-8B:MiniCPM4のフラッグシップモデルで、80億個のパラメータを持ち、8Tトークンで学習されています。
MiniCPM4-0.5B:MiniCPM4の小型版で、パラメータ数は5億、学習データは1Tトークン。
MiniCPM4-8B-Eagle-FRSpec: MiniCPM4-8Bにおける投機的推論を高速化するFRSpec用のEagleヘッダー。
MiniCPM4-8B-Eagle-FRSpec-QAT-cpmcu: QATでトレーニングされたFRSpecのEagleヘッドを使用して、推論と量子化を効率的に組み合わせ、MiniCPM4-8Bの超高速化を実現します。
MiniCPM4-8B-Eagle-vLLMvLLM形式のEagleヘッダーは、MiniCPM4.8Bにおける推測的推論を加速させる。
MiniCPM4-8B-marlin-Eagle-vLLM: MiniCPM4-8Bにおける投機的推論を高速化する、量子化されたvLLMフォーマットのEagleヘッダー。
BitCPM4-0.5B:極値の応用三値量子化MiniCPM4-0.5Bでは、モデルパラメータが3進数値に圧縮され、ビット幅が90%削減されています。
BitCPM4-1B: MiniCPM3-1Bに極値三値量子化を適用することで、モデルパラメータを三値に圧縮し、ビット幅を90%削減します。
MiniCPM4-Survey:MiniCPM4-8Bをベースに、ユーザーからのクエリを入力として受け取り、信頼性の高い長文の調査レポートを自動的に生成します。
MiniCPM4-MCP:MiniCPM4-8Bをベースに、ユーザーからのクエリと利用可能なMCPツールを入力として受け取り、ユーザーのニーズを満たすために関連するMCPツールを自動的に呼び出します。
MiniCPM 4.0の主な機能
-
高効率二周波シフト機構MiniCPMバージョン4.0-8Bは、タスクの特性に基づいてアテンションモードを自動的に切り替えることができます。長文を処理する場合は、計算の複雑さを軽減するためにスパースアテンションを有効にし、短文を処理する場合は、精度を確保するためにデンスアテンションに切り替えます。
-
究極の推論速度向上独自開発のCPM.cu推論フレームワークにより、極端なシナリオでは最大220倍、通常のシナリオでは5倍の高速化を実現しています。
-
モデルのスリム化と効率的な展開革新的なスパースアーキテクチャと超低ビット幅量子化技術を採用することで、優れたパフォーマンスを維持しながらモデルサイズを90%削減します。vLLM、SGLang、LlamaFactoryなどのオープンソースフレームワークへの展開をサポートしています。
-
エンドサイド推論の最適化本製品は、自社開発の超高速エッジ推論フレームワーク「CPM.cu」を内蔵しており、投機的サンプリング、モデル圧縮と量子化、エッジ展開フレームワークにおける革新により、モデルサイズと処理速度を90%削減します。
-
マルチプラットフォーム対応Intel、Qualcomm、MTK、Huawei Ascendといった主流のチップと互換性があり、様々なエッジデバイス上でスムーズに動作します。
-
複数のバージョンが利用可能ですさまざまなシナリオのニーズに対応するため、8Bと0.5Bの2種類のパラメータスケールを備えたバージョンを提供しています。
MiniCPM 4.0の技術的原則
-
スパースアテンションメカニズムMiniCPM 4.0-8Bは、革新的な学習可能なスパースアテンションメカニズム(InfLLM v2)を採用しており、長文テキストを処理する際に、各トークンが他のトークンの5%未満との関連性計算を実行するだけで済むため、長文テキスト処理の計算オーバーヘッドを大幅に削減します。
-
高効率デュアル周波数シフトタスクの特性に基づいて、アテンションモードを自動的に切り替えます。長いテキストを処理する場合は、計算の複雑さを軽減するためにスパースアテンションを有効にし、短いテキストを処理する場合は、精度を確保するためにデンスアテンションに切り替えます。
-
モデル風洞2.0高度な下流タスクスケーリング予測手法の導入により、最適なモデルトレーニング構成をより正確に探索および決定することが可能になります。
-
BitCPMこれは究極の三値量子化技術を実現し、モデルパラメータのビット幅を90%以上圧縮することで、優れた性能を維持しながらモデルを大幅に「スリム化」します。
-
高効率トレーニングプロジェクト本手法は、FP8低精度演算技術を全面的に採用し、マルチトークン予測学習戦略と組み合わせることで、学習効率をさらに向上させています。
-
独自開発の推論フレームワークMiniCPM 4.0は、独自開発のCPM.cu超高速エッジ推論フレームワークを組み込んでおり、投機的サンプリング、モデル圧縮と量子化、エッジ展開フレームワークにおける革新により、モデルサイズと速度を90%削減します。
MiniCPM 4.0プロジェクトのアドレス
- GitHubリポジトリ:https://github.com/OpenBMB/MiniCPM
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/openbmb/minicpm4
- 技術報告書:https://github.com/OpenBMB/MiniCPM/blob/main/report/MiniCPM_4_Technical_Report.pdf
MiniCPM 4.0の適用シナリオ
-
インテリジェントな個別指導システムMiniCPM 4.0は、インテリジェントな個別指導システムの中核として機能します。自然言語処理技術を通して、生徒の質問を理解し、詳細な回答と説明を提供することで、生徒が知識をより深く理解し、習得できるよう支援します。
-
症例分析と診断支援MiniCPM 4.0は、自然言語処理技術を用いて診療記録の内容を理解し、医師に診断に関する提案や参考情報を提供することで、医師の症例分析を支援し、診断の精度と効率を向上させることができます。
-
医学文献検索これは、医師や研究者が関連する医学文献や研究結果を迅速に検索するのに役立ち、正確な文献の推奨と要約を提供することで、時間と労力を節約します。
-
インテリジェントな顧客サービス金融顧客サービスの核となる部分として、顧客からの問い合わせに迅速かつ正確に対応し、パーソナライズされたサービスとソリューションを提供し、顧客満足度を向上させることが不可欠です。
-
ゲームストーリー生成MiniCPM 4.0は、ゲーム設定やプレイヤーの行動に基づいて、豊富で多様なゲームストーリーやタスクを自動的に生成し、ゲームの面白さとリプレイ性を向上させます。