project
MiniCPM-SALA - Wallfacerのオープンソース9Bエッジモデル
MiniCPM-SALAは、Wallfacer Intelligence社が開発した9Bエッジサイド大規模モデルで、革新的なSALA(スパース・リニアハイブリッドアテンション)アーキテクチャを採用しています。アテンションの75%は線形であり、効率的なグローバルモデリングを処理し、残りの25%はスパースであり、重要な情報を正確に捉えます。
MiniCPM-SALAとは何ですか?
MiniCPM-SALAは、Wallfacer Intelligenceがオープンソース化した、エッジサイド向けの90億規模の大規模モデルです。革新的なSALA(Sparse-Linear Hybrid Attention)アーキテクチャを採用しており、75%の線形アテンションで効率的なグローバルモデリングを、25%のスパースアテンションで重要な情報を正確に捉えます。ハイブリッド位置エンコーディング(HyPE)を導入することで、長文と短文のシームレスな切り替えを実現しています。このモデルは、RTX 5090などのコンシューマー向けグラフィックカード上で初めて数百万レベルのコンテキスト推論を、低メモリ使用量と高速な推論速度で実現し、エッジエージェントが長文テキスト処理機能を実装するための実現可能な道筋を提供します。
MiniCPM-SALAの主な機能
-
数百万件規模の長文テキスト処理100万個以上のトークンを含むコンテキストをサポートし、初めてRTX 5090コンシューマー向けグラフィックカード上で100万個の長さの推論を実行しました。
-
高効率な推論処理の高速化256Kシーケンスに対する推論において、同サイズの高密度モデルと比較して3.5倍の高速化を実現します。
-
ビデオメモリ使用量が少ないKVキャッシュを最適化することで、512Kから1Mの長さでもOOM(メモリ不足)を起こさずに安定して動作させることができます。
-
長文と短文の互換性このモデルは、短いテキストに関してはQwen3-8Bと同等の汎用性を維持しており、長いテキストに関しては大きな利点がある。
-
エッジ展開の最適化携帯電話、自動車、ロボットなどの端末機器向けに特別に設計されており、ローカライズされたロングコンテキストエージェントを実現する。
MiniCPM-SALAの技術原理
- SALAハイブリッドアテンションアーキテクチャこの手法は、75%の線形アテンション(Lightning Attention)と25%のスパースアテンション(InfLLM v2)を階層的に組み合わせたものです。前者はO(N)の計算量でグローバルモデリングを行い、後者は必要に応じて重要なローカル情報を計算することで、効率性と精度のバランスを実現しています。
- HyPEハイブリッド位置エンコーディング線形層は短いテキストのパフォーマンスを維持するためにRoPEを保持し、一方、疎層はNoPEを使用してKVキャッシュをロケーションから切り離し、長距離減衰を回避し、数百万のコンテキストの効率的な取得をサポートします。
- HALO低コスト移住パラメータ変換、隠れ状態のアライメント、層の選択、知識の蒸留という4つのステップを用いることで、完全なアテンションモデルをハイブリッドアーキテクチャに移行し、トレーニング予算を新規事前トレーニングに必要な予算の25%に削減します。
MiniCPM-SALAプロジェクトの住所
- GitHubリポジトリ:https://github.com/openbmb/minicpm
- ハギングフェイスモデルライブラリ:https://huggingface.co/openbmb/MiniCPM-SALA
MiniCPM-SALAの応用シナリオ
-
パーソナルインテリジェントアシスタントローカルデバイス上に数百万件ものチャットログと個人の好みを継続的に保存することで、真に「理解力のある」プライベートなパーソナルアシスタントを作り出す。
-
エンド側の知識ベース数百万語を収録したオフライン文書ライブラリを基盤として、企業の機密データのローカライズニーズを満たす専門的なQ&Aサービスを提供します。
-
コード開発アシスタントこれにより、コードリポジトリ全体のコンテキストを一度に把握できるため、ファイル間のデバッグや複雑なリファクタリング作業が容易になります。
-
車載インテリジェントシステム車両マニュアル、ナビゲーション履歴、ユーザーの運転習慣を統合し、オフラインの車内環境でパーソナライズされた運転サービスを提供する。
-
科学文献分析このモデルは、膨大な量の学術論文を迅速に処理し、文書間の相関情報を抽出して、レビュー論文の執筆を支援することができる。