project
Colibrì - 推論のための階層型ストレージを備えた、オープンソースの軽量ローカル推論エンジン。
Colibrìは、オープンソースの軽量ローカル推論エンジンであり、25GBのRAMを搭載した一般消費者向けコンピュータ上で、744個のパラメータを持つ主力モデルであるGLM-5.2 MoEを実行できます。このモデルは、階層型ストレージアーキテクチャを使用して、常駐パラメータをメモリに保持します。
Colibrìとは何ですか?
Colibrìは、オープンソースの軽量ローカル推論エンジンであり、25GBのRAMを搭載した一般消費者向けコンピュータ上で、744Bのパラメータを持つ主力モデルであるGLM-5.2 MoEを実行できます。このモデルは階層型ストレージアーキテクチャを採用しており、常駐パラメータをメモリに保持し、大規模なルーティングエキスパートパラメータをNVMeディスクに保存して必要に応じてロードすることで、モデル全体を高速メモリにロードする必要があるという従来の制約を打破しています。
Colibrìの主な機能
- 階層型ストレージ推論専門家のパラメータは、GPUメモリ、システムメモリ、NVMeハードドライブという3つのレベルのストレージに分散され、必要に応じて動的にロードされるため、メモリ容量の制限を克服できます。
- 超大規模モデルの局所展開744BパラメータをサポートするフラッグシップモデルであるGLM-5.2 MoEは、25GBのメモリを搭載した一般消費者向けPC上で動作します。
- int4量子化圧縮int4によって量子化された後の常駐パラメータは、約9.9GBの常駐メモリに相当します。ルーティングエキスパートパラメータ370GBは、ローカルハードドライブに保存されます。
- 純粋なC言語によるストリーミングCPU推論外部依存関係が一切ない軽量エンジンであり、ストリーミングロードによってエキスパートパラメータの動的なスケジューリングを実現し、モデル全体を高速メモリにロードする必要性をなくします。
- ウェブビジュアルコントロールパネルTTFT、スループット、キューの状態など、推論パフォーマンス指標をリアルタイムで表示するためのチャットインターフェースを内蔵しています。
- エキスパートルーティングブレインビューBrainページでは、76層×256のエキスパートマトリックスを使用してルーティングヒートマップとストレージ階層を表示します。エキスパートのトピック設定にマウスカーソルを合わせると、そのエキスパートの設定が表示されます。
コリブリの技術原則
- MoEスパース活性化利用GLM-5.2は合計744Bのパラメータを持ち、トークンごとに約40Bがアクティブ化されます。Colibrìはこのスパース性を利用して、固定パラメータをメモリに常駐させ、ルートに応じて変化するエキスパートパラメータのみを必要に応じてロードします。
- 階層型ストレージアーキテクチャこのモデルは、約9.9GBの常駐パラメータと約370GBのルーティングエキスパートに分割されており、それぞれメモリとNVMeハードドライブに格納され、ビデオメモリ/メモリ/ディスクの3階層ストレージプールを形成します。
- エキスパートストリーミング21,504 個のルーティングエキスパートが、ルーター選択に基づいて推論中にディスクから動的にストリーミングします。
- LRUとラーニングキャッシュ各レイヤーは、ホットエキスパートを保持するために独立したLRUキャッシュで構成されています。同時に、キャッシュを学習してセッション間の使用履歴を記録することで、使用頻度の高いエキスパートが優先的にメモリに固定され、ディスクI/O操作の回数が削減されます。
- ルーター先読みプリフェッチ現在の層のアテンション状態に基づいて、次の層に必要な専門家が予測されます。これは、専用のI/Oスレッドを使用して、現在の層での計算中に専門家の情報を非同期的にプリフェッチすることで実現されます。
WILLNEEDシステムコールは読書を加速させる。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Colibrìの使い方
- 環境準備LinuxまたはWSL2システム、AVX2をサポートするx86-64 CPU、GCCコンパイラ、最低16GBのメモリ、および約400GBの空き容量を持つローカルNVMe SSDが必要です。
- エンジンのソースコードを取得する:埋め込む
git clone https://github.com/JustVugg/colibriリポジトリをクローンし、colibri/cディレクトリの後に実行./setup.shワンクリックでコンパイルを完了し、依存関係が一切ない純粋なC言語の実行可能ファイルを生成します。 - 変換前のモデルをダウンロードハギングフェイスのリポジトリより
jlnsrk/GLM-5.2-colibri-int4int4量子化モデルコンテナをダウンロードし、ローカルのNVMeハードドライブに保存してください。 - 地域対話を開始するモデルパスを設定した後に実行します
COLI_MODEL=/nvme/glm52_i4 ./coli chat初期ロード時間は約30秒、常駐メモリサイズは約9.9GBです。端末上でGLM-5.2と連携できます。 - APIサービスを開始します:埋め込む
COLI_MODEL=/nvme/glm52_i4 ./coli serve --host 0.0.0.0 --port 8000OpenAIプロトコルをサポートするクライアントであればどれでも直接アクセスできる、OpenAI互換のHTTPサービスを開始します。 - WindowsネイティブコンパイルWindows 11ユーザーは、MinGW-w64またはMSYS2を介してGCCをインストールできます。
c/ディレクトリ実行make glm.exeネイティブ実行可能ファイルをコンパイルします。
Colibrìの主な利点
- フラッグシップモデルを実行する一般消費者向けハードウェア従来、744Bパラメータを持つGLM-5.2はサーバークラスタに展開する必要があるという制約がありましたが、GLM-5.2は25GBのメモリとNVMeハードドライブのみでローカルに実行できます。
- 純粋なC言語、依存関係なし、極めて軽量エンジン全体は純粋なC言語で記述されており、外部ライブラリやランタイムに依存せず、コンパイル時の出力が非常に小さく、起動も高速です。
- 階層型ストレージのインテリジェントなスケジューリング独自の3段階エキスパートキャッシュシステム(ビデオメモリ/RAM/ハードディスク)を搭載しており、LRUと学習キャッシュを組み合わせることで、使用頻度の高いエキスパートをメモリに常駐させ、使用頻度の低いエキスパートを必要に応じてディスクからストリーミング配信します。
- ルーター先読みプリフェッチの高速化現在のレイヤーの状態に基づいて、次のレイヤーに必要な専門家を70%以上の精度で予測します。また、非同期I/Oスレッドを使用して計算間隔中にプリフェッチを実行することで、ディスク読み取りの遅延を大幅に削減します。
- int4量子化と手書きカーネルグローバルなint4量子化により、744Bモデルは約380GBのディスク容量に圧縮されます。AVX2手書き整数ドット積カーネルと組み合わせることで、BLASに依存することなく効率的な推論が可能になります。
- MLA KVキャッシュ 極限圧縮KV-Cacheはトークンあたりわずか576個の値しか使用しないため、従来のソリューションの約1/57となり、長いコンテキストのメモリ使用量を大幅に削減し、永続的なリカバリをサポートします。
Colibrìのプロジェクト住所
- GitHubリポジトリ:https://github.com/JustVugg/colibri
Colibrìの類似競合製品の比較
| 寸法 | Colibrì | KTransformers |
|---|---|---|
| コアポジショニング | 依存関係がゼロで、純粋なC言語アーキテクチャを採用した、大規模なMoE階層型ストレージ推論エンジン。 | 清華大学が開発した、CPUとGPUが混在するMoE推論および微調整フレームワーク。 |
| 最大モデルサポート | 744B GLM-5.2(25GB RAM + NVMeで動作可能) | 671B DeepSeek-R1 / 1TB + Kimi-K2.5(大容量メモリとオプションのGPUが必要) |
| 専門家によるスケジュール戦略 | ビデオメモリ/メインメモリ/ディスクの3層ストリーミング + ルーター先読みプリフェッチ | CPU-GPU周波数を考慮した配置 + 動的再割り当て + 3層プレフィックスキャッシュ |
| ハードウェアしきい値 | CPU単体で十分です。最低要件は25GBのRAMとNVMe SSDです。 | 推奨構成:大容量メモリ搭載ワークステーション+一般消費者向けGPU;CPUはAVX2/AMX対応であること。 |
| 量への依存性 | 純粋なC言語、依存関係なし、極めて軽量 | Python + PyTorch + CUDA、比較的重い |
| 定量的サポート | グローバルint4 + 手書きAVX2カーネル | FP8 / BF16 / INT8 / INT4 / GGUF 多段階量子化 |
| 視覚化 | 大脳皮質レベルでのエキスパートルートヒートマップ | 基本的な監視パネルとログ |
| 微調整機能 | 推論のみ | LLaMA-Factoryと統合されたLoRA SFT微調整のネイティブサポート |
Colibri の応用シナリオ
-
個人向けローカル展開フラッグシップ大型モデルサーバー予算のない開発者でも、自宅のコンピューターで744BパラメータGLM-5.2の推論機能をすべて体験できます。
-
エッジデバイス向けオフライン推論ネットワーク接続のない環境におけるインテリジェントな意思決定ニーズを満たすため、メモリ容量に制約のある産業用PCやエッジボックス上で、超大規模なMoEモデルを実行します。
-
モデル性能の迅速な予備調査これにより、高額なクラウド リソースを申請することなく、特定の業務タスクにおける超大規模モデルの実際のパフォーマンスを検証できます。
-
プライバシーに配慮したデータ処理医療、金融、行政などの分野では、データはプロセス全体を通して完全にローカルに保持され、厳格なデータプライバシーコンプライアンス要件を満たします。
-
教育省のメカニズム教育と研究低コストの研究専門家ルーティング、階層型キャッシング、および定量的推論技術は、大学における教室でのデモンストレーションや学術論文の実験を容易にする。