project
BitCPM-CANN - Wallfacer Intelligenceと清華大学が共同開発した大規模エッジモデル。
BitCPM-CANNは、Wallfacer Intelligence、清華大学、およびOpenBMBオープンソースコミュニティが共同で開発した1.58ビットの3進数大規模モデルです。これは、ファーウェイの国内コンピューティングプラットフォームであるAscend上でエンドツーエンドで完全に学習された、中国初の1.58ビット3進数大規模モデルです。
BitCPM-CANNとは何ですか?
BitCPM-CANNは、Wallfacer Intelligence、清華大学、およびOpenBMBオープンソースコミュニティが共同で開発した1.58ビットの3値大規模モデルです。これは、HuaweiのAscendコンピューティングプラットフォーム上でエンドツーエンドで完全にトレーニングされた、中国初の1.58ビット3値大規模モデルです。このモデルは、0.5Bから8Bまでの4つのサイズを含む量子化対応トレーニングルートを採用し、推論段階で約6倍のGPUメモリの優位性を実現しています。モデルの能力保持率は90.1%~97.2%に達し、国産NPUで完全な低ビットトレーニングスタックを実現したのはこれが初めてです。
BitCPM-CANNの主な機能
-
1.58ビット3進数大規模モデル推論: 本製品は、0.5B、1B、3B、8Bの4つのパラメータ仕様を提供し、エッジデバイス上で効率的に動作します。8Bモデルは、現在主流となっているフラッグシップスマートフォンに容易に導入可能です。
-
国内アセンドフルチェーントレーニングクローズドループ: トレーニングと推論の全プロセスは、事前トレーニングに外部GPUを使用することなく、Huawei Ascendプラットフォーム上でネイティブに実行されます。
-
究極のメモリ解放: 従来のBF16精度と比較して、推論段階で約6倍のGPUメモリを解放し、同じメモリ量でより高度なモデル機能をサポートできます。
-
高精度な比較と評価検証: 常識、読解力、専門知識、数学、推論など11のタスクにおいて、同サイズのMiniCPM4フルプレシジョンモデルと1対1の性能比較を実現している。
-
オープンソースのモデルとトレーニングプラットフォーム: MindSpeed × Megatron-LM に基づくすべてのモデルウェイトと低ビットトレーニングベースは一般に公開されており、開発者がそれらを再現したり、革新したりすることを支援します。
BitCPM-CANNの技術原理
-
定量的認識トレーニング(QAT): このモデルは、初期トレーニング段階で知識を表現するために3値重み(-1、0、+1)を使用するように能動的に学習し、トレーニング完了後に受動的に圧縮されるため、極めて低いビット深度で本質的にネイティブな成長を実現します。
-
3値重みの情報密度を最大化する: ビット幅を1.58に制限することで、各ビットは知識伝達効率を最大化するように強制され、重み精度はビット幅ではなく、各ビットが伝達する知識量に依存するようになる。
-
マインドスピード × メガトロンLMトレーニングベース: 環境適応、32K長シーケンスのサポート、並列戦略、融合演算子システムなどを含む、バックボーンフレームワークに基づいた完全な低ビットトレーニングインフラストラクチャが、Ascendプラットフォーム上に構築されています。
-
国内コンピューティング能力のエンドツーエンドのネイティブ適応: 最下層の量子化演算子やQATアルゴリズムから、完全な並列戦略やトレーニングフレームワークに至るまで、すべてがHuawei Ascend向けにネイティブに開発および最適化されており、統合されたトレーニングと推論を実現しています。
-
体系的で拡張性の高い低ビットパラダイム: 0.5Bから8Bまでのあらゆる規模のデータを用いたエンジニアリング検証により、この低ビットトレーニング手法は、規模を問わず体系性、拡張性、およびエンジニアリング上の再現性を備えていることが実証されました。
BitCPM-CANNの使い方
-
オープンソースモデルの重みを取得する: HuggingFaceにアクセスして、0.5B、1B、3B、8Bの全種類のモデル重量をダウンロードしてください。
-
訓練基地を配備する: Mianbi Intelligenceが開発したMindSpeed × Megatron-LM低ビットトレーニングプラットフォームをベースに、Huawei Ascendプラットフォーム上で環境適応、依存関係のインストール、およびフレームワークの展開が完了しました。
-
エンドサイド推論実行: このモデルの6倍のVRAM容量という利点を活用することで、推論処理を現在の主流のフラッグシップスマートフォンや、VRAM容量が8B以下のPCベースのデバイスで直接実行できます。
-
中等教育におけるイノベーション: QATトレーニングインフラストラクチャとオープンソースコードに基づいて、二次的な微調整、ドメイン適応、または大規模なトレーニングを実行することにより、Ascendプラットフォーム上で低ビットトレーニングを革新することができます。
BitCPM-CANNの主な利点
-
中国国内のコンピューティング能力クローズドループシステムにおける画期的な進歩: Ascend上で初めてエンドツーエンドの1.58ビット学習とフル精度比較評価が実現され、国産チップは推論しか実行できないという固定観念が打ち破られた。
-
業界トップクラスの従業員定着率: 3Bモデルは97.2%という最高の機能維持率を示し、次いで8Bが95.7%、0.5Bが90.1%となっており、体系的な拡張性とエンジニアリングの再現性を示している。
-
トレーニング効率は、類似の方法と比較して著しく優れている。 以前、BitCPM 1BのGPU版は、Microsoft BitNet 2Bのわずか20分の1の計算能力で完全な勝利を収め、その効率性の優位性を証明した。
-
端の天井が大幅に引き上げられた。 ビデオメモリが6倍に増加し、MoEアーキテクチャと組み合わせることで、50B、あるいは100Bものパラメータを持つ超大型モデルを端末にロードできるようになり、エッジAIの機能を全く新しいレベルに引き上げることが期待されます。
BitCPM-CANNプロジェクトのアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/openbmb/bitcpm-cann
BitCPM-CANNと類似製品との比較
| 比較対象寸法 | BitCPM-CANN | マイクロソフト ビットネット |
|---|---|---|
| 開発者 | 壁面インテリジェンス / 清華大学 / OpenBMB | マイクロソフトリサーチ |
| テクニカルルート | 量子化対応トレーニング(QAT) | 3値量子化トレーニング |
| トレーニングプラットフォーム | ファーウェイ・アセンド(国内NPU) | Nvidia GPU |
| 重量精度 | 1.58-bit(-1, 0, +1) | 1.58-bit(-1, 0, +1) |
| 能力維持率 | 90.1%~97.2%(3Bが最高で97.2%) | 同種の完全な精度での比較データは、一般には公開されていない。 |
| トレーニング効率 | 1BはBitNet 2Bのわずか20分の1の計算能力しか使用しない。 | ベンチマーク方式 |
| エンドツーエンドのトレーニング | Ascendネイティブ補完 | GPUネイティブ補完 |
| オープンソースレベル | 幅広い重量範囲とオープンソースのトレーニングプラットフォーム | 部分的にオープンソース |
| エンドサイド値 | 中国における低ビットNPUモデルの供給不足を解消する | 三値量子化に関する研究を促進する |
BitCPM-CANNの応用シナリオ
-
スマートフォンにおけるAI: 限られたメモリでより大規模なパラメータモデルを実行できるようになることで、将来的には携帯電話上で60B規模の大規模モデルを実行できるようになり、端末のインテリジェンスレベルとユーザーエクスペリエンスが直接的に向上することが期待される。
-
国内チップエコシステムを完成させる: Qualcomm Snapdragon 8 Gen 4など、既に2ビット推論をサポートしているエッジチップ向けに高品質なモデル側供給を提供し、ソフトウェアとハードウェアの連携およびエコシステムのクローズドループを実現します。
-
エンタープライズレベルのエッジ展開: これは、PC、自動車、IoTデバイスなどにおける低メモリコストの大規模モデル推論に適しており、世界的なHBMメモリ価格の高騰によって引き起こされるサプライチェーンの圧力に対するヘッジとなる。
-
低ビットトレーニング研究における革新: Ascendプラットフォーム開発者向けに、再利用可能で拡張性の高いQAT(品質保証テスト)の公開インフラストラクチャを提供し、国内のコンピューティング能力に基づいた二次的なトレーニングとイノベーションの微調整を支援する。