project
BlueLM-V-3B - ViVoが香港中文大学と共同で開発したアルゴリズムおよびシステム協調設計手法。
BlueLM-V-3Bは、vivo AI Labと香港中文大学MMLabが共同開発したアルゴリズムとシステム協調設計手法です。モバイルデバイスへのマルチモーダル大規模言語モデル(MLLM)の効率的な展開をサポートします。モデルのサイズは小さく(2.7B)、...
BlueLM-V-3Bとは何ですか?
BlueLM-V-3Bは、vivo AI Labと香港中文大学MMLabが共同開発したアルゴリズムとシステム協調設計手法です。モバイルデバイスへのマルチモーダル大規模言語モデル(MLLM)の効率的な展開をサポートします。このモデルは、小型サイズ(言語パラメータ27億、視覚パラメータ4億)、高速処理速度(生成速度24.4トークン/秒)、そして高いパフォーマンス(OpenCompassベンチマークスコア66.1)を特徴としています。最適化された動的解像度スキームとハードウェアを考慮した展開により、モバイル端末上でのモデルの推論効率とパフォーマンスを向上させます。
BlueLM-V-3Bの主な機能
- マルチモーダルな理解テキストや画像など、さまざまなデータ形式を処理・統合することで、より豊かなインタラクションとより深い文脈理解を実現します。
- リアルタイム処理モバイルデバイス上でのリアルタイム応答を可能にし、拡張現実やリアルタイム翻訳など、迅速なフィードバックが求められるシナリオに適しています。
- プライバシー保護デバイス上でのローカル処理をサポートすることで、データ転送量を削減し、ユーザーのプライバシー保護を強化します。
- 高効率な展開モバイルデバイスの計算能力とメモリ容量の制限に適応するようにモデルを最適化し、リソースが限られたハードウェア上でも効率的な動作を保証する。
- 高性能パラメータ数が比較的少ないモデルで、より多くのパラメータを持つモデルと同等の性能を実現する。
- 多言語能力多言語理解をサポートし、さまざまな言語環境におけるモデルの適用性を向上させる。
BlueLM-V-3Bの技術原理
- アルゴリズム設計:
- 動的解像度処理: 高解像度画像の理解に対応し、画像トークンの数を減らし、展開の複雑さを軽減するために、動的な画像解像度戦略を再設計する。
- 緩やかなアスペクト比マッチング方法パラメータαを導入することで、より適切なアスペクト比を選択できるようになり、画像の拡大率を低減し、トレーニングと展開の効率を最適化できる。
- システム設計:
- バッチ画像エンコードNPUの並列処理機能を利用して画像パッチをバッチ処理することで、画像エンコード処理を高速化する。
- パイプライン並列処理画像エンコード処理において、Conv2D演算の実行遅延を隠蔽するために、パイプライン並列処理が設計されている。
- トークンのダウンサンプリング情報の統合と融合に基づいて、NPUの処理能力に合わせて画像トークンの数を削減します。
- ブロック計算長い入力トークンを処理するために、並列処理とNPUのパフォーマンスのバランスを取るブロックベースの戦略が採用されています。
- モデル量子化モデルの重みをINT8およびINT4の精度で量子化する一方で、LLM活性化のINT16精度とViT活性化のFP16精度を維持することで、計算効率とモデル精度とのバランスを取っています。
- 全体的な枠組みViTモデルとLLMモデルはモデル初期化時に同時にロードされ、ユーザーが画像をアップロードするとすぐに処理が開始されます。コマンドを同時に入力できるため、応答速度とメモリ使用効率が向上します。
BlueLM-V-3Bプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2411.10640
BlueLM-V-3Bの応用事例
- 拡張現実(AR)スマートフォンのカメラを使って現実世界の物体を識別し、関連情報を提供するなど、モバイルデバイス上でリアルタイムの拡張現実体験を提供する。
- リアルタイム翻訳異言語間コミュニケーションにおいて、テキストを音声や画像にリアルタイムで翻訳することで、ユーザーが言語の壁を克服するのを支援します。
- 教育支援学習ツールとして、複雑な概念を学生が理解するのに役立ち、画像とテキストを用いたインタラクティブな学習体験を提供します。
- 視覚的質問応答(VQA)ユーザーは、自分が撮影またはアップロードした写真に基づいて、画像の内容について質問することができ、モデルは正確な回答を提供する。
- 画像と文書の理解オフィスオートメーションにおいては、画像や文書の内容を理解し処理することが含まれ、例えば請求書や契約書などの文書情報を自動的に認識することなどが挙げられる。