CogVLM2 - Zhipu AI によって発売された新世代のマルチモーダル大規模モデル
CogVLM2は、Zhipu AIが開発した新世代のマルチモーダル大規模モデルです。視覚と言語の理解において大幅な性能向上を実現し、最大8Kのテキスト長と1344×1344ピクセルの画像入力に対応し、強力なテキスト処理機能を備えています。
CogVLM2とは何ですか?
Zhipu AIが開発したCogVLM2は、視覚と言語の理解において大幅な性能向上を実現する次世代マルチモーダル大規模モデルです。最大8Kのテキスト長と1344×1344ピクセルの画像入力に対応し、強力な文書画像理解能力を発揮します。このモデルは、50億パラメータのビジュアルエンコーダと70億パラメータのビジュアルエキスパートモジュールを採用し、深層融合戦略によって視覚と言語のモダリティ間の相互作用を最適化します。これにより、言語処理能力を維持しながら視覚理解能力を向上させています。CogVLM2のオープンソース版は中国語と英語の両方に対応しており、モデルサイズは19億パラメータですが、実際の推論時には約120億パラメータがアクティブ化され、マルチモーダルタスクにおける高い効率性を示しています。
CogVLM2の改良点
CogVLM2モデルは、前モデルと比較して主に以下の点が改善されています。
- パフォーマンスの向上CogVLM2は、OCRbenchやTextVQAなど、いくつかの主要なベンチマークテストにおいて、大幅な性能向上を示しました。例えば、OCRbenchでは32%、TextVQAでは21.9%の性能向上を実現しています。
- 文書イメージの理解CogVLM2は、文書画像の理解力と質問応答能力を向上させ、特にDocVQAベンチマークテストにおいて非常に優れた性能を発揮します。
- 高解像度画像に対応このモデルは最大1344×1344ピクセルの画像解像度をサポートしており、より高解像度の画像を処理することが可能です。
- 長文テキストのサポートCogVLM2は最大8Kのテキスト入力をサポートしており、これによりモデルはより長い文書やより複雑な言語処理タスクを処理できるようになります。
- バイリンガルサポートCogVLM2は、中国語と英語の両方をサポートするオープンソース版モデルを提供しており、モデルの多言語対応機能を強化しています。
CogVLM2モデル情報
CogVLM2は、Meta-Llama-3-8B-Instruct言語ベースモデルに基づいたオープンソース版CogVLM2を2つリリースしました。cogvlm2-llama3-chat-19Bとcogvlm2-llama3-chinese-chat-19Bです。興味のあるユーザーは、GitHub、Hugging Face、またはModaコミュニティからダウンロードまたはオンラインで試用できます。
|
モデル名
|
cogvlm2-llama3-chat-19B
|
cogvlm2-llama3-chinese-chat-19B
|
|
基本モデル
|
Meta-Llama-3-8B-Instruct
|
Meta-Llama-3-8B-Instruct
|
|
言語
|
英語
|
中国語と英語
|
|
モデルサイズ
|
19B
|
19B
|
|
タスク
|
画像理解、対話モデル
|
画像理解、対話モデル
|
|
モデルリンク
|
||
|
エクスペリエンスリンク
|
||
|
Int4モデル
|
まだ発売されていません
|
まだ発売されていません
|
|
テキストの長さ
|
8K
|
8K
|
|
画像解像度
|
1344 * 1344
|
1344 * 1344
|
CogVLM2モデルアーキテクチャ
CogVLM2モデルのアーキテクチャは、前世代モデルをベースに最適化および革新されており、以下の具体的な特徴を備えています。
- ビジュアルエンコーダーCogVLM2は、入力画像の特徴抽出と符号化を担当する、50億個のパラメータを持つビジュアルエンコーダを採用しています。
- ビジュアルエキスパートモジュール70億個のパラメータを持つ視覚エキスパートモジュールが、大規模な言語モデルに統合されています。このモジュールは、独自のパラメータ設定によって、視覚情報と言語情報の相互作用を精緻にモデル化します。
- 深層統合戦略CogVLM2は深層融合戦略を採用しており、視覚と言語のモダリティをより密接に統合することで、言語処理における優位性を維持しながら、モデルの視覚理解能力を向上させている。
- MLP Adapterこのモデルは、MLP(多層パーセプトロン)アダプタを使用して、異なるモダリティ間で特徴を調整および適応させます。
- ダウンサンプリングモジュール高解像度の文書やウェブ画像をより適切に処理・理解するために、CogVLM2はビジュアルエンコーダーの後に専用のダウンサンプリングモジュールを導入し、重要な情報を効果的に抽出し、言語モデルへの入力シーケンス長を削減します。
- Word Embeddingこのモデルには、テキストをモデルが理解できる数値ベクトルに変換する単語埋め込み層が含まれています。
- 複数専門家によるモジュール構造CogVLM2はマルチエキスパートモジュール構造を採用しており、推論時にアクティブ化されるパラメータは約120億個に抑えられています。この設計により、モデルのパフォーマンスと推論効率の両方が向上します。
- 言語ベースモデルCogVLM2は、言語基盤モデルとしてMeta-Llama-3-8B-Instructを使用しており、強力な言語理解および生成機能を備えています。
CogVLM2モデルのパフォーマンス
CogVLM2チームは、TextVQA、DocVQA、ChartQA、OCRbench、MMMU、MMVet、MMBeenなど、さまざまなマルチモーダルベンチマークで定量評価を実施しました。下の表に示すように、CogVLM2の2つのモデルは、モデルサイズが小さいにもかかわらず、複数のベンチマークで最先端(SOTA)のパフォーマンスを達成しました。また、その他のパフォーマンス面でも、クローズドソースモデル(GPT-4VやGemini Proなど)に匹敵するレベルに達しました。
| モデル | オープンソースですか? | モデルサイズ | TextVQA | DocVQA | ChartQA | OCRbench | MMMU | MMVet | MMBench |
|---|---|---|---|---|---|---|---|---|---|
| LLaVA-1.5 | ✅ | 13B | 61.3 | – | – | 337 | 37.0 | 35.4 | 67.7 |
| Mini-Gemini | ✅ | 34B | 74.1 | – | – | – | 48.0 | 59.3 | 80.6 |
| LLaVA-NeXT-LLaMA3 | ✅ | 8B | – | 78.2 | 69.5 | – | 41.7 | – | 72.1 |
| LLaVA-NeXT-110B | ✅ | 110B | – | 85.7 | 79.7 | – | 49.1 | – | 80.5 |
| InternVL-1.5 | ✅ | 20B | 80.6 | 90.9 | 83.8 | 720 | 46.8 | 55.4 | 82.3 |
| QwenVL-Plus | ❌ | – | 78.9 | 91.4 | 78.1 | 726 | 51.4 | 55.7 | 67.0 |
| Claude3-Opus | ❌ | – | – | 89.3 | 80.8 | 694 | 59.4 | 51.7 | 63.3 |
| Gemini Pro 1.5 | ❌ | – | 73.5 | 86.5 | 81.3 | – | 58.5 | – | – |
| GPT-4V | ❌ | – | 78.0 | 88.4 | 78.5 | 656 | 56.8 | 67.7 | 75.0 |
| CogVLM1.1 (Ours) | ✅ | 7B | 69.7 | – | 68.3 | 590 | 37.3 | 52.0 | 65.8 |
| CogVLM2-LLaMA3 (Ours) | ✅ | 8B | 84.2 | 92.3 | 81.0 | 756 | 44.3 | 60.4 | 80.5 |
| CogVLM2-LLaMA3-Chinese (Ours) | ✅ | 8B | 85.0 | 88.4 | 74.7 | 780 | 42.8 | 60.5 | 78.9 |