project
Granite 3.2 - IBMのオープンソース・マルチモーダルAIモデルスイート
Granite 3.2は、IBMのオープンソースのマルチモーダルAIモデルファミリーであり、強力な推論、視覚理解、および予測機能を備えています。Granite 3.2には複数のバージョンがあり、Granite 3.2 Instructは実験的な連鎖推論機能を提供します。
Granite 3.2とは何ですか?
Granite 3.2は、IBMのオープンソースのマルチモーダルAIモデルファミリーであり、強力な推論、視覚理解、および予測機能を誇ります。Granite 3.2には複数のバージョンがあります。Granite 3.2 Instructは、実験的な連鎖推論機能を提供し、複雑な命令実行のパフォーマンスを大幅に向上させます。Granite Vision 3.2 2Bは、ドキュメント理解に焦点を当てた最初のビジュアル言語モデルであり、大規模モデルに匹敵するパフォーマンスを実現します。Granite 3.2では、スパース埋め込みモデルとより効率的なGuardianモデルが導入され、リソース利用率とセキュリティが最適化されています。
Granite 3.2の主な特徴
- 推論能力Granite 3.2 Instructは、推論機能を強化し、複雑な命令の実行をサポートします。
- マルチモーダルな理解Granite Vision 3.2 2Bは、文書理解に特化したマルチモーダルな視覚言語モデルであり、最大で5倍規模のモデルに匹敵する性能を備えています。
- セキュリティ監視Granite Guardian 3.2は、入力と出力におけるリスクを検出するために使用されるセキュリティ監視モデルです。
Granite 3.2の技術的原理
- 連鎖推論「段階的に考える」というプロンプトを導入することで、論理推論タスクにおけるモデルのパフォーマンスが大幅に向上します。推論プロセスはAPIパラメータの切り替えに基づいており、計算リソースの無駄な浪費を回避します。
- マルチモーダル融合Granite Vision 3.2 2Bは、Transformerアーキテクチャに基づいたマルチモーダルモデルであり、視覚情報とテキスト情報を組み合わせます。ドキュメントや図表の理解能力を最適化するために、専用のドキュメント理解データセット(DocFMなど)を使用して手順が微調整されます。
- 推論拡張技術推論性能を向上させるには、モデルサイズを増やすのではなく、推論時の計算リソースを増やす。強化学習(RL)フレームワークを用いてモデルの「思考プロセス」を最適化することで、数学的推論などのタスクにおいて優れた性能を発揮する。
- スパース埋め込み従来の密埋め込みとは異なり、疎埋め込みの各次元はモデルの語彙内の単語に直接対応しており、高い解釈性を提供します。短いテキストの検索やマッチングタスクに適しており、その性能は従来の密埋め込みモデルと同等かそれ以上です。
- 時系列予測手法本モデルは、軽量な周波数プレフィックス調整技術を採用することで、異なる周波数の入力データに迅速に対応できるようにしています。また、さまざまなコンテキスト長と予測範囲を持つモデルバリアントを提供することで、さまざまな時系列タスクにおけるパフォーマンスを最適化します。
- セキュリティ監視と信頼性評価Granite Guardian 3.2は、強化学習を用いてリスク検出機能を最適化し、より詳細なリスク評価を提供する「表現信頼度」機能を導入するとともに、モデルの剪定と最適化によって推論コストとメモリ使用量を削減します。
Granite 3.2プロジェクトの住所
- プロジェクト公式サイト:https://www.ibm.com/new/announcements/ibm-granite-3-2
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/ibm-granite/granite-32-language-models
Granite 3.2の適用シナリオ
- 複雑なタスクの自動化コード生成、数学的計算、論理的推論など、複雑な命令を実行するために使用されます。
- 文書の理解文書の質疑応答、グラフ分析、重要情報の抽出などを処理する。
- 時系列予測金融、気象、エネルギー分野における短期から長期の予測をサポートします。
- セキュリティ監視入力と出力におけるリスクを検出し、コンテンツのセキュリティを確保する。
- テキスト検索短文検索とマッチングを最適化することで、情報検索効率を向上させる。