AB
AiBoss
project

openPangu-VL-7B - ファーウェイのオープンソースマルチモーダルモデル

openPangu-VL-7Bは、ファーウェイが開発したオープンソースのマルチモーダルモデルで、Ascendハードウェア向けに最適化されています。言語機能と画像認識機能を組み合わせたこのモデルは、強力な画像位置特定機能とOCR機能を備えており、画像、文書、動画などの処理を効率的に行うことができます。

openPangu-VL-7Bとは何ですか?

openPangu-VL-7Bは、Huaweiが発表したオープンソースのマルチモーダルモデルで、Ascendハードウェア向けに最適化されています。言語機能と画像認識機能を組み合わせたこのモデルは、強力な画像位置特定機能とOCR機能を備え、画像、文書、動画のタスクを効率的に処理します。Ascendチップ上で優れた推論性能を発揮し、720P画像の推論レイテンシはわずか160ミリ秒であるため、エッジ環境への展開や個別開発に適しています。openPangu-VL-7Bの革新的なビジュアルエンコーダとトレーニング戦略により、マルチモーダルタスクで優れた性能を発揮し、Ascendエコシステムに新たな勢いをもたらし、開発者がより多くのアプリケーションシナリオを探求できるよう支援します。

openPangu-VL-7Bの主な機能

  • 視覚的な位置特定とターゲットの計数このモデルは、画像内の対象物の位置を正確に識別し、数を数えることができます。例えば、複雑なシーンの中にあるミニトマトをすべて見つけて数を数えることができます。
  • 文書理解とOCRこのモデルは、ドキュメントのスクリーンショットをMarkdown形式に変換でき、テキスト認識とグラフ理解をサポートし、ドキュメント処理効率を大幅に向上させます。
  • 視覚に関する一般的な質問画像の内容に関する質問の理解と回答を支援します。例えば、画像内の場面描写や、画像内の詳細説明などが可能です。
  • 短い動画の解説このモデルは、短い動画コンテンツを分析し、重要な情報を抽出し、動画コンテンツの迅速な解釈を支援することができます。
  • マルチモーダルタスク処理視覚的推論やマルチグラフ理解など、多様なマルチモーダルタスクをサポートし、幅広いアプリケーションシナリオに適しています。

openPangu-VL-7Bの技術原理

  • ネイティブアーキテクチャを昇り詰めるこのモデルはAscendハードウェア向けに最適化されており、Ascend用に改良されたビジュアルエンコーダーを使用することで、従来のエンコーダーと比較してスループットを15%向上させ、推論性能を大幅に強化しています。
  • 革新的なビジュアルエンコーダーこのモデルは、22層のウィンドウアテンションと4層のフルアテンションを組み合わせることで、きめ細かな視覚理解を強化します。同時に、マルチラベル対照学習フレームワークを採用することで、視覚的位置特定タスクの基盤を強化します。
  • ハイブリッド損失設計「重み付きサンプル損失+トークン損失」というハイブリッドアプローチを用いることで、長さの異なるサンプルの学習バランスの問題が解決され、モデルの汎化能力が向上する。
  • パディングを含む位置情報データ形式このモデルは、000~999パーセンタイルを使用して相対座標を埋めることで、学習の難易度を低減し、位置特定タスクの精度と効率を向上させます。
  • 大規模な事前トレーニング3T+トークンを使用して、スパイクのないクラスタの長期安定トレーニングを完了し、開発者にAscendクラスタの実践的な参考情報を提供するとともに、モデルの汎用性と適応性を向上させました。

openPangu-VL-7Bのプロジェクトアドレス

  • プロジェクト公式サイト:https://ai.gitcode.com/ascend-tribe/openPangu-VL-7B
  • 技術論文:https://ai.gitcode.com/ascend-tribe/openPangu-VL-7B/blob/main/doc/technical_report.pdf

openPangu-VL-7Bの応用シナリオ

  • インテリジェントな文書処理このツールは、文書のスクリーンショットやスキャン画像からテキストやグラフをMarkdownなどの形式に素早く変換し、文書処理の効率を向上させ、手作業による文字起こしにかかる時間を節約します。
  • ビジュアルQ&Aユーザーが画像をアップロードすると、モデルは画像の内容に関連する質問(シーンの説明や物体の認識など)に回答できます。教育や情報検索の分野で広く利用されています。
  • 標的の位置特定と計数これは、工業生産における部品の迅速な位置特定と計数、あるいは小売店における棚商品の管理に利用でき、生産効率と在庫管理の精度を向上させる。
  • 短編動画コンテンツ分析このモデルは、短い動画から重要な情報を自動的に抽出し、動画の要約やレビューコンテンツを生成することで、ユーザーが動画を素早く理解し、コンテンツ管理の効率を向上させるのに役立ちます。
  • インテリジェントな顧客サービス画像とテキスト情報を組み合わせることで、ユーザーにより正確なカスタマーサービス回答を提供できます。例えば、製品画像を活用して相談をサポートし、カスタマーサービス体験を向上させることができます。