AB
AiBoss
project

Qianfan-VL - Baiduのオープンソース画像理解モデル

Qianfan-VLは、Baidu AI Cloud Qianfanが開発した大規模な画像認識モデルで、企業レベルのマルチモーダルアプリケーション向けに設計されています。このモデルは3B、8B、70Bのサイズで提供され、OCRや教育などの垂直アプリケーション向けに優れた汎用性と特化した機能を備えています。

Qianfan-VLとは何ですか?

Qianfan-VLは、Baidu AI Cloud Qianfanが発表した大規模な画像認識モデルで、企業レベルのマルチモーダルアプリケーション向けに設計されています。このモデルは3B、8B、70Bのサイズで提供され、優れた汎用機能に加え、OCRや教育などの特定の分野向けに強化された機能も備えています。オープンソースモデルをベースに、Baiduが独自開発したKunlun P800チップ上で全ての計算処理を実行し、卓越した性能と効率性を実現しています。Qianfan-VLは、複雑なグラフの理解、視覚的推論、数学的問題解決といったマルチモーダルタスクをサポートし、企業向けアプリケーションに高精度な画像認識ソリューションを提供します。

Qianfan-VLの主な機能

  • 複数サイズモデル本製品は、3B、8B、70Bの3つのモデル仕様を提供し、規模の異なる企業や開発者の多様なニーズに対応します。また、エッジにおけるリアルタイムシナリオから複雑な推論コンピューティングシナリオまで、あらゆる用途に適用可能です。
  • OCRと高度な文書理解本システムは、全シーンOCR認識機能を備え、手書き文字、数式、自然なシーンテキストを正確に認識し、カード、証明書、請求書からの構造化された情報抽出をサポートします。さらに、複雑な文書レイアウトの理解、レイアウト要素の自動分析、表やグラフの正確な解析、インテリジェントな質問応答、構造化された文書解析にも優れています。
  • 思考力と推論能力8Bおよび70Bモデルは、特殊なトークンを通して思考連鎖能力の活性化をサポートし、複雑な図表の理解、視覚的推論、数学的問題解決など、さまざまな複雑なシナリオに対応します。視覚情報と外部知識を組み合わせて統合的な推論を行うことで、明確な問題解決のアイデアと段階的な手順説明を提供します。
  • 一般能力物体認識、画像記述、視覚的質問応答といった一般的なマルチモーダルタスクにおいて優れた性能を発揮します。中国語と英語の混合理解をサポートし、クロスモーダルアライメント機能も優れているため、様々なシナリオにおけるインテリジェントアプリケーションを強力に支援します。

千帆VLの技術原理

  • マルチモーダル建築3BモデルはQwen 2.5アーキテクチャをベースとしており、8Bモデルと70BモデルはLlama 3.1アーキテクチャをベースとしています。どちらのモデルも、語彙拡張とローカライズ強化のために3T中国語コーパスと3T英語コーパスを活用し、中国語と英語の混合理解をサポートしています。InternViTの初期化は、異なる解像度の画像の動的なブロック処理をサポートしており、最大で4K解像度の入力に対応しています。MLPアダプタを介して視覚情報と言語情報をシームレスに橋渡しすることで、情報伝達の正確性と効率性が確保されます。
  • 能力向上トレーニングパイプライン
    • 4段階のトレーニング戦略モデルの汎用性とドメイン固有の能力は、クロスモーダルアライメント、汎用知識の注入、ドメイン強化知識の注入、およびトレーニング後の処理という4つの段階を経て段階的に向上します。
    • 高精度データ合成技術文書認識、数式問題解決、グラフ理解、表認識、数式認識、自然シーンOCRなどのコアタスクを網羅する、マルチモーダルタスク向けの大規模データ合成パイプラインを構築します。洗練されたパイプライン設計と中間処理データの構築により、高品質なトレーニングデータの大規模生成を実現します。
  • 大規模並列トレーニング:に基づくデータ並列処理(DP)、テンソル並列処理(TP)、パイプライン並列処理(PP)の3次元並列組み合わせにより、動的負荷分散、勾配同期最適化、およびZeRO-3状態分割技術を通じて、トレーニング効率が大幅に向上します。Baiduが独自開発したKunlun P800チップをベースに、通信演算子と行列乗算演算子をハードウェアで分離した設計により、並列通信と並列演算が可能になり、ハードウェア利用率が大幅に向上する。
  • 推論最適化このモデルは、Kunlun CoreやGPUなどのチップ上で高効率な推論を実行し、5000枚のカードからなる単一タスク規模での並列計算をサポートすることで、実用的なアプリケーションにおけるモデルの高効率な処理能力を保証します。

Qianfan-VLのプロジェクトアドレス

  • プロジェクト公式サイト:https://baidubce.github.io/Qianfan-VL/
  • GitHubリポジトリ:https://github.com/baidubce/Qianfan-VL
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/baidu/qianfan-vl-68d0b9b0be8575c17267c85c
  • arXiv技術論文:https://github.com/baidubce/Qianfan-VL/blob/main/docs/qianfan_vl_report_comp.pdf

Qianfan-VLの応用シナリオ

  • OCR認識シナリオこのモデルは、さまざまな文書、請求書、手書きメモなどに含まれるテキスト情報を正確に認識でき、複数のフォントや複雑な背景にも対応しているため、企業の文書処理やデータ入力に効率的なソリューションを提供します。
  • 数学的な問題解決シナリオ視覚認識を用いて数学の問題を識別し、推論計算を実行するこのシステムは、幾何学や代数など、さまざまな問題形式に対応しています。教育分野向けにインテリジェントな個別指導ツールを提供し、生徒が数学の問題を理解し、解決するのを支援します。
  • 理解シナリオを文書化する文書構造を自動的に解析し、重要な情報を抽出し、複雑な表やグラフの理解と分析を支援し、企業における文書管理、情報検索、知識管理の効率を向上させます。
  • チャート分析シナリオ棒グラフ、折れ線グラフ、円グラフなどのグラフからデータを抽出・分析し、傾向予測や相関関係の推論を支援するとともに、データ分析や意思決定を強力にサポートします。