AB
AiBoss
project

Qianfan-OCR - Baidu Qianfanのエンドツーエンドのインテリジェント文書モデル

Qianfan-OCRは、Baidu Qianfanが開発したエンドツーエンドのインテリジェント文書モデルです。4Bパラメータ視覚言語アーキテクチャに基づいており、文書解析、レイアウト分析、テキスト認識、意味理解を統合しています。

Qianfan-OCRとは何ですか?

Qianfan-OCRは、Baidu Qianfanが開発したエンドツーエンドのインテリジェント文書モデルです。4Bパラメータのビジュアル言語アーキテクチャに基づき、文書解析、レイアウト分析、テキスト認識、意味理解を統合しています。OmniDocBench v1.5ベンチマークでは、エンドツーエンドモデルの中で93.12というスコアで1位を獲得しました。Layout-as-Thoughtメカニズムによりページ構造を明示的にモデル化し、複雑な表やグラフの理解にも対応しています。このモデルはオープンソースであり、A100 GPU 1基で効率的に展開できます。

Qianfan-OCRの主な機能

  • 文書画像解析このモデルは、スキャンされた文書や画像から、前処理なしで構造化されたテキストコンテンツを直接抽出することをサポートしています。
  • ページレイアウトの分析と理解文書内のタイトル、段落、表、グラフなどの要素とその空間的な関係を自動的に認識する機能をサポートしています。
  • テキスト認識と変換画像内の印刷されたテキストや手書きのテキストを、編集可能なテキストに正確に変換します。
  • 重要な情報抽出複雑な文書から、日付、金額、名前などの特定のフィールドを検索して抽出する機能をサポートしています。
  • チャート推論分析このモデルは、棒グラフや折れ線グラフなどの視覚化における数値的な意味や傾向を理解することができる。
  • マルチフォーマット出力Markdown、JSON、HTMLなどの構造化データ形式の生成をサポートします。

Qianfan-OCRの技術原理

  • エンドツーエンドの統合アーキテクチャQianfan-OCRは、統一された視覚言語アーキテクチャを採用し、従来の「検出→認識→理解」という多段階パイプラインをエンドツーエンドのアプローチに置き換えています。このモデルは、文書画像を直接構造化された出力にマッピングすることで、段階的な処理によって引き起こされるエラーの蓄積や視覚情報の損失を回避します。
  • レイアウト・アズ・ソート機構エンドツーエンドモデルにおける明示的なレイアウトモデリングの欠如に対処するため、チームは「レイアウト・アズ・ソート」メカニズムを導入した。最終結果を出力する前に、モデルは… <think> トークンは構造的思考段階をトリガーし、まず要素の位置、種類、読み上げ順序などのレイアウト情報を生成します。この事前知識に基づいてコンテンツの解析が完了し、統一されたフレームワーク内で構造認識と意味理解の両方の能力を備えています。

Qianfan-OCRの主要情報と使用要件

  • モデルサイズ4Bパラメータ視覚言語アーキテクチャ
  • 評価結果OmniDocBench v1.5のエンドツーエンドモデルは、KIEランキングでGemini 3-Proを上回り、93.12ポイントで1位を獲得しました。
  • コアイノベーション本システムは「思考に基づくレイアウト」メカニズムを採用しており、ページレイアウト構造の明示的なモデリングをサポートしています。
  • 展開パフォーマンスシングルA100 GPU(W8A8量子化)スループット:1.024ページ/秒
  • オープンソースのステータスモデルの重み付けデータは、付属のスキルツールチェーンとともにHuggingFaceに公開されました。
  • ハードウェア環境推論処理を実行する場合は、NVIDIA A100または同等のGPUを搭載することをお勧めします。
  • ソフトウェアの依存関係VRAM使用量を削減するために、W8A8量子化をサポートするvLLM推論フレームワークのインストールが必要です。
  • アクセス方法Baidu Qianfanプラットフォーム経由でオンラインで呼び出すことも、オープンソースの権限に基づいてプライベートに展開することも可能です。
  • 入力形式一般的な文書および画像フォーマット(PDF、PNG、JPGなど)に対応しています。
  • 出力形式ニーズに合わせて、Markdown、JSON、HTMLなどの構造化出力を設定できます。

Qianfan-OCRの主な利点

  • 一流の建築このモデルは、従来の多段階パイプラインに代わり、エンドツーエンドの統一されたビジュアル言語アーキテクチャを採用することで、モジュール間のエラーの蓄積を排除し、システムの導入と運用の複雑さを大幅に簡素化します。
  • ページレイアウトの理解: 独自のレイアウト思考メカニズムにより、 <think> トークンは、文書要素の位置、種類、および読み取り順序を明示的にモデル化することで、複雑なレイアウトのシナリオにおける解析精度を大幅に向上させます。
  • 最高のパフォーマンスOmniDocBench v1.5ベンチマークにおいて、エンドツーエンドモデルの中で93.12のスコアで1位を獲得し、グラフ理解を含む6つのタスクのうち5つで最高のスコアを達成した。
  • 卓越した効率性単一のA100 GPUとW8A8量子化を組み合わせることで、毎秒1.024ページの処理能力を実現でき、従来のソリューションと比較して、CPU検出や複数のモデルの異種オーケストレーションにかかるコストを削減できます。
  • 箱から出してすぐに使えますBaidu Qianfanプラットフォームのオンライン呼び出しとHuggingFaceオープンソース重みのプライベート展開をサポートし、完全なスキルツールチェーンとマルチフォーマット出力機能を提供します。

Qianfan-OCRの使い方

  • オンライン通話Baidu Qianfanプラットフォームコンソールにアクセスし、モデルセンターでQianfan-OCR組み込みモデルを選択し、アプリケーションを作成してAPIキーを取得します。その後、標準HTTPインターフェースを介してドキュメント画像をアップロードすると、構造化解析結果がリアルタイムで取得されます。
  • プライベート展開 HuggingFaceからオープンソースのモデル重みをダウンロードし、vLLM推論フレームワークをインストールしてW8A8量子化パラメータを設定し、A100 GPUを搭載したサーバーでモデルサービスを開始し、ローカルAPIを介してオフライン呼び出しを実装します。
  • ツールチェーン統合 公式のGitHub Skillsリポジトリをクローンし、提供されているドキュメントインテリジェンスツールキットに基づいて二次開発を行い、既存のビジネスシステムにOCR機能を組み込み、カスタム出力フォーマットとバッチドキュメント処理ワークフローをサポートします。

Qianfan-OCRプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/baidubce/Qianfan-VL
  • ハギングフェイスモデルライブラリ:https://huggingface.co/baidu/Qianfan-OCR
  • arXiv技術論文:https://arxiv.org/pdf/2603.13398

Qianfan-OCRと類似の競合製品との比較

比較対象寸法 Qianfan-OCR GPT-4o Gemini 3-Pro
建築設計 エンドツーエンドの統合型ビジュアル言語アーキテクチャ(4Bパラメータ) 一般的なマルチモーダル大規模モデル 一般的なマルチモーダル大規模モデル
OmniDocBench v1.5 93.12ポイント(総合1位) 非公開の特別評価 非公開の特別評価
ページレイアウト分析能力 レイアウト・アズ・ソートによる明示的なモデリング 暗黙の了解、非構造化出力 暗黙の了解、非構造化出力
チャートの理解 6つのタスク、ベスト5 優れた一般推論能力 優れた一般推論能力
導入コスト A100カード1枚で実行可能 クラウドAPIの呼び出しが必要です クラウドAPIの呼び出しが必要です
オープンソースレベル モデルの重み、紙、スキルはすべてオープンソースです クローズドソースの商用API クローズドソースの商用API
出力形式 Markdown/JSON/HTML構造化出力 自然言語による説明 自然言語による説明

Qianfan-OCRの応用事例

  • 企業文書のデジタル化契約書、請求書、報告書などのスキャンされた文書のバッチ処理をサポートし、主要なフィールドを自動的に抽出して構造化されたデータベースを生成します。
  • 財務請求書レビューこのモデルは、銀行取引明細書、保険証券、口座明細書から金額、日付、口座情報を特定することができ、リスク管理やコンプライアンス審査に役立ちます。
  • 医療記録管理手書きまたは印刷された医療記録に記載された症状、診断、投薬記録を分析し、電子医療記録の迅速なアーカイブと検索を可能にする。
  • 学術論文処理PDF文書をMarkdown形式に変換することで、数式、グラフ、引用構造を保持し、知識ベースの構築を容易にします。
  • 公文書および歴史文書の修復このモデルは、古書や古い新聞などの低画質画像に含まれるテキストを認識することができ、文化遺産のデジタル保存に役立つ。