AB
AiBoss
project

PaddleOCR-VL - Baidu PaddlePaddleのオープンソースのマルチモーダル文書解析モデル

PaddleOCR-VLは、Baidu PaddlePaddleチームが開発したオープンソースのマルチモーダル文書解析モデルです。パラメータ数はわずか0.9Bで、低処理能力のデバイス向けに最適化されています。国際的に権威のあるベンチマークであるOmnidocBench V1.5で92.6のスコアを獲得し、世界第1位にランクイン、GPAを上回りました。

PaddleOCR-VLとは何ですか?

PaddleOCR-VLは、Baidu PaddlePaddleチームが開発したオープンソースのマルチモーダル文書解析モデルです。パラメータ数はわずか0.9Bで、低処理能力のデバイス向けに最適化されています。国際的に権威のあるOmnidocBench V1.5で92.6のスコアを獲得し、世界第1位にランクイン、GPT-4oなどの主流モデルを凌駕しています。このモデルは2段階アーキテクチャを採用しており、PP-DocLayoutV2がレイアウト解析を行い、PaddleOCR-VL-0.9Bがコンテンツ認識を完了します。109言語に対応し、表、数式、グラフなどの複雑な要素も正確に処理し、構造化されたMarkdown/JSONデータを出力します。軽量設計のため、ローカル展開に適しており、特に医療レポートや古書認識など、高いプライバシー要件が求められるシナリオに最適です。

PaddleOCR-VLの主な機能

  • インテリジェントな文書構造解析テキスト、表、数式、グラフなどの要素を自動的に認識し、正しい読み上げ順序を維持します。
  • 多言語対応中国語、英語、日本語、韓国語などを含む109言語に対応しています。
  • 軽量で効率的な展開携帯電話やローカルサーバーなど、リソースに制約のあるデバイスに適しています。
  • マルチモーダルな理解テキストと画像が混在するシナリオにも対応可能です。このモデルは、国際ベンチマークであるOmniDocBench V1.5で優れた性能を発揮し、特に医療報告書、古書の縦書きテキスト、数式といった特殊なシナリオを正確に認識する能力に優れています。構造化されたJSON形式またはMarkdown形式のデータを出力できます。

PaddleOCR-VLの技術原理

  • 2段階処理アーキテクチャ:使用ページレイアウトの検出が先で、コンテンツ認識は後です。プロセス:
    • フェーズ1:合格 PP-DocLayoutV2 このモデルはレイアウト分析を行い、テキスト、表、数式などの意味領域を特定し、人間の読書順序を予測します(誤差はわずか0.043)。
    • フェーズ2:による PaddleOCR-VL-0.9B 検出された領域に対してきめ細かな認識を行い、構造化されたテキスト、表、数式、その他のコンテンツを出力します。
      これにより、エンドツーエンドモデルでよく見られる錯覚や位置ずれの問題を回避し、複雑なレイアウトの処理安定性を向上させることができます。
  • マルチモーダル融合コアアーキテクチャコアモデルは、以下の3つの主要コンポーネントを統合しています。
    • ビジュアルエンコーダー:使用 NaViTダイナミック解像度エンコーダ異なるサイズや解像度の文書画像を、詳細な情報を保持しながら適応的に処理します。
    • 言語モデル軽量ベース ERNIE-4.5-0.3B強力な言語理解および言語生成機能を提供する。
    • クロスモーダルアライメントメカニズム視覚言語融合モジュールは、画像の特徴を構造化されたテキスト出力に変換します。
  • ダイナミックな解像度と軽量設計NaViTエンコーダーは以下をサポートします動的解像度調整文書の複雑さに基づいて計算リソースを適応的に割り当て、効率性と精度をバランスよく両立させます。モデル全体のパラメータ数はわずか0.9Bで、CPU上で効率的に動作し、推論速度は類似モデルと比較して14.2%~253.01%高速です。
  • マルチタスク統合フレームワークこのシステムは、命令駆動型のメカニズムを使用して、テキスト、表、数式、グラフなどの要素の認識を統一的に処理するため、タスクごとにモデルを切り替える必要がなくなり、導入の複雑さを大幅に軽減します。

PaddleOCR-VLプロジェクトのアドレス

  • プロジェクト公式サイト:https://ernie.baidu.com/blog/zh/posts/paddleocr-vl/
  • ハギングフェイスモデルライブラリ:https://huggingface.co/PaddlePaddle/PaddleOCR-VL
  • arXiv技術論文:https://arxiv.org/pdf/2510.14528
  • オンラインでデモを体験してください:https://huggingface.co/spaces/PaddlePaddle/PaddleOCR-VL_Online_Demo
  • 公式試験会場:https://aistudio.baidu.com/application/detail/98365

PaddleOCR-VLの応用事例

  • 大規模な文書のデジタル化紙のアーカイブ、歴史的文書、契約書などを一括して編集可能な電子形式に変換するのに適しており、多言語や複雑なレイアウト(表や数式など)の正確な解析をサポートしています。
  • 金融・商業紙の処理請求書、領収書、銀行書類から金額、日付、会社名などの重要な情報を自動的に識別し、財務監査と税務管理の効率を向上させます。
  • 学術研究と教育のデジタル化本ソフトウェアは、学術論文や教科書中のテキスト、数式、図表を分析し、知識抽出と構造化をサポートするため、科学研究情報管理やインテリジェント教育ツールの開発に適しています。
  • 多言語対応のグローバル文書処理109言語(アラビア語、ロシア語、日本語、その他の特殊文字体系を含む)に対応しており、多国籍企業、翻訳プラットフォーム、多言語ファイル管理に適しています。
  • プライバシーに配慮したシナリオにおける局所的な展開このモデルは軽量(パラメータ数0.9B)であるため、通常のCPUやエッジデバイスで動作させることができ、政府機関や医療機関など、高いデータセキュリティ要件が求められる分野に適しています。
  • インテリジェント知識ベースおよび検索システムRAGテクノロジーと組み合わせることで、スキャンした文書を構造化データに変換し、企業における知識管理の効率性と検索精度を向上させます。