AB
AiBoss
project

PaddleOCR-VL-1.6 - Baiduがリリースした、文書解析のための視覚言語解析モデル。

PaddleOCR-VL-1.6は、Baidu PaddlePaddleチームが開発した文書解析用ビジュアル言語モデル(VLM)であり、PaddleOCR-VLシリーズの最新アップグレード版です。

PaddleOCR-VL-1.6とは何ですか?

PaddleOCR-VL-1.6は、Baidu PaddlePaddleチームが開発した文書解析ビジュアル言語モデル(VLM)であり、PaddleOCR-VLシリーズの最新アップグレード版です。わずか0.9B個のパラメータで、権威あるOmniDocBench v1.6ベンチマークテストにおいて96.33%という新たな最先端(SOTA)スコアを達成し、OmniDocBench v1.5およびReal5-OmniDocBenchでも新記録を樹立しました。テキスト、数式、表の認識機能は、オープンソースおよびクローズドソースのソリューションを総合的に凌駕しています。モデルアーキテクチャはバージョン1.5と完全に互換性があり、コストゼロのプラグアンドプレイ移行をサポートします。

PaddleOCR-VL-1.6の主な機能

  • テキスト認識一般的なテキスト認識機能、109言語に対応、OmniDocBench v1.6のテキストスコアは96.8。
  • 数式認識数式LaTeXの認識精度は97.5点で、GLM-OCRとMinerUを上回った。
  • テーブル認識複雑な表構造の分析(結合セルや多階層ヘッダーを含む)、TEDSスコア94.8。
  • 古代書物の鑑定古代中国語の文書や縦書きのテキストを認識する能力が大幅に向上しました。
  • 珍しいキャラクター認識珍しい漢字の認識精度が大幅に向上した。
  • アザラシの認識公印/切手上の文字の抽出と位置特定。
  • チャート認識円グラフや折れ線グラフを含む11種類のグラフが、構造化データに解析されます。
  • テキスト検出(スポッティング)自然シーンにおけるテキスト検出。
  • 構造化された出力Markdown、JSON、およびDOCX形式でのエクスポートに対応しています。
  • 複数のページにわたる表の結合複数ページにまたがる表を自動的に識別し、結合します。

PaddleOCR-VL-1.6の技術原理

  • 2段階分離アーキテクチャ本モデルは「レイアウト解析+VLM認識」の2段階設計を採用しています。第1段階では、PP-DocLayoutV3を用いて25種類の文書要素を検出し、読み上げ順序と座標を出力します。第2段階では、0.9Bパラメータを持つVLMを用いて各要素を個別に認識します。VLM内部では、NaViT動的解像度ビジュアルエンコーダを用いて様々なサイズの画像を適応的に処理し、ERNIE-4.5-0.3B言語モデルと連携して構造化出力を生成することで、固定解像度による小さなテキスト情報の損失を回避しています。
  • アーキテクチャの変更を一切伴わないデータ駆動型アップグレードバージョン1.6はバージョン1.5と同じモデル構造を採用しており、性能向上はデータとトレーニング戦略の最適化によるものです。開発チームはバージョン1.5のOmniDocBenchにおける各サブアイテムの弱点を分析し、古文書、希少文字、印章、複雑な表などのシナリオに合わせて、対象を絞ったデータ拡張を実施しました。
  • エリア認識型データ強化弱点を克服するため、CVシミュレーション歪み技術を導入し、数式やテキストなどの学習データにおいて、スキャン、傾き、照明、画面キャプチャといった実際の物理的な歪みをシミュレートします。同時に、テキスト検出タスクの最大解像度を2048×28×28ピクセルに拡張し、印章や古文書などの大規模な特殊データを注入することで、実世界のシナリオにおける堅牢性を大幅に向上させます。
  • 段階的な3段階トレーニングこのアプローチでは、「事前学習 → SFT → 強化学習」という段階的なスキームを採用しています。事前学習データは、2900万組の画像とテキストのペアから4600万組に拡張されます。SFT段階では、元のOCR、表、数式タスクに基づいて、切手認識とテキスト発見タスクが追加されます。最後に、GRPO強化学習を使用して、出力品質をさらに調整し、マルチタスクの統合を実現します。

PaddleOCR-VL-1.6の使い方

  • ローカルインストール(Python):インストール paddlepaddle-gpu==3.2.1(CUDA 12.6)、実行 pip install -U "paddleocr[doc-parser]"環境設定が完了した後に使用できます。
  • コマンドラインの使用方法インストール後に実行 paddleocr doc_parser -i your_document.png または paddleocr doc_parser -i document.pdf解析結果を直接出力し、単一画像およびPDFのバッチ処理をサポートします。
  • Python API輸入 PaddleOCRVL クラス初期化パイプライン、呼び出し predict() 画像パスを入力すれば、結果が得られます。 print() 表示または使用する save_to_json()save_to_markdown() 構造化ファイルとして保存する。
  • Dockerデプロイメント(本番環境): 公式ミラーを引く ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddleocr-vl:latest-nvidia-gpu起動後はコンテナ内で直接実行されるため、サーバーへのデプロイに適しています。
  • 推論サービスの展開:埋め込む paddleocr genai_server HTTPサービスをワンクリックで起動でき、vLLM、SGLang、FastDeploy、Transformers、llama.cppなどの複数のバックエンドをサポートし、高並行API呼び出しシナリオに適しています。

PaddleOCR-VL-1.6の主な利点

  • SOTAの精度OmniDocBench v1.6は96.33%の精度を達成し、テキスト、数式、表を含むすべての項目で第1位にランクインしました。
  • 超軽量パラメータ数は0.9Bであり、Qwen3-VL-235BやGPT-5.2といった汎用的な大規模モデルに比べてはるかに少ない。
  • 費用ゼロの移行アーキテクチャは1.5と全く同じです。重みを置き換えるだけで済みます。
  • 実世界での堅牢性このシステムは、スキャン、歪み、画面キャプチャ、照明の変化、傾きという5つの主要なシナリオにおいて、最先端の結果を達成しました。
  • 複数のハードウェアをサポートNVIDIA GPU(Blackwellを含む)、Apple Silicon、Kunlun Chips、Ascend、AMD、Intel

PaddleOCR-VL-1.6のプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/PaddlePaddle/PaddleOCR
  • ハギングフェイスモデルライブラリ:https://huggingface.co/PaddlePaddle/PaddleOCR-VL-1.6

PaddleOCR-VL-1.6と類似競合製品との比較

比較対象寸法 PaddleOCR-VL-1.6 GLM-OCR MinerU 2.5
開発者 Baidu PaddlePaddle 志浦AI 上海AI研究所/清華大学
パラメータサイズ 0.9B 0.9B 1.2B
OmniDocBench v1.6 96.33% 95.22% 95.75%
テキスト認識 96.8 94.0
数式認識 97.5 96.5
テーブル認識(TEDS) 94.8 85.2 88.4
実世界での堅牢性 SOTA 基本 基本
古代の書物/珍しい文字 大幅に強化 サポート 一般的に
アザラシの認識 強化する サポート 言及されていない
導入コスト 極めて低い 極めて低い 中くらい
オープンソースライセンス オープンソースで無料 オープンソースで無料 オープンソースで無料

PaddleOCR-VL-1.6の応用シナリオ

  • 文書のデジタル化紙のアーカイブ、書籍、論文などのスキャン画像を、MarkdownまたはJSON形式の電子文書に変換し、バッチ処理をサポートします。
    本社契約書、請求書、報告書、承認書から重要な情報を自動的に抽出し、ERPシステムやOAシステムと連携してプロセスを自動化します。
    教育研究学術論文中の複雑な数式(LaTeX出力)や表形式データを識別することができ、文献の整理や知識抽出を支援します。
    金融サービス銀行手形、財務諸表、銀行取引明細書を分析し、データの自動入力とコンプライアンス監査を可能にします。
    健康管理これにより、医療記録、検査報告書、処方箋などを体系的に入力することが可能になり、病院情報システムとの連携もサポートされます。