project
PP-OCRv6 - Baidu PaddleOCRのオープンソース第6世代OCRモデル。
PP-OCRv6は、Baidu PaddleOCRチームが発表した第6世代のオープンソースOCRモデルです。今回初めて、Tiny(1.5M)、Small(7.7M)、Medium(34.5M)の3つのモデルサイズを導入し、ブラウザからサーバーまでの全プロセスをカバーしています。
PP-OCRv6とは何ですか?
PP-OCRv6は、Baidu PaddleOCRチームが発表した第6世代のオープンソースOCRモデルです。今回初めて、Tiny(1.5M)、Small(7.7M)、Medium(34.5M)の3つのモデルサイズを導入し、ブラウザからサーバーまであらゆるコンピューティングプラットフォームに対応しています。前バージョンと比較して、検出精度は4.9%、認識精度は5.1%向上しています。Mediumモデルは、Intel Xeon CPU上でエンドツーエンドの処理時間がわずか1.40秒となり、v5_serverの5.2倍の速さを実現しています。Tinyモデルは、ブラウザ側で単一画像の予測時間が97msと非常に高速です。1つのモデルでサポートされる言語数は4言語から50言語に拡大し、回路基板、デジタル管、CAD図面、インクジェットドットマトリックス文字などの新たな産業シナリオが追加されました。
PP-OCRv6の主な機能
-
柔軟な展開を実現する3層モデルサイズは、Tiny(1.5M)、Small(7.7M)、Medium(34.5M)の3種類があり、それぞれブラウザ、組み込み機器、サーバー向けに最適化されています。ニーズに合ったサイズを選んで、すぐに使い始めることができます。
-
高精度テキスト検出および認識エンドツーエンドのテキスト領域特定とコンテンツ認識を実現し、検出精度は86.2%、認識精度は83.2%であり、前世代と比較して飛躍的な進歩を遂げている。
-
単一モデルで50言語に対応単一のモデルで中国語、英語、日本語、および46のラテン語系言語を同時にサポートするため、モデルを切り替えることなく多言語混在文書を処理できます。
-
産業シナリオに特化した機能強化これにより、回路基板、デジタルチューブ、CAD図面、インクジェットドットマトリックス文字、タイヤ印刷など、複雑な産業環境における検出および認識機能が追加されます。
-
高速推論と低遅延Tinyフォーマットでは、純粋なブラウザフロントエンドにおいて、単一画像の予測時間がわずか97msに短縮されます。Mediumフォーマットでは、Intel Xeon CPU上でエンドツーエンドの処理時間がわずか1.40秒となり、前世代のサーバーモデルよりも5.2倍高速です。
-
高い堅牢性と安定した出力マルチサイズ予測検出の一貫性変動はわずか5.19%であり、エッジサイズ摂動認識の一貫性はv5と比較して20.5%向上しています。入力解像度の変化や切り抜き境界に対する強力な耐干渉性を備えています。
-
複数のバックエンドとプライベートデプロイメントOpenVINO、ONNX Runtime、TensorRTなどの推論バックエンドをサポートしており、イントラネット、オフライン環境、セキュリティが重視される環境などにもプライベートに展開できます。
-
構造化文書解析PP-StructureV3と組み合わせることで、複雑なPDFや画像をMarkdownまたはJSON形式に変換し、きめ細かなテキスト座標とレイアウト情報を出力できます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
PP-OCRv6の使い方
-
クイックコマンドライン呼び出しPaddleOCR 3.7.0以降をインストール後、直接実行してください。
paddleocr ocr -i image.png --text_detection_model_name PP-OCRv6_medium_det --text_recognition_model_name PP-OCRv6_medium_recこれにより、画像に対してOCR処理を実行できます。 -
Python API統合コード内でインポート
from paddleocr import PaddleOCR初期化時にモデル名を指定します。例:PaddleOCR(text_detection_model_name="PP-OCRv6_medium_det", text_recognition_model_name="PP-OCRv6_small_rec")、 電話predict()この方法は、画像パスを渡すことで認識結果を取得できます。 -
モデルの自動ダウンロード指定されたモデルを初めて使用する場合、PaddleOCRは手動設定を必要とせずに、HuggingFaceまたはModelScopeから対応する重みを自動的にダウンロードします。あるいは、ModelScopeコレクションページまたはGitHubリポジトリからモデルファイルを事前にローカルマシンにダウンロードすることもできます。
-
ブラウザ側のフロントエンド展開Tinyファイル(1.5M)モデルを使用することで、ONNX Runtime WebまたはOpenVINOフロントエンドを介して推論を実行でき、バックエンドサーバーを必要とせずに、純粋なブラウザ環境で97ミリ秒という超高速で単一画像の予測が可能になります。
-
マルチバックエンド推論の高速化OpenVINO、ONNX Runtime、TensorRTなどのバックエンドをサポートしており、CPU、GPU、組み込みデバイス上で推論エンジンをオンデマンドで切り替えることで、本番環境のパフォーマンスを最適化できます。
-
構造化文書解析PP-StructureV3モジュールと組み合わせることで、画像やPDFを入力として受け取ると、テキストコンテンツ、座標位置、ページレイアウト情報などを含む構造化された結果をMarkdownまたはJSON形式で出力できます。
-
必要に応じてモデルレベルを選択してください。展開環境の計算能力に応じて、Tiny(モバイル/ブラウザ向け)、Small(組み込み/中程度の計算能力向け)、またはMedium(サーバー/高精度向け)を選択してください。3つのモデルのインターフェースは同じなので、モデル名を変更するだけでシームレスに切り替えることができます。
PP-OCRv6のプロジェクトアドレス
- プロジェクト公式サイト:https://paddleocr.com
- ModelScope:https://modelscope.cn/collections/PaddlePaddle/PP-OCRv6
PP-OCRv6の主な利点
-
精密な飛躍的世代間改善テキスト検出精度はv5と比較して4.9%向上し、認識精度は5.1%向上し、中モードでの検出の平均H値は86.2%に達し、認識精度は83.2%に達し、大幅な飛躍を遂げました。
-
究極の推論速度MediumはIntel Xeon CPU上でエンドツーエンドの処理時間をわずか1.40秒に抑え、前世代のサーバーモデルより5.2倍高速化しています。Tinyはブラウザ上での単一グラフ予測時間を97ミリ秒まで短縮し、極めて低い計算能力の環境にも適しています。
-
史上最高の堅牢性マルチサイズ予測検出の一貫性のばらつきはわずか5.19%(v5より35%低い)であり、エッジサイズ摂動認識の一貫性は20.5%向上し、入力変更や切り抜き境界に対する非常に強力な耐干渉能力を備えています。
-
コンピューティングパワープラットフォーム全体をシームレスにカバーTiny、Small、Mediumの各モデルは、ブラウザや組み込み機器からサーバーまで、あらゆるシナリオでの導入に対応しています。ニーズに最適なモデルを選択し、すぐに使用できます。
-
50言語の統一認識この単一モデルは、中国語、英語、日本語、そして46のラテン語を含む50言語に対応しており、従来の4言語から大幅に増加しました。また、モデルを切り替えることなく多言語コンテンツを処理できます。
-
産業シナリオの深層強化回路基板、デジタルチューブ、CAD図面、インクジェットドットマトリックス文字、タイヤ印刷など、実際の複雑な産業環境における特殊な認識機能を追加しました。
-
軽量パラメトリック破砕大型モデルMediumは、3450万個のパラメータで、Qwen3-VL-235B、GPT-5.5、Gemini-3.1-Proなど、数十億個のパラメータを持つ視覚言語モデルを、検出および認識精度において凌駕します。
-
極めて低い幻覚性忠実な再現元のテキスト(意図的なスペルミスを含む)を復元する精度は、一般的な大規模モデルよりもはるかに高く、大規模モデルによく見られる「見せかけの」改ざんを回避しています。
PP-OCRv6と類似の競合製品との比較
| 比較対象寸法 | PP-OCRv6 | EasyOCR | MMOCR |
|---|---|---|---|
| 開発者 | Baidu PaddleOCR | JaidedAI | OpenMMLab(センスタイム) |
| オープンソースライセンス | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| システムアーキテクチャ | 統合メタフォーマー(LCNetV4 + RepLKFPN + LightSVTR) | CRAFT/DB検出 + CRNN認識 | DB/PSENet/FCENet検出 + CRNN/SAR/NRTR認識 |
| エンドツーエンドのサポート | 検出・識別機能を統合し、3段階の速度調整が可能。箱から出してすぐに使用できます。 | エンドツーエンドの統合、自動言語検出 | モジュール式アセンブリでは、検出および識別リンクの手動設定が必要です。 |
| 対応言語 | 50言語(中国語、英語、日本語、およびラテン語46言語) | 80種類以上 | 選択したモデル構成によっては、ご自身で拡張作業を行う必要があります。 |
| モデルサイズ | 1.5M–34.5M(非常に軽量) | 検出能力は約1000万以上で、言語ごとの認識モデルの累計数は5000万以上に達する可能性があります。 | 柔軟な構成が可能で、通常モデルあたり1,000万~1億以上。 |
| 中国シーンの最適化 | 縦書きテキスト、古書、ピンイン注釈をサポートするために徹底的に最適化されています。 | 一般的に、中国語文字の認識精度はPP-OCRよりも低い。 | サポート対象ですが、手動での最適化が必要です。 |
| 工業風景 | 内蔵回路基板、デジタルチューブ、CAD、ドットマトリックス文字、タイヤ印刷など。 | 主に汎用用途向けであり、特定の産業用途向けではありません。 | 主に汎用用途向けであり、特定の産業用途向けではありません。 |
| CPU推論速度 | 非常に速い小型ブラウザ:97ms、中型CPU:1.40秒 | 中程度、通常は第2レンジ | 中程度、通常は第2レンジ |
| ブラウザ/フロントエンドの展開 | ネイティブサポート(小型ファイル ONNX/Web) | ネイティブブラウザの推論はサポートされていません。 | サポートされていません |
| 幻覚抑制 | 極めて低い(忠実な繁殖率93.2%) | 低い評価だが、誤りや漏れがある。 | 中程度、モデルの組み合わせによって異なる |
PP-OCRv6の応用シナリオ
-
モバイルデバイスおよびエッジデバイスのリアルタイム識別Tiny(1.5M)設定では、携帯電話、IoTデバイス、組み込み端末でミリ秒レベルのOCRが可能になり、オフラインスキャンや速達送り状の認識といった低消費電力のシナリオに適しています。
-
ブラウザ側のフロントエンド統合ONNX/Webを介して純粋なWeb環境に展開することで、単一画像の予測処理はわずか97ミリ秒で完了し、バックエンドサーバーを必要とせずにユーザーがアップロードした画像からリアルタイムでテキストを抽出することが可能になります。
-
文書のデジタル化と記録管理このツールを使用すると、IDカード、運転免許証、営業許可証、請求書、領収書、契約書などの文書や領収書をバッチ処理で構造化して抽出し、PP-StructureV3を使用してJSON/Markdown形式で出力できます。
-
財務および医療データの入力極めて低い誤認率(93.2%の忠実な再現率)により、請求書、医療記録、処方箋、保険証券など、極めて高い精度が求められる機密文書を正確に識別します。
-
工業品質検査と自動化このシステムは、回路基板のシルクスクリーン印刷、デジタルチューブの読み取り、CAD図面の注釈、インクジェットドットマトリックス文字、タイヤ印刷、工業用銘板など、複雑な産業シナリオの自動検出と認識を可能にします。
-
多言語国際化処理この単一モデルは50言語に対応しており、越境EC、貿易文書、多言語指示書、国際コンテンツのレビュー、翻訳前処理などに適しています。