project
MonkeyOCR - 華中科技とキングソフトオフィスが共同開発した文書解析モデル
MonkeyOCRは、華中科技大学とKingsoft Officeが共同開発した文書解析モデルです。このモデルは、非構造化文書コンテンツを構造化情報に効率的に変換することをサポートします。正確なレイアウト分析に基づき、…
MonkeyOCRとは何ですか?
MonkeyOCRは、華中科技大学とKingsoft Officeが共同開発した文書解析モデルです。このモデルは、非構造化文書の内容を効率的に構造化情報に変換します。精密なレイアウト解析、内容認識、論理ソートに基づき、文書解析の精度と効率を大幅に向上させます。従来の手法と比較して、MonkeyOCRは複雑な文書(数式や表を含む文書など)の処理において特に優れた性能を発揮し、平均で5.1%、数式と表の解析ではそれぞれ15.0%と8.6%の向上を実現しています。また、複数ページの文書処理にも優れており、毎秒0.84ページという処理速度を達成し、他の類似ツールをはるかに凌駕しています。MonkeyOCRは、学術論文、教科書、新聞など、様々な種類の文書に対応し、多言語にも対応しているため、文書のデジタル化と自動処理を強力にサポートします。
MonkeyOCRの主な機能
- 文書の解析と構造化このソフトウェアは、さまざまなドキュメント形式(PDF、画像など)に含まれる非構造化コンテンツ(テキスト、表、数式、画像など)を、構造化された機械可読情報に変換します。
- 多言語対応中国語と英語を含む複数の言語に対応しています。
- 複雑な文書を効率的に処理する数式、表、複数列レイアウトを含むような複雑な文書の処理において、非常に優れた性能を発揮します。
- 複数ページ文書の高速処理複数ページの文書を効率的に処理し、毎秒0.84ページの処理速度を実現しており、他のツール(例えば、毎秒0.65ページのMinerUや毎秒0.12ページのQwen2.5-VL-7Bなど)を大幅に上回っています。
- 柔軟な導入と拡張単一のNVIDIA 3090 GPU上での効率的な展開をサポートし、さまざまな規模のニーズに対応します。
MonkeyOCRの技術原理
- 構造認識関係(SRR)トリプルパラダイムYOLOをベースとしたこの文書レイアウト検出器は、文書内の主要要素(テキストブロック、表、数式、画像など)の位置とカテゴリを識別します。検出された各領域に対して、エンドツーエンドの認識に大規模マルチモーダルモデル(LMM)を用いたコンテンツ認識を実行し、高い精度を確保します。ブロックレベルの読み上げ順序予測メカニズムに基づき、検出された要素間の論理的な関係を決定し、文書の意味構造を再構築します。
- MonkeyDocデータセットMonkeyDocは、中国語と英語の両方で10種類以上の文書タイプを網羅した390万件のインスタンスを含む、現在までで最も包括的な文書解析データセットです。このデータセットは、綿密な手動アノテーション、手続き型合成、モデル駆動型自動アノテーションを統合した多段階パイプラインに基づいて構築されています。MonkeyOCRモデルのトレーニングと評価に使用され、多様で複雑な文書シナリオ全体にわたって高い汎化能力を保証します。
- モデルの最適化と展開AdamWオプティマイザとコサイン学習率スケジューリングは、大規模データセットでのトレーニングにおいて、精度と効率のバランスを確保するために使用されています。LMDeployツールをベースに、MonkeyOCRは単一のNVIDIA 3090 GPU上で効率的に動作し、高速な推論と大規模な展開をサポートします。
MonkeyOCRプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/Yuliang-Liu/MonkeyOCR
- ハギングフェイスモデルライブラリ:https://huggingface.co/echo840/MonkeyOCR
- arXiv技術論文:https://arxiv.org/pdf/2506.05218
- オンラインでデモを体験してください:http://vlrlabmonkey.xyz:7685/
MonkeyOCRの応用事例
- 自動化されたビジネスプロセス契約書、報告書、請求書などの社内文書処理において、データの自動抽出と構造化を可能にし、効率性を向上させ、手作業による介入を削減します。
- デジタルアーカイブ図書館、公文書館、その他の機関は、紙の文書をデジタル化することで、長期保存と検索を容易にしている。
- スマート教育教育機関は、教科書、試験問題、学術論文などを分析し、オンライン学習プラットフォームや教育リソースデータベースで使用するためのコンテンツを抽出します。
- 医療記録管理病院は、診療記録や検査報告書などの医療文書を分析し、電子カルテシステムで使用する重要な情報を抽出することで、データ管理の効率性を向上させている。
- 学術研究研究者は、文献レビューやデータ分析に必要な重要な情報を抽出するため、多数の学術文書を分析し、研究活動を支援する。