project
MinerU - OpenDataLabが開発したオープンソースのインテリジェントデータ抽出ツール
MinerUは、上海人工知能研究所のOpenDataLabチームが開発したオープンソースのインテリジェントデータ抽出ツールです。複雑なPDF文書の効率的な解析と抽出に特化しています。MinerUは、画像、数式、表、その他の要素を含むマルチモーダルPDF文書からデータを抽出できます。
MinerUとは何ですか?
MinerUは、上海人工知能研究所のOpenDataLabチームが開発したオープンソースのインテリジェントデータ抽出ツールです。複雑なPDFドキュメントの効率的な解析と抽出に特化しています。MinerUは、画像、数式、表などの要素を含むマルチモーダルPDFドキュメントを、解析しやすいMarkdown形式に変換できます。Webページや電子書籍からのコンテンツ抽出をサポートし、AIコーパスの準備効率を向上させます。MinerUは、高精度なPDFモデル解析ツールチェーンを備え、複数の入力モデルをサポートし、文字化けを自動的に識別し、ドキュメント構造を保持し、数式をLaTeXに変換します。学術、金融、法律など、さまざまな分野に適しています。CPUとGPUの両方をサポートし、Windows/Linux/Macプラットフォームと互換性があり、優れたパフォーマンスを誇ります。
MinerUの主な機能
- PDFからMarkdownへの変換様々なコンテンツタイプを含むPDF文書を、編集や分析を容易にする構造化されたMarkdown形式に変換します。
- マルチモーダルコンテンツ処理PDFファイル内の画像、数式、表、テキストなど、さまざまなコンテンツを認識して処理することができます。
- 構造と書式は保持されます変換処理中、見出し、段落、リストなど、元の文書の構造と書式は保持されます。
- 数式の認識と変換数式専用に設計されており、数式を認識してLaTeX形式に変換できるため、学術的なコミュニケーションや技術文書の作成が容易になります。
- 妨害要素の除去ヘッダー、フッター、脚注、ページ番号などのコンテンツ以外の要素を自動的に削除し、文書情報を整理します。
- 文字認識と処理の不具合PDF文書内の文字化けを自動的に識別して修正し、情報抽出の精度を向上させます。
- 高品質な構文解析ツールチェーンレイアウト検出、数式検出、光学文字認識(OCR)などの高度なPDF解析ツールを統合しており、抽出結果の精度を高めています。
MinerUの技術原則
- PDF文書の分類と前処理MinerUはPDF文書を処理する前に、まず文書を分類し、その種類(テキスト、レイヤー付きPDF、スキャンされたPDFなど)を識別し、文字化けの検出や文書がスキャンされたものかどうかの識別など、対応する前処理を実行します。
- モデル分析とコンテンツ抽出:
- レイアウト検出LayoutLMv3などの深層学習ベースのモデルを使用して領域検出を行い、文書内の画像、表、見出し、テキストなどのさまざまな領域を識別する。
- 数式検出このシステムは、YOLOv8をベースに独自開発したモデルを使用して、文書中の数式を識別し、インライン数式とクロスライン数式を区別します。
- 数式認識独自開発のUniMERNetモデルを用いて数式を識別・解析し、LaTeX形式に変換する。
- 光学文字認識(OCR)PaddleOCRなどのOCR技術を使用して、文書内のテキストコンテンツを認識します。
- パイプライン処理モデル分析から得られたデータは、後処理のために処理パイプラインに入力され、以下の処理が含まれます。
- ブロックレベルの次数を決定する。
- 不要な要素を削除してください。
- コンテンツはレイアウトに従って整理・構成され、本文の読みやすさを確保しています。
- 座標修復、高IOU処理、画像と表の説明のマージ、数式置換、アイコンダンプ、レイアウトソートなどの操作を実行します。
- 複数の形式で出力処理された文書情報は、統一された中間フォーマット(middle-json)に変換され、必要に応じてレイアウト、スパン、マークダウン、コンテンツリストなど、さまざまなフォーマットで出力できます。
- PDF抽出結果の品質検査抽出結果の最適化を確実にするため、プロセス全体は手動で注釈を付けたPDF自己テストデータセットを用いて評価されました。視覚的な品質管理ツールを用いて手動で品質チェックと注釈を行い、モデルのトレーニングにフィードバックを提供することで、モデルの性能をさらに向上させました。
MinerUのプロジェクトアドレス
- プロジェクト公式サイト:https://opendatalab.com/OpenSourceTools/Extractor/PDF
- GitHubリポジトリ:https://github.com/opendatalab/PDF-Extract-Kit
- ハギングフェイスモデルライブラリ:https://huggingface.co/wanderkid/PDF-Extract-Kit
- マジックモデルコミュニティライブラリー:https://www.modelscope.cn/models/wanderkid/PDF-Extract-Kit
MinerUの応用事例
- 学術研究研究者は、文献レビューやデータ分析を支援するために、学術論文や学術誌からテキスト、数式、図表などの重要な情報を抽出することができる。
- 法的文書処理法律専門家はMinerUを利用して、契約書、法的意見書、その他の法的文書から用語や証拠を抽出することで、業務効率を向上させることができます。
- 技術文書管理エンジニアや技術文書作成者は、技術マニュアルや製品文書から技術仕様や操作手順を抽出することができ、これにより知識管理や技術普及が促進される。
- 知識管理と情報検索企業や組織は、MinerUを利用して社内文書リポジトリから情報を抽出し、ナレッジベースを構築し、情報検索の効率を向上させることができます。
- データマイニングと自然言語処理(NLP)データサイエンティストや自然言語処理の研究者は、MinerUによって抽出されたデータを使用して、機械学習モデルのトレーニングと最適化を行うことができます。