AB
AiBoss
project

Nanonets-OCR-s - Nanonetsが開発したOCRモデル

Nanonets-OCR-s(Nanonets OCR Small)は、Nanonets社が開発した画像からMarkdownへのOCRモデルで、画像内のドキュメントコンテンツを構造化されたMarkdown形式に変換することをサポートしています。このモデルはテキストを抽出できます...

Nanonets-OCR-sとは何ですか?

Nanonets-OCR-s(Nanonets OCR Small)は、Nanonets社が提供する画像からMarkdownへのOCRモデルで、画像から文書コンテンツを構造化されたMarkdown形式に変換する機能をサポートしています。このモデルは、テキストを抽出し、LaTeXの数式、画像の説明、署名、透かし、チェックボックス、複雑な表など、複雑な文書要素をインテリジェントに認識・処理できます。大規模なデータセットで学習された深層学習モデルに基づいており、研究論文、財務文書、医療フォームなど、さまざまな文書タイプに対応しています。出力されるMarkdown形式のコンテンツは、大規模な言語モデルで直接処理でき、学術、法律、金融、企業などの分野で幅広く活用されており、文書処理の効率と精度を大幅に向上させます。

Nanonets-OCR-sの主な機能

  • LaTeX数式認識数式や方程式を、インラインの数式や表示される数式を含め、正しくフォーマットされたLaTeX構文に自動的に変換します。
  • インテリジェント画像記述ドキュメント内の画像を構造化タグで記述することで、大規模な言語モデルによる処理が可能になります。単一または複数の画像(ロゴ、グラフ、図表、QRコードなど)の内容、スタイル、コンテキストの記述、`<img>`タグ内の画像の説明の予測、`<page_number>`タグ内のページ番号の予測をサポートします。
  • 署名の検出と分離個別の文書から署名を識別することは、法律文書やビジネス文書の処理において非常に重要です。このモデルは、<signature>タグから署名テキストを予測します。
  • 透かし抽出署名検出と同様に、このモデルは文書から透かしテキストを検出して抽出することをサポートしており、予測された透かしテキストは<watermark>タグ内にあります。
  • スマートチェックボックス処理この関数は、フォーム内のチェックボックスとラジオボタンを標準化されたUnicode記号に変換し、一貫した処理を実現します。モデルは、`<checkbox>`タグ内のチェックボックスの状態を予測します。
  • 複雑なテーブルの抽出文書から複雑な表を抽出し、Markdown形式とHTML形式の表に変換します。

Nanonets-OCR-sの技術原理

  • 視覚言語モデル(VLM)Nanonets-OCR-sは、視覚情報(画像、表、グラフなど)と言語情報(テキストコンテンツなど)を同時に理解・処理する視覚言語モデル(VLM)に基づいています。このモデルは、視覚的特徴と言語的特徴の共同学習を活用することで、文書の構造と内容をより深く理解します。
  • データセットの計画とトレーニングモデルのトレーニングには、研究論文、財務文書、法律文書、医療文書、税務申告書、領収書、請求書など、さまざまな種類の文書を含む25万ページを超える文書データセットがキュレーションされました。これらの文書には、画像、グラフ、数式、署名、透かし、チェックボックス、複雑な表などの要素が含まれています。トレーニングは、合成データセットと手動でラベル付けされたデータセットの両方を使用して実施されました。モデルはまず合成データセットでトレーニングされ、次に手動でラベル付けされたデータセットで微調整されました。合成データセットは多数のトレーニングサンプルを提供し、手動でラベル付けされたデータセットは実世界の文書におけるモデルのパフォーマンスを向上させます。
  • ベースモデルの選択Qwen2.5-VL-3Bモデルは、ビジュアル言語モデル(VLM)のベースモデルとして選択され、文書固有の光学文字認識(OCR)タスクにおける性能を向上させるために、厳選されたデータセットで微調整されました。
  • インテリジェントなコンテンツ認識とセマンティックタグ付けNanonets-OCR-sは、文書内の様々な要素を識別し、意味的なタグ付けを行うことができます。この手法に基づき、モデルは非構造化文書の内容を、構造化されたコンテキスト豊富なMarkdown形式に変換し、後続のタスクにより高品質な入力データを提供します。
  • モデルの最適化とチューニングトレーニング中、モデルのパラメータと構造は、さまざまな文書タイプやシナリオにおけるパフォーマンスを向上させるために継続的に最適化されます。モデルには、さまざまな機能要件を満たすための具体的な調整と最適化が施され、実際のアプリケーションにおける精度と信頼性が確保されます。

Nanonets-OCR-sプロジェクトの住所

  • プロジェクト公式サイト:https://nanonets.com/research/nanonets-ocr-s/
  • ハギングフェイスモデルライブラリ:https://huggingface.co/nanonets/Nanonets-OCR-s

Nanonets-OCR-sの応用シナリオ

  • 学位論文のデジタル化このツールは、LaTeXの数式や表を含む学術論文を構造化されたMarkdown形式に変換することで、研究者が文献を整理、引用、さらに分析しやすくします。
  • 研究データの収集実験データ、図表、結論など、研究論文から重要な情報を迅速に抽出できるため、研究者は論文を素早く確認・比較しやすくなります。
  • 学術出版これは、出版社が印刷物やPDF形式の学術文書をオンライン出版に適した形式に変換するのに役立ち、文書のアクセス性と検索性を向上させます。
  • 法律文書分析法律文書から重要な条項、判例引用、法的規定を迅速に特定・抽出できるため、法律調査や判例分析の効率が向上します。
  • 財務諸表の処理収益、費用、貸借対照表などの財務諸表からデータを抽出することで、財務分析や報告書の作成が容易になります。