AB
AiBoss
project

MOCR - 小紅書と華中科技大学が共同で開発したマルチモーダル文書解析モデル。

MOCR(マルチモーダルOCR)は、華中科技大学と小紅書研究室が共同開発したマルチモーダル文書解析モデルです。わずか30億個のパラメータで、文書解析と画像再構成において画期的な性能を実現しています。

MOCRとは何ですか?

MOCR(マルチモーダルOCR)は、華中科技大学と小紅書hi研究室が共同開発したマルチモーダル文書解析モデルです。わずか3つのパラメータで、文書解析と画像再構成において画期的な性能を実現しています。テキストのみを認識する従来のOCRの限界を打破し、図表、数式、フローチャートなどの視覚要素を編集可能なSVGコードに解析することで、「あらゆるものを解析する」という新たなパラダイムを実現しました。オープンソースモデルの中でトップクラスの性能を誇り、画像再構成能力はGemini 3 Proを凌駕し、文書AI分野にパラダイムシフトをもたらしています。

MOCRの主な機能

  • 文書の完全な要素分析テキスト、表、数式、グラフなど、すべてのページ要素を認識し、読み上げ順序を維持しながら構造化データを出力します。
  • グラフィックからSVGコードへの変換統計グラフ、科学イラスト、UIレイアウトなどの視覚コンテンツを、編集可能なSVGコードに再構築します。
  • マルチフォーマット入力対応PDF、ウェブページのスクリーンショット、スキャンした文書、携帯電話で撮影した写真など、さまざまな種類の文書の解析をサポートしています。
  • 一般的な視覚能力このモデルは、視覚的な質問応答、視覚的な位置特定、画像の説明など、一般的なマルチモーダル理解能力を備えている。
  • デュアルバージョンモデルさまざまなシナリオのニーズを満たすために、dots.mocr のバランスの取れたバージョンと、SVG に最適化された dots.mocr-svg のバージョンを提供します。

MOCRの主要情報と使用要件

  • 開発チーム華中科技大学 × 暁紅樹hi研究室
  • モデルパラメータ3B(1.2Bのビジュアルエンコーダー+1.5Bの言語デコーダー)
  • モデルバージョンdots.mocr(バランス版)、dots.mocr-svg(SVG拡張版)
  • コアイノベーショングラフィックをSVGコードに解析することで、「あらゆるものを解析する」という新たなパラダイムが可能になります。
  • パフォーマンスオープンソース文書解析においてトップの性能を誇り、画像再構成においてはGemini 3 Proを凌駕する。
  • GPU:CUDAをサポートするNVIDIA製グラフィックカード(推論処理の高速化に推奨)
  • メモリ:入力解像度に応じて調整されます。高解像度のドキュメントは、より多くのビデオメモリを必要とします。

MOCRの主な利点

  • 小さなパラメータで、大きな可能性を秘めるわずか30億個のパラメータで、多くの大規模モデルを凌駕する性能を発揮し、文書解析のための最高のオープンソースツールであり、画像再構成性能はGemini 3 Proを上回ります。
  • 全元素分析このモデルは、テキストしか認識できない従来のOCRの限界を打破し、グラフ、数式、フローチャートなどの視覚要素を構造化されたコードに解析する機能を統合します。
  • グラフィック編集機能画像を単にピクセル画像に切り抜くのではなく、SVGコードに変換することで、劣化のない復元や二次編集が可能になります。
  • データエンジンの革新PDF、ウェブページ、SVGアセットなどのマルチソースデータパイプラインの構築をサポートし、グラフィック監視信号の不足という問題を解決します。
  • 評価方法論の革新本モデルは、信頼性の高い比較評価のための審判役として強力なVLM(仮想言語モデル)を用いるOCRアリーナフレームワークを提案する。

MOCRの使い方

  • 環境準備Python 3.12の仮想環境を作成し、GitHubリポジトリをクローンして依存関係をインストールします。
  • モデルをダウンロードダウンロードスクリプトを実行してモデルの重みを取得してください。保存パスにはピリオド(.)を含めないでください。
  • サービスを開始するvLLMを使用してモデルサービスをデプロイし、GPUアクセラレーションによる推論をサポートします。
  • 文書解析画像ファイルまたはPDFファイルを処理する解析スクリプトを呼び出し、構造化された結果を出力します。
  • グラフィック変換専用のSVGスクリプトを使用して、グラフを編集可能なSVGコードに変換してください。
  • 結果を出す: バウンディングボックス、Markdownテキスト、および視覚的な注釈図を含む生成されたJSONファイルを取得します。

MOCRプロジェクトの住所

  • GitHubリポジトリ:https://github.com/rednote-hilab/dots.mocr
  • arXiv技術論文:https://arxiv.org/pdf/2603.13032
  • オンラインでデモを体験してください:https://dotsocr.xiaohongshu.com/

MOCRの競合製品比較

寸法 MOCR Gemini 3 Pro PaddleOCR-VL
開発者 華中科技大学 × 小紅書 グーグル 百度
パラメータサイズ 3B 非公開(はるかに大きい) 0.9B
オープンソースのステータス 完全オープンソース クローズドソースAPI オープンソース
コアポジショニング 文書全体の要素分析と図の再構築 一般的なマルチモーダル大規模モデル 従来型の文字認識
文書解析 Elo 1125(オープンソース優先) 1211(業界リーダー) 920.5
olmOCR-Bench 83.9 非公開 80.0
グラフィック処理能力 SVGコードに変換(編集可能) 基本的な認識 サポートされていません
展開方法 vLLM/Transformersのローカル展開 API呼び出し ローカル展開
中核的な利点 小さなパラメータで大きな機能を実現。編集可能なグラフィック 非常に汎用性が高く、完全なエコシステムを備えている 軽量で高速、そして中国語利用に最適化されている。

MOCRの応用シナリオ

  • 学術研究このツールは、PDF形式の論文を解析し、数式を抽出し、図表を再構築します。スキャンした論文を編集可能なLaTeX形式に変換することで、科学研究の図表やデータを再現します。
  • 金融と経済財務諸表を分析し、データレポートを抽出し、グラフをデジタル化します。PDF形式の財務諸表から棒グラフや折れ線グラフを抽出し、Excelで使用可能なデータに変換します。
  • 法律および政治問題契約書を精査し、書類をデジタル化し、文書を特定し、複数ページにわたる契約書から重要な情報を構造化された方法で抽出すると同時に、フォーマットの整合性を維持する。
  • 教育出版デジタル教科書、問題集、黒板認識技術などは、印刷された教科書にある複雑な数式や図表を電子リソースに変換する。
  • 健康管理医療記録の分析、検査報告書の抽出、医療画像の注釈付け、化学式や医療図を含む文書の処理などが可能です。