project
OvisOCR2 - AlibabaのATH-MaaSチームが開発した、エンドツーエンドの文書解析モデル。
OvisOCR2は、アリババのATH-MaaSチームが開発したエンドツーエンドの文書解析モデルです。Qwen3.5-0.8Bで学習されており、完全にオープンソースです。このモデルはOmniDocBench v1.6ベンチマークで96.58のスコアを獲得し、その優れた能力を実証しました。
OvisOCR2とは何ですか?
OvisOCR2は、アリババのATH-MaaSチームが開発したエンドツーエンドの文書解析モデルです。Qwen3.5-0.8Bで学習され、完全にオープンソースで、OmniDocBenchベンチマークで96.58という最高スコアを獲得しました。複雑な文書レイアウトに対しても高精度な認識と構造化抽出機能を備え、複数列レイアウト、表、数式などの解析に対応しています。学術研究、アーカイブのデジタル化、企業知識ベース構築など、高度な文書処理ニーズに適しています。
OvisOCR2の主な機能
-
エンドツーエンドの文書解析入力された文書画像から、多段階のパイプライン処理を必要とせずに、構造化されたテキストを直接出力できます。
-
複雑なレイアウト認識複数列レイアウト、テキストと画像が混在するレイアウト、ネストされた表など、複雑なドキュメントレイアウトの正確な解析をサポートします。
-
高精度OCR抽出OmniDocBench v1.6において96.58点のスコアを獲得し、文字認識および段落認識の精度で業界トップの座に輝いた。
-
オープンソースでデプロイ可能Qwen3.5-0.8Bのトレーニングに基づき、モデルの重みとコードがHuggingFaceにオープンソースとして公開されました。
OvisOCR2の技術的原理
-
ビジュアル言語モデルアーキテクチャこのモデルはQwen3.5-0.8Bをベースとしており、画像から構造化テキストへのエンドツーエンドのマッピングを実現するために、ビジュアルエンコーダーとテキストデコーダーを統合しています。
-
大規模文書事前学習このモデルは、大量のスキャン文書、PDFレンダリング画像、その他のデータを用いて事前学習されており、文書のレイアウトと意味の関係性を学習します。
-
エンドツーエンドの最適化従来の検出→認識→後処理という多段階プロセスを廃止し、単一モデルの共同最適化によって誤差の蓄積を低減する。
-
軽量で効率的0.8B個のパラメータを持つ小型モデルで、推論速度と導入コストのバランスを取りながら、最先端(SOTA)のパフォーマンスを実現します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
OvisOCR2の使い方
-
環境準備HuggingFaceリポジトリをクローンし、その依存関係(Transformers、PyTorchなど)をインストールします。
-
モデル:合格
AutoModelForCausalLMOvisOCR2の重みと対応する単語分割器を読み込みます。 -
入力文書スキャンした文書やスクリーンショットをテンソル形式に変換し、それをモデルに渡して順推論を行います。
-
結果を出すこのモデルは、構造化された解析結果をMarkdown形式またはプレーンテキスト形式で直接出力します。
-
展開の微調整: 自社の文書データに基づいて微調整を続け、特定のフィールドのレイアウト要件に適合させます。
OvisOCR2の主な利点
-
評価リストのトップOmniDocBench v1.6は96.58というスコアでトップに立ち、文書解析精度において業界をリードした。
-
超軽量Qwen3.5-0.8Bのトレーニングに基づくと、わずか0.8B個のパラメータで最先端の性能を達成でき、単一のカード上でスムーズな推論が可能になります。
-
完全オープンソースモデルの重みとコードはHuggingFace上で公開されており、商用ライセンスの制限はなく、二次開発も自由に行えます。
-
エンドツーエンドアーキテクチャこのモデルは従来の多段階パイプラインを廃止し、入力された文書画像から構造化テキストを直接出力することで、エンジニアリング保守コストを大幅に削減します。
-
複雑なレイアウトの適応追加の後処理ルールを必要とせずに、複数列レイアウト、テキストと画像の混在、ネストされたテーブルなどの複雑なシナリオをネイティブにサポートします。
OvisOCR2プロジェクトのアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/ATH-MaaS/OvisOCR2
OvisOCR2と類似の競合製品との比較
| 寸法 | OvisOCR2 | GOT-OCR2.0 |
|---|---|---|
| パラメータサイズ | 0.8B(Qwen3.5) | 約0.5億 |
| 評価結果 | OmniDocBench v1.6が1位(96.58)にランクインしました。 | 複数のチャートで首位を獲得 |
| オープンソースライセンス | 完全オープンソース | オープンソースで商用利用可能 |
| 建築的特徴 | エンドツーエンドのビジュアル言語モデル | エンドツーエンドのユニバーサルOCR |
| 導入コスト | 極めて低性能。一般消費者向けGPUでも動作する。 | 極めて低い |
| シナリオ分析に長けている | 複雑なレイアウト文書構造の解析 | 一般的なOCRと数式認識 |
OvisOCR2の応用シナリオ
-
学術文献のデジタル化スキャンされたPDF論文を一括解析し、本文、図表のタイトル、参考文献構造を自動的に抽出することで、研究資料の整理を迅速化します。
-
エンタープライズレコード管理この方法は、歴史的な紙媒体のアーカイブをスキャンしたコピーを検索可能な構造化データベースに変換することで、手作業によるデータ入力のコストを削減します。
-
金融商品処理請求書や契約書内の重要な項目やネストされたテーブルを正確に識別し、自動化された財務監査プロセスをサポートします。
-
教育資料の整理教科書やテスト用紙の複雑な複数段組レイアウトを分析し、オンラインで簡単に検索・編集できる構造化された電子リソースを生成します。
-
RAG知識ベースの構築文書形式の質疑応答システム向けに、高品質な構造化テキスト入力を提供し、検索性を向上させ、生成される回答の精度を高めます。