project
Unlimited-OCR - Baiduのオープンソースのエンドツーエンド長文文書OCRモデル
Unlimited-OCRは、Baiduが開発したエンドツーエンドの長文文書OCRモデルです。参照スライディングウィンドウアテンション機構を用いて、デコーダのキーバリューキャッシュを線形増加から定数へと圧縮し、単一の順変換を実現します。
Unlimited-OCRとは何ですか?
Unlimited-OCRは、Baiduが開発したエンドツーエンドの長文文書OCRモデルです。参照スライディングウィンドウアテンション機構を採用することで、デコーダのキーバリューキャッシュを線形増加から定数へと圧縮し、数十ページにも及ぶ文書を1回の順方向処理で文字起こしできます。30億パラメータのMoEアーキテクチャに基づき、OmniDocBench v1.6において、総合スコア93.92%、推論速度5580 TPSという最先端の性能を実現しました。コードと重みは完全にオープンソースです。
Unlimited-OCRの主な機能
-
長文文書を一度に認識する2ページから40ページ以上のPDF文書を、ページごとのループ処理を必要とせずに、単一の順方向文字起こしで処理できます。
-
複数種類の文書の解析これには、PPT、学術論文、書籍、カラー教科書、テスト問題、雑誌、新聞、ノート、研究報告書など、9種類のフォーマットが含まれます。
-
高精度コンテンツ抽出テキストや数式から表に至るまでの全プロセスは、読み込んだ順序でエンドツーエンドで出力され、数式のCDM精度は95.79%、表のTEDS精度は93.32%です。
-
デュアル解像度ビジュアルコーディング基本モード(1024×1024)は複数ページにわたる長文文書に使用され、ガンダムモード(動的解像度)は単一ページにおける高精度な認識に使用されます。
-
定数遅延推論出力シーケンスの長さに関わらず、KVキャッシュはm+nで一定であり、推論レイテンシとメモリ使用量は安定している。
Unlimited-OCRの技術原理
-
R-SWA注意機構生成される各トークンは、すべての参照トークン(視覚情報+手がかりとなる単語)と直近の128個の出力トークンのみを考慮します。視覚トークンは、長時間の生成中に視覚的特徴が徐々にぼやけるのを防ぐため、スライディングウィンドウの状態遷移から除外されます。
-
定数KVキャッシュ設計KVキャッシュは、容量m+nのキューとして実装されています。新しいトークンが生成されるたびに、(m+1)番目のトークンが削除されます。計算コストとメモリ使用量は、シーケンス長に応じて増加しません。
-
DeepEncoderビジュアルエンコーディング本システムはSAM-ViTカスケードCLIP-ViTアーキテクチャを採用し、ブリッジ層を介して16回のトークン圧縮を実行します。1024×1024ピクセルの画像は256個のビジュアルトークンに圧縮され、一度エンコードされた後、固定されます。
-
MoE-LLMデコーダーMoEアーキテクチャは、合計30億個のパラメータと5億個のアクティベーションを備え、すべてのアテンション層はR-SWAに置き換えられています。DeepSeek-OCRチェックポイントに基づいて4000ステップで学習され、グローバルバッチサイズは256、最大シーケンスサイズは32Kです。
-
推論エンジンの最適化TransformersとSGLangはどちらも一定のTPSと一定のメモリKVキャッシュ管理を実装しており、Flash Attention v3カーネル下では呼び出しごとのレイテンシは一定に保たれます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Unlimited-OCRの使い方
-
モデルのダウンロードハギングフェイス経由
baidu/Unlimited-OCRまたはGitHubbaidu/Unlimited-OCRコードと重量を取得してください。 -
環境準備TransformersライブラリとSGLang推論エンジンをサポートします。対応するGPU環境が必要です。
-
入力形式PDFページの画像入力に対応しています。基本モードは複数ページの長文文書に、ガンダムモードは単一ページの高解像度認識に使用されます。
-
推論呼び出し外部のページネーション用スケジューラを必要とせず、OCRを使用して文書全体を一度の順方向処理で文字起こしできます。
-
拡張アプリケーションR-SWAメカニズムは、音声認識、翻訳、字幕生成などの長文出力タスクにも適用可能です。
Unlimited-OCRの主な利点
-
SOTAの認識精度OmniDocBench v1.5は合計スコア93.23%、v1.6は合計スコア93.92%を達成し、エンドツーエンドのパフォーマンスで1位を獲得しました。
-
継続的なリソース使用KVキャッシュはドキュメントのページ数に応じて増加しません。メモリ使用量とレイテンシは、20ページまたは40ページ以上のドキュメントでも安定しています。
-
速度は長さとともに増加する出力が長くなるほど、その利点はより明確になります。6144トークンの場合、理論上のTPS上限はDeepSeek-OCRよりも約35%高くなります。
-
一般的な復号化アーキテクチャR-SWAはOCRに特化したものではなく、「参照ソース+長い出力」を伴うあらゆる生成タスクに適用できる手法です。
-
軽量オープンソース:3B 一般パラメータ、500M アクティベーション、モデルとコードはオープンソースであり、展開と二次開発に便利です。
Unlimited-OCRプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/baidu/Unlimited-OCR
- ハギングフェイスモデルライブラリ:https://github.com/baidu/Unlimited-OCR
Unlimited-OCRと類似製品との比較
| 寸法 | Unlimited-OCR | DeepSeek-OCR |
|---|---|---|
| モデルサイズ | 3B-A0.5B (MoE) | 3B-A0.5B (MoE) |
| 注意機構 | R-SWA(参照スライディングウィンドウアテンション) | 標準的な全注意 |
| KVキャッシュの成長 | 定数(m+n)は配列の長さとともに増加しない。 | 出力シーケンスとともに継続的に蓄積される線形成長。 |
| OmniDocBench v1.5 総合スコア | 93.23% | 87.01% |
| OmniDocBench v1.6 総合スコア | 93.92% | 90.25%(DeepSeek-OCR 2) |
| テキスト編集距離 | 0.038 | 0.073 |
| フォーミュラCDM | 92.61% | 83.37% |
| テーブルTEDS | 90.93% | 84.97% |
| 読み上げ順序 編集距離 | 0.045 | 0.086 |
| 推論速度 | 5580 TPS、レイテンシは終始一定。 | 4951 TPS、レイテンシは長さとともに増加 |
| 長文ドキュメントのサポート | 40ページ以上を一度に読み進めることができ、ページ番号を付ける必要はありません。 | 長いシーケンスはKVキャッシュの拡張によって制限され、ページング処理が必要となる。 |
| トレーニングの基本 | DeepSeek-OCRのチェックポイントに基づいて、4000ステップにわたるトレーニングが継続された。 | 基本モデル |
Unlimited-OCRの応用シナリオ
-
企業記録のデジタル化数百、数千ものスキャンされたPDFファイル、古書、製本された書籍を一括処理し、分割することなく一度に構造化されたデータを抽出することが可能です。
-
学術文献の分析論文、学術誌、研究報告書全体を、数式、表、読み順を保持したまま、最初から最後まで書き起こします。
-
教育テスト用紙の採点複数ページのテスト用紙やワークブックの一括認識に対応し、カラー教科書や複雑なレイアウトもサポートします。
-
法的契約書のレビュー長文の契約書テキストを正確にOCRで抽出し、その後の自然言語処理(NLP)分析およびコンプライアンスレビューに活用する。
-
多言語翻訳パイプライン一般的なR-SWAデコード方式の検証シナリオとして、音声認識や字幕生成といった長シーケンスのタスクにも拡張できる。