project
LightOnOCR-2-1B - LightOnAIが発表したOCRモデル
LightOnOCR-2-1Bは、LightOnAIが開発した高効率OCRモデルです。わずか10億個のパラメータで、複雑な文書処理において卓越した性能を発揮し、学術論文、数式、複雑な表の認識に優れています。
LightOnOCR-2-1Bとは何ですか?
LightOnOCR-2-1Bは、LightOnAIが開発した高効率OCRモデルで、パラメータ数はわずか10億個です。特に学術論文、数式、複雑な表の認識など、複雑な文書処理に優れています。RLVR強化学習を採用し、Markdown形式の構造化テキストを出力します。表の再構築、数式の認識、複数列レイアウト処理にも対応しています。低コストかつ高速な処理能力が高く評価されており、1,000ページあたり0.01ドル未満で、最大5.71ページ/秒の処理速度を実現しているため、文書のデジタル化や知識ベース構築に最適な選択肢です。
LightOnOCR-2-1Bの主な機能
- マークダウン構造化出力認識されたテキストは、見出し、リスト、コードブロックなどの構造化されたコンテンツを含むMarkdown形式で出力されるため、後で編集や書式設定が容易になります。
- テーブル修復表の構造を正確に復元でき、複雑な統計表の認識にも対応しています。
- 数式認識LaTeX/KaTeX形式の数式認識を完全にサポートしているため、学術論文や工学文書に適しています。
- 複数列レイアウト処理複数段組レイアウトの読み上げ順序を自動的に認識し、新聞や学術論文などの複雑な文書レイアウトに適しています。
- バウンディングボックス予測(bboxバリアント)このモデルは、画像内のテキストを認識し、テキストの境界ボックスを予測できるため、テキストと画像の対応付けやスライス処理が容易になります。
- 高効率かつ低コストH100グラフィックカード1枚で、1秒間に5.71ページの文書を処理でき、処理コストは1,000ページあたり0.01ドル未満であるため、大規模な文書処理に適しています。
LightOnOCR-2-1Bの技術原理
-
検証フィードバックに基づく強化学習(RLVR):KaTeXの報酬メカニズムは数式レンダリングに最適化されており、出力されるLaTeXコードが標準化され、レンダリング可能であることを保証します。圧縮報酬メカニズムは、モデルの反復的な行動を罰することで、反復率を50%以上削減し、小規模モデルでよく見られるデッドループ問題を回避します。
-
エンドツーエンドOCRモデルアーキテクチャ:サポート入力はPDFまたは画像で、出力は複雑な前処理や後処理を必要とせず、構造化されたテキストが直接出力されます。
-
高効率推論フレームワーク:vLLM推論フレームワークを組み合わせることで、モデルのスループットとコストが最適化され、処理速度と経済性が向上します。
-
高品質なデータクリーニング:複雑なシナリオにおいてもモデルの精度と堅牢性を確保するため、質の高い訓練データを使用してください。
LightOnOCR-2-1Bのプロジェクトアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/lightonai/LightOnOCR-2-1B
- arXiv技術論文:https://arxiv.org/pdf/2601.14251
LightOnOCR-2-1Bの応用事例
-
学術論文およびarXiv文書のデジタル化このモデルは、学術論文における複雑な書式設定、数式、複数列のレイアウトを構造化されたMarkdown形式に迅速に変換できるため、研究者や研究機関が文献を整理し、知識を共有することが容易になります。
-
古いアーカイブやスキャンされた書籍のOCR処理このモデルは、古い文書中のテキストや表を効率的に認識することができ、歴史的文書のデジタル保存や研究を支援するため、図書館や公文書館などの機関に適しています。
-
エンタープライズ文書プラットフォームおよびナレッジベースの構築知識管理とデータクレンジングを容易にするために、内部文書、報告書、および声明を体系的に整理し、それによって企業情報システムの効率性を向上させる。
-
財務注記および複雑な財務諸表の構成このモデルは、財務文書内のテキストや表を迅速に認識できるため、レポートの自動処理が可能になり、財務データ入力の効率と精度が向上します。
-
数学、工学、科学知識基盤の構築数学的な公式や工学図面を正確に識別することで、研究機関や大学が質の高い知識基盤を構築し、学術研究や教育を促進することを支援します。