project
FireRed-OCR - Xiaohongshuによる文書構造解析のためのオープンソース視覚言語モデル
FireRed-OCRは、文書構造解析のための軽量な視覚言語モデルであり、Xiaohongshuチームによってオープンソース化されました。わずか2バイトのパラメータで、権威あるOmniDocBench v1.5ベンチマークにおいて総合スコア92.94%を達成し、GPT-5.2を上回りました。
FireRed-OCRとは何ですか?
FireRed-OCRは、文書構造解析用の軽量ビジュアル言語モデルで、Xiaohongshuチームがオープンソース化しました。わずか2B個のパラメータで、権威あるOmniDocBench v1.5ベンチマークで総合スコア92.94%を達成し、GPT-5.2、Gemini-3.0 Pro、Qwen3-VL-235Bなどの大規模モデルを凌駕し、「小型モデルが大型モデルに勝つ」というブレークスルーを実現しました。このモデルはQwen3-VL-2B-Instructアーキテクチャに基づいており、3段階の段階的学習戦略を採用しています。FireRed-OCRは、文書解析における「構造錯覚」問題を解決するために特別に設計されており、複雑な表、数式、階層的な見出しなどのコンテンツを正確に抽出し、標準的なMarkdown形式に変換します。
FireRed-OCRの主な機能
-
複雑なテーブルの抽出この技術は、乱雑なPDFファイルやスキャンされた文書から表構造を正確に識別して抽出し、行と列の対応関係を維持し、従来のOCRでよく見られる表のずれの問題を回避します。
-
数式分析このソフトウェアは、文書内の数式を正確に識別し、標準的なLaTeXまたはMarkdown形式に変換することで、数式構文の妥当性と可読性を保証します。
-
階層構造の復元文書内の見出しレベル(H1~H6)、段落のインデント、リスト記号などをインテリジェントに識別し、仕様に準拠したMarkdown階層構造を生成します。
-
複数フォーマット文書の変換PDF、スキャン画像、学術論文、財務報告書など、さまざまな文書形式をワンクリックで構造化されたMarkdownテキストに変換する機能をサポートしています。
-
反構造的錯覚GRPO強化学習による最適化により、内容の捏造、行順の乱れ、階層構造の混乱といった一般的な文書解析エラーが大幅に削減されます。
-
マルチシナリオ適応財務報告書のデジタル化、学術論文の分析、契約書の構成、書籍コンテンツの抽出など、専門的な用途に適しています。
-
軽量展開2Bパラメータスケールに対応し、ローカル展開とAPI呼び出しをサポートすることで、計算コストを削減し、中小企業や個人開発者に適しています。
FireRed-OCRの技術的原則
-
インフラストラクチャーこれは、Qwen3-VL-2B-Instructマルチモーダル大規模モデル構築をベースにしており、その強力な視覚理解能力とテキスト生成能力を継承している。
-
3段階の漸進的トレーニング戦略:
-
フェーズ1(マルチタスクの事前調整)領域検出、領域認識、Markdownへのレイアウトという3つのタスクを同時にトレーニングすることで、モデルが文書の空間レイアウトを認識する能力を確立します。
-
フェーズ2(専門SFT)一貫性のある出力ロジックと正確な階層構造表現を保証するために、高品質で標準化されたMarkdownデータセットに対して、教師ありファインチューニングが実施されます。
-
フェーズ3(フォーマット制約GRPO)グループ相対方策最適化強化学習アルゴリズムは、フォーマット報酬メカニズムを通じて出力品質を最適化するために適用される。
-
-
4つの主要な報酬メカニズム:
-
数式構文の妥当性に関するボーナス:数式がLaTeXの構文仕様に準拠していることを保証します。
-
テーブルの整合性ボーナス:テーブルの行と列の構造が完全に一貫していることを保証します。
-
階層的閉じタグの報酬: Markdownの見出しレベルのタグが正しく閉じられていることを確認します。
-
テキスト精度ボーナス:テキスト認識精度とコンテンツの忠実度が向上します。
-
-
構造的幻覚抑制文書解析における一般的な問題、例えば、行順の乱れ、捏造された数式、混沌とした階層構造などに対処するため、フォーマット制約と強化学習を組み合わせた最適化手法を用いることで、錯覚の発生率を大幅に低減する。
-
エンドツーエンドの最適化視覚入力から直接構造化されたMarkdownを生成するため、従来のOCRの多段階パイプライン(検出→認識→レイアウト分析→書式設定)が不要になり、エラーの蓄積が軽減されます。
FireRed-OCRプロジェクトのアドレス
-
GitHubリポジトリ:https://github.com/FireRedTeam/FireRed-OCR
FireRed-OCRの応用シナリオ
-
財務報告書のデジタル化上場企業の財務諸表や監査報告書から複雑な表や財務データを正確に抽出し、構造化されたMarkdown形式に変換することで、財務分析やデータ保存を容易にします。
-
学術論文の分析このソフトウェアは、研究論文中の数式、図表のタイトル、参考文献レベルを識別し、文献管理や知識抽出を支援するための標準的な学術形式のテキストを生成します。
-
契約書の構成スキャンした契約書や法律文書を編集可能な構造化テキストに変換し、階層構造と重要な情報を保持することで、法律文書処理の効率を向上させます。
-
書籍や雑誌のデジタル化スキャンした書籍や定期刊行物を処理し、目次とテキストレイアウトを復元して、検索可能なデジタルライブラリを迅速に構築します。
-
教育資料の整理教科書、試験問題、講義ノートなどの数式や表を分析し、オンライン学習に適した構造化された形式に変換することで、教育プラットフォームにおけるコンテンツ開発を支援します。
-
アーカイブのデジタル化これは、企業や組織が歴史的な紙のアーカイブや手書きのメモを構造化された電子文書に変換するのを支援し、アーカイブの永続的な保存とインテリジェントな検索を可能にします。