project
DeepSeek-OCR 2 - DeepSeekチームによってオープンソース化された第2世代OCRモデル。
DeepSeek-OCR 2は、DeepSeekチームがリリースした第2世代OCRモデルです。DeepEncoder V2アーキテクチャを導入することで、固定スキャンから意味推論へのパラダイムシフトを実現しています。このモデルは、因果ストリームクエリとデュアルストリームインジェクションを採用しています。
DeepSeek-OCR 2とは何ですか?
DeepSeek-OCR 2は、DeepSeekチームが開発した第2世代OCRモデルです。DeepEncoder V2アーキテクチャを採用することで、固定スキャンから意味推論へとパラダイムシフトを実現しました。このモデルは、因果ストリームクエリとデュアルストリームアテンションメカニズムを採用し、視覚トークンを動的に再配置することで、複雑な文書の自然な読解ロジックをより正確に再構築します。OmniDocBench v1.5ベンチマークにおいて、このモデルは総合スコア91.09%を達成し、前モデルを大幅に上回る性能向上を実現するとともに、OCR認識結果の繰り返し率を大幅に低減し、将来的にフルモーダルエンコーダーを構築するための新たな道筋を示しました。
DeepSeek-OCR 2の主な機能
-
複雑な文書解析このモデルは、表、数式、複数列レイアウトを含む複雑な文書を正確に解析し、自然な読解ロジックを復元することができます。
-
高効率画像圧縮複雑な文書ページでも、わずか256~1120個のビジュアルトークンで表現できるため、計算負荷を大幅に削減できます。
-
動的な意味的再編成このモデルは、因果フロークエリを使用して、画像の意味に基づいて視覚トークンの順序を動的に調整し、従来の固定スキャン方式の限界を打破します。
-
高精度認識OmniDocBench v1.5ベンチマークでは、総合スコア91.09%を達成し、前バージョンを大幅に上回る性能を示し、特に読み上げ順序認識において優れたパフォーマンスを発揮しました。
DeepSeek-OCR 2の技術原理
-
DeepEncoder V2アーキテクチャ:ビジュアルトークナイザーは、SAMベースと2つの畳み込み層を使用して画像をビジュアルトークンに離散化し、出力次元は896です。本稿では、視覚トークンが双方向アテンションを使用し、因果フロークエリが因果アテンションを使用して意味的な並べ替えを実現する因果フロークエリを導入する。
-
因果推論メカニズム:因果フロークエリを通じて視覚トークンを動的に再配置することにより、エンコーダーは画像の意味に基づいてトークンの順序を動的に調整できる。このメカニズムはLLMの一方向性注意パターンと非常に整合性が高く、連続的な視覚的意味論によりよく適合する。
-
デコーダ:私たちは引き続き、DeepSeek-OCRのDeepSeek-MoEデコーダーを使用しており、そのパラメータ規模は30億で、推論時には約5億のパラメータがアクティブ化されます。
-
トレーニングプロセス:これはエンコーダの事前学習、クエリ拡張、デコーダの特化という3つの段階に分かれています。多段階最適化によってモデルのパフォーマンスが向上します。
DeepSeek-OCR 2のプロジェクトアドレス
- GitHubリポジトリ:https://github.com/deepseek-ai/DeepSeek-OCR-2
- ハギングフェイスモデルライブラリ:https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
- 技術論文:https://github.com/deepseek-ai/DeepSeek-OCR-2/blob/main/DeepSeek_OCR2_paper.pdf
DeepSeek-OCR 2の応用シナリオ
-
文書処理とデジタル化このモデルは、紙文書を編集可能な電子文書に迅速に変換でき、複雑なレイアウトや多言語コンテンツの高精度な認識をサポートしており、図書館や公文書館などの機関におけるデジタル作業に適しています。
-
学術研究および科学研究学術論文中の数式、図表、複数列のテキストを効率的に解析し、研究者が重要な情報を迅速に抽出し、文献レビューやデータ分析の効率を向上させるのに役立ちます。
-
エンタープライズオフィスオートメーションこのモデルは、契約書や報告書などの文書から重要な情報を自動的に識別できるため、企業文書の迅速なレビュー、アーカイブ、検索を支援し、オフィスの効率性を向上させます。
-
教育教科書や試験問題などの文書を迅速にデジタル化し、オンライン授業や電子試験をサポートし、教師や学生が学習資料を整理するのを支援し、教育と学習の効率を向上させることができます。
-
出版とメディアこのモデルは、雑誌や新聞の複雑なレイアウトを迅速に解析し、電子版の制作とコンテンツ配信をサポートし、メディア業界が効率的なコンテンツ制作と管理を実現するのに役立ちます。