AB
AiBoss
project

DeepSeek-OCR - DeepSeekチームによるオープンソースの視覚言語モデル。

DeepSeek-OCRは、DeepSeekチームが開発した視覚言語モデルで、光圧縮技術を用いて長文テキストコンテンツを効率的に処理することに重点を置いています。このモデルは、DeepEncoderエンコーダーとDeepSeek3B-MoEデコーダーで構成されています。

DeepSeek-OCRとは何ですか?

DeepSeek-OCRは、DeepSeekチームが開発したビジュアル言語モデルで、光学圧縮技術を用いて長文テキストコンテンツを効率的に処理することに重点を置いています。このモデルは、DeepEncoderエンコーダーとDeepSeek3B-MoEデコーダーで構成されており、高解像度の入力を維持しながら、アクティベーションメモリとビジュアルタグの数を大幅に削減します。10倍の圧縮率で97%のOCR精度を達成し、20倍の圧縮率でも60%の精度を維持します。DeepSeek-OCRは複数の解像度モードをサポートし、多言語文書の処理に適しており、図表や化学式などの複雑なコンテンツを解析できるため、大規模な文書処理に効率的なソリューションを提供します。

DeepSeek-OCRの主な機能

  • 視覚的なテキスト圧縮視覚的な要素を用いて長文テキストを効率的に圧縮することができ、7~20倍の圧縮率を実現します。
  • 多言語OCR中国語、英語、アラビア語、シンハラ語など、約100の言語での文書認識に対応しています。
  • 詳細な分析グラフ、化学式、幾何学的図形などの複雑な内容を分析できます。
  • マルチフォーマット出力レイアウト付きのMarkdown形式と、レイアウトなしの無料OCR形式をサポートしています。

DeepSeek-OCRの技術原理

  • コアアーキテクチャDeepSeek-OCRは2つの部分から構成されています。
    • DeepEncoder入力画像(ドキュメント)を視覚的なトークンにエンコードする役割を担います。
    • DeepSeek-3B-MoE-A570Mデコーダーとして、視覚的なトークンをテキストにデコードする役割を担います。
  • DeepEncoderDeepEncoderはDeepSeek-OCRの中核となるコンポーネントであり、高解像度入力に対して高い圧縮率を実現しながら、アクティブメモリ使用量を低く抑えるように設計されています。DeepEncoderは以下の部分で構成されています。
    • ツインタワー
      • SAM-base (80M)ウィンドウアテンションに基づいており、主に局所的な特徴を認識するために使用され、高解像度の入力を処理する際のメモリ使用量が少ないという特徴があります。
      • CLIP-large (300M)これはグローバルアテンションに基づいており、グローバルな意味情報を抽出するために使用されます。入力が圧縮されているため、グローバルアテンションコンポーネントのメモリ使用量を効果的に制御できます。
    • 16×畳み込み圧縮層DeepEncoderは、SAMとCLIPの間で16倍畳み込み圧縮モジュールを使用します。このモジュールは、2つの畳み込み層(それぞれストライド2)を使用して、ビジュアルトークンの数を4096から256に削減します。この設計により、重要な情報を失うことなく、ビジュアルトークンの数を大幅に削減し、メモリ使用量を低減できます。
    • マルチ解像度対応DeepEncoderは、Tiny、Small、Base、Large、Gundamなど、複数の解像度モードをサポートしています。各モードは、異なる入力解像度とビジュアルトークンの数に対応しています。例:
      • Tiny解像度512×512、出力ビジュアルトークン数64。
      • Small: 解像度640×640、ビジュアルトークン100個を出力します。
      • Base解像度1024×1024、出力ビジュアルトークン数256。
      • Large解像度1280×1280、出力ビジュアルトークン数400。
      • Gundam動的解像度は、より高解像度の入力をサポートし、チャンク処理によってアクティブメモリをさらに削減します。
  • デコーダー: DeepSeek-3B-MoE-A570MDeepSeek-3B-MoEアーキテクチャに基づくデコーダは、5億7000万個のアクティベーションパラメータを持ちます。圧縮されたビジュアルトークンをテキストにデコードする役割を担います。デコーダは、非線形マッピングによってビジュアルトークンをテキスト表現に変換します。具体的には、以下の式を使用します。 これは視覚トークンの数です。 これはテキストトークンの数です。 そして これらはそれぞれ、ビジュアルトークンとテキストトークンの寸法です。

DeepSeek-OCRプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/deepseek-ai/DeepSeek-OCR
  • ハギングフェイスモデルライブラリ:https://huggingface.co/deepseek-ai/DeepSeek-OCR
  • 技術論文:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

DeepSeek-OCRの応用シナリオ

  • 大規模なトレーニングデータ生成このシステムは毎日数十万ページもの文書を自動的に処理し、大規模な言語モデルや視覚言語モデルのための膨大な量の高品質な学習データを提供する。
  • 企業レベルの文書デジタル化企業内の紙の契約書や報告書など、さまざまな文書を、検索や編集が可能なデジタル形式に迅速かつ正確に変換できます。
  • 学術研究および文書処理このソフトウェアは、数式、化学式、図表など、学術論文に含まれる複雑な内容を正確に解析し、構造化された機械可読形式に変換します。
  • 多言語国際化文書処理多国籍企業や組織のグローバルビジネスにおける多言語文書処理ニーズに容易に対応できます。
  • 財務およびビジネスインテリジェンス分析調査レポート内のグラフを詳細に分析し、構造化データに変換することで、財務分析や投資判断を自動的に支援します。