AB
AiBoss
project

GOT-OCR2.0 - 多言語およびマルチモーダル認識、多様な入出力に対応したオープンソースのエンドツーエンドOCRモデル。

GOT-OCR 2.0は、OCR技術を2.0時代へと押し上げる高度な光学文字認識(OCR)モデルです。GOT-OCR 2.0のエンドツーエンドモデルは、テキストを処理できる高圧縮エンコーダと長コンテキストデコーダで構成されています。

GOT-OCR2.0とは何ですか?

GOT-OCR 2.0は、高度な光学文字認識(OCR)モデルであり、OCR技術を2.0時代へと押し上げます。エンドツーエンドのGOT-OCR 2.0モデルは、高圧縮エンコーダと長コンテキストデコーダで構成され、テキスト、数式、分子式、チャート、楽譜、幾何学的図形など、さまざまな光学文字を処理できます。GOT-OCR 2.0は、中国語と英語をはじめとする複数の言語をサポートし、MarkdownやLaTeXなどのさまざまなフォーマット形式で結果を出力できます。このモデルは、領域レベルの認識や動的解像度戦略、マルチページOCR技術などのインタラクティブなOCR機能を備えており、高解像度画像やバッチ文書処理に適しています。GOT-OCR 2.0は5億8000万個のパラメータと1.43GBのモデルサイズを持ち、正確かつ効率的なOCRソリューションを提供します。

GOT-OCR2.0の主な機能

  • 多言語およびマルチモーダル認識中国語や英語を含む複数の言語のテキスト認識に対応しており、手書き文字と印刷文字の両方を認識できます。
  • 多様な入出力写真、文書、スライスなどの様々な入力形式に対応し、プレーンテキスト、Markdown、TikZ、SMILES、Kernなどの出力形式をサポートしています。
  • 長文処理このデコーダーは最大8KBのトークンサイズをサポートしているため、学術論文や法律文書などの長文テキスト文書の処理に適しています。
  • 対話型OCR機能座標や色に基づいた領域レベルの認識は、より柔軟なユーザーエクスペリエンスを提供する。
  • 動的解決戦略大型ポスターや複数のPDFページを繋ぎ合わせたような超高解像度画像にも対応し、認識精度を維持します。
  • 複数ページOCR技術複数ページ文書の一括処理は、長いPDFファイルや画像が多数含まれる文書の処理効率を向上させます。

GOT-OCR2.0の技術的原則

  • エンコーダ・デコーダアーキテクチャ
    • エンコーダ入力画像を、画像内の視覚情報を捉えた一連の画像トークンに圧縮する役割を担います。
    • デコーダエンコーダーから画像トークン出力を受け取り、テキスト出力に変換します。デコーダーは長いコンテキストをサポートしており、長いテキストを処理できます。
  • 高圧縮率エンコーダエンコーダーは、1024×1024ピクセルの画像を256×1024ピクセルの画像トークンに圧縮します。これにより、高解像度画像の処理が容易になります。
  • ロングコンテキストデコーダーこのデコーダーは最大8Kのトークンシーケンスをサポートし、大量のテキストを含む長いドキュメントを処理できます。
  • 多段階トレーニング戦略
    • 事前トレーニング段階エンコーダーは、大量のテキストデータを用いて事前学習を行い、テキストの視覚的表現を学習します。
    • 合同訓練段階エンコーダーは、より幅広いOCRタスクに対応できるよう、新しいデコーダーと連携してトレーニングされます。
    • トレーニング後の段階デコーダーのさらなるトレーニングにより、高精度OCR、動的解像度、複数ページOCRなどの高度な機能がサポートされます。

GOT-OCR2.0のプロジェクトアドレス

GOT-OCR2.0の応用シナリオ

  • 文書のデジタル化紙媒体の文書(書籍、原稿、法律文書、学術論文など)を電子形式に変換することで、保管、検索、編集を容易にします。
  • シーンテキスト認識道路標識、看板、メニューなど、自然な風景の中からテキストを識別して抽出します。
  • 請求書処理請求書、領収書、請求書からテキスト情報を自動的に認識・抽出することで、財務・会計処理を簡素化します。
  • 認証とセキュリティ銀行取引や空港の保安検査など、個人識別の確認が必要な場面では、パスポート、身分証明書、運転免許証などの情報を識別することができる。
  • 物流と輸送荷物のバーコードと住所情報を自動的に識別することで、物流の仕分けと配送の効率を向上させます。
  • 医療記録管理医師の手書き処方箋、医療記録、その他の医療文書を特定し、デジタル化する。