AB
AiBoss
project

HyOCR-1.5 - テンセント・フンユアンのオープンソース軽量エンドツーエンドOCRエキスパートモデル

HyOCR-1.5は、テンセント・フンユアンがオープンソース化した軽量エンドツーエンドOCRエキスパートモデルです。わずか10億個のパラメータで、文書解析、テキスト認識、情報抽出、画像翻訳、チャート解析、古代文字認識、動画字幕抽出など、幅広い処理を実行できます。

HyOCR-1.5とは何ですか?

HyOCR-1.5は、Tencent Hunyuanがオープンソース化した軽量エンドツーエンドOCRエキスパートモデルです。わずか10億個のパラメータで、文書解析、テキスト認識、情報抽出、画像翻訳、チャート解析、古代文字認識、動画字幕抽出、複数ページ文書の質問応答など、フルスタック機能を実現しています。DFlashの推測的デコードに基づき、長文構造化出力に対して最大6.37倍高速な推論速度を実現し、エンドツーエンドOmniDocBench v1.6で94.74のスコアを獲得し、第1位にランクインしています。

HyOCR-1.5の主な機能

  • 文書解析密度の高い文書、複数列レイアウト、表、数式を、ワンクリックで構造化テキスト(Markdown/HTML/LaTeX)に変換します。
  • テキスト検出と認識画像内のすべてのテキストコンテンツと対応する座標を出力します。文書、街並み、手書き文字、広告、ゲーム、ビデオなど、さまざまなシナリオに対応します。
  • 情報抽出請求書、証明書、領収書から指定されたフィールドを抽出し、JSON形式で返します。
  • 写真翻訳画像からテキストを抽出し、文書のレイアウトと数式書式を保持したまま、複数の言語に翻訳します。
  • チャート分析フローチャートや統計グラフをMermaidまたはMarkdown形式に解析します。
  • 古代中国語の文字認識7種類の漢字(甲骨文字、青銅文字、篆書体、書道体、楷書体、行書体、草書体)の認識をサポートします。
  • 動画字幕抽出動画フレームから字幕テキストを正確に抽出します。
  • 複数ページにわたる文書に関する質疑応答複数ページにわたるPDFファイルに基づいた、ページをまたいだ情報検索、比較、および証拠集約に関する質問応答。

HyOCR-1.5の技術原理

  • 軽量エンドツーエンドアーキテクチャ本システムは、HyOCR-1.0で検証されたコンパクトな設計を採用しており、ネイティブ解像度のビジュアルエンコーダーHunyuan-ViT、適応型MLPコネクタ、軽量言語モデルHunyuan-0.5Bで構成されています。タスクレベルの後処理モジュールを必要とせず、マルチモーダル入力をMarkdown、HTML、LaTeXなどの構造化出力に直接マッピングします。
  • 4Kネイティブ解像度のビジュアルエンコーディングビジュアルエンコーダーはHunyuan-ViTをベースに構築されており、最大入力解像度を2Kから4Kに拡張しつつ、元の縦横比と空間レイアウトを維持することで、高密度文書、超大型表、複雑なレイアウトのきめ細かな構造の詳細を捉えることができる。
  • DFlashの投機的デコード約9070万個のパラメータを持つブロック拡散ドラフトモデルを導入し、単一の並列順伝播で候補トークン全体を予測できるようにした。ターゲットモデルは、単一の伝播で最長の正しい接頭辞を検証し、受け入れる。ターゲットモデルの出力分布を厳密に維持しながら、長文構造OCRのデコード遅延を大幅に削減する。
  • Agentic Data Flowこのインテリジェントエージェントは、データ生成のクローズドループを推進し、モデルの欠点を実行可能なデータ要件に変換します。材料検索、ツール支援によるデータクリーニング、困難な事例のマイニング、データパイプライン開発を自律的に完了し、アルゴリズムエンジニアと継続的に連携します。
  • 3段階トレーニング方式事前学習段階では、ステージ3を再計画し、新しい機能データを注入して4K解像度と128Kコンテキストに拡張します。SFT段階では、データを徹底的にクリーニングし、プロンプトインターフェースを統一します。RL段階では、IcePop(GRPOスタイル)最適化を採用し、事実性、一貫性評価、劣化抑制という3つの補完的な報酬を通じて出力品質を向上させます。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

HyOCR-1.5の使い方

  • 環境準備Python 3.12以降、CUDA 12.9、PyTorch 2.7.1、およびvLLM(0.12.0以上)をインストールしてください。
  • モデルスタートアップ:埋め込む vllm serve tencent/HunyuanOCR サービスを開始するか、ハギングフェイスのウェイトを読み込んでください。
  • 画像入力PILを使用して画像を読み込み、画像とテキストを含むメッセージの会話構造を構築します。
  • 作業手順文書解析、テキスト検出、情報抽出、翻訳など、シナリオに基づいてプロンプトを選択してください。
  • 推論の呼び出しvLLMまたはTransformersを使用して結果を生成し、temperature=0、max_tokens=16384に設定します。
  • 清掃結果組み込みの重複排除機能を使用して、重複する可能性のある部分文字列を削除し、最終的な構造化された出力を取得します。
  • ローカル展開llama.cppを介してCPUまたは一般消費者向けGPU上で動作し、サーバーは不要です。

HyOCR-1.5の主な利点

  • スピード推論DFlashの投機的デコードにより、Transformersでは長文ドキュメントの生成速度が6.37倍、vLLMでは2.14倍向上し、エンドツーエンドのページ生成時間はわずか1.4秒になります。
  • 軽量で展開可能1Bパラメータは、llama.cppを介して、CPU、一般消費者向けグラフィックカード、およびノートパソコン上でローカルに実行できます。
  • SOTAの精度OmniDocBench v1.6は、エンドツーエンドのパフォーマンスで94.74という第1位を獲得し、表のTEDSスコアは93.67で、複雑な表や読み上げ順序において優れたパフォーマンスを示しました。
  • フルスタックのオープンソース学習式、推論フレームワーク、およびモデルの重みは完全に公開されており、再現性、微調整性、および拡張性を備えています。
  • ロングテール機能Agentic Data Flowは、331の低リソース言語、古代文字、複数画像による質問応答など、他に類を見ない機能を追加しています。
  • 高解像度長文コンテキスト4K画像解像度と128Kコンテキストをサポートし、高密度な長文ドキュメントにも対応します。
  • 幻覚抑制CHAOS-Benchモデルは、ページ平均再現率が14.15を達成しており、これは既存のモデルよりも優れており、出力結果も実際に見たものにより忠実である。

HyOCR-1.5プロジェクトの住所

  • GitHubリポジトリ:https://github.com/Tencent-Hunyuan/HunyuanOCR
  • ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/HunyuanOCR
  • arXiv技術論文:https://arxiv.org/pdf/2607.04884

HyOCR-1.5と類似製品との比較

寸法 HyOCR-1.5 DeepSeek-OCR-2
パラメータサイズ 1B(軽量級) 3B(3倍の大きさ)
OmniDocBench 94.74 87.01
エンドツーエンド遅延 1.408秒/ページ 5.460秒/ページ(3.9倍遅い)
表分析TEDS 93.67 約84.97
推論の高速化 DFlashの投機的デコード、Transformersの6.37倍高速化 専用のアクセラレーション機能はなく、純粋な自己回帰デコード方式を採用しています。
導入コスト CPU/ノートパソコンで動作可能 サーバーグレードのGPUが必要

HyOCR-1.5の応用シナリオ

  • 文書の集中的なデジタル化契約書、論文、報告書などの高密度な複数列レイアウトを、読み順とレイアウトを維持したまま、ワンクリックでMarkdown/HTML/LaTeX形式の構造化テキストに変換します。
  • 複雑な表や数式の分析財務諸表や学術論文における大規模な表や数式を正確に再現し、HTML表とLaTeX数式の出力に対応しています。
  • 多言語による国境を越えた文書処理331言語に対応し、複数の言語が混在する文書を自動的に認識・解析する機能を備えており、貿易、法律、出版といったグローバルなビジネスシーンに適しています。
  • 古代文字の研究と保護このシステムは、甲骨文字、青銅文字、篆書体、典礼体など、7種類の漢字を識別することができ、博物館や考古学機関による歴史文書のデジタルアーカイブ化や研究を支援する。