AB
AiBoss
project

Chronicles-OCR - テンセントが大学やその他の機関と協力して立ち上げた、視覚認識能力評価のベンチマーク。

Chronicles-OCRは、テンセント渾源、中国科学院情報工学研究所、安陽師範大学、南開大学、故宮博物院が共同で開発した業界初の時系列横断型技術であり、漢字の「七つの書体」の完全な進化の軌跡を網羅しています。

Chronicles-OCRとは何ですか?

Chronicles-OCRは、テンセント渾源、中国科学院情報工学研究所、安陽師範大学、南開大学、故宮博物院が共同で立ち上げた、業界初の時系列横断型視覚認識評価ベンチマークです。中国語の「七書体」の完全な進化の軌跡を網羅しています。このベンチマークには2,800枚の高画質画像が含まれており、甲骨文字、青銅文字、篆書、字書、楷書、行書、草書の7つの主要な書体を網羅しています。段階適応型注釈パラダイムと4つの評価タスクを通じて、数千年にわたる中国語文字の形態の継続的な進化に対する視覚的大規模言語モデルの知覚的堅牢性を評価します。

Chronicles-OCRの主な機能

  • 7つの身体の総合評価本書は、甲骨文字、青銅文字、篆書、書道、楷書、行書、草書という7つの主要な中国語文字を完全に網羅し、殷王朝から現代に至るまでの時代を超えた評価システムを構築している。
  • ステージ適応型アノテーション古代文字(甲骨文字/青銅文字/篆書)については、文字単位の境界ボックスと現代中国語の文字マッピング注釈を提供し、成熟したフォント(楷書体/楷書体/行書体/草書体)については、異なる歴史的段階の形態的差異に適応するためのシーケンスレベルのレイアウト理解注釈を提供します。
  • 4つの主要な評価タスク本モデルは、時代を跨いだ文字位置特定、高精度な古代文字認識、古代テキストの解析、フォント分類をサポートしており、モデルの能力を包括的に評価できる。
  • 視覚参照機構画像中の対象文字を色付きの枠で囲むことで、モデルにそれらを認識させることが可能になり、文字解読能力と空間位置特定能力を分離して評価することができる。
  • 高品質な専門家による注釈フォント分類、境界ボックスの位置決め、文字転写の精度を高めるため、博士号取得者、大学院生、古文書学の専門家による多段階の相互注釈が行われた。
  • 信頼できるデータソースの統合甲骨文字は安陽師範大学の甲骨文字情報処理重点実験室から、青銅器文字/篆書は古文書学チームによって、そして楷書/楷書/行書/草書は故宮博物院所蔵の文化財の手書き文字認識テストデータセットから得られたものです。
  • モデルの堅牢性診断本研究は、数千年にわたる漢字の形態進化の過程における視覚的大規模言語モデルの知覚能力を体系的に評価し、現代の文書解析を歴史的な文字体系に一般化する際の重要なボトルネックを明らかにする。

Chronicles-OCRの使い方

  • オープンソースリポジトリにアクセスするデータセット、論文、評価コードを入手するには、GitHubリポジトリ(https://github.com/VirtualLUOUCAS/Chronicles-OCR)にアクセスしてください。
  • データセットをダウンロード甲骨文字、青銅文字、印章文字、書道文字、普通文字、行体文字、筆記体文字をそれぞれ400枚ずつ含む、合計2,800枚の画像からなる完全なデータセットと、JSONまたはXML形式の注釈ファイルを入手してください。
  • データ形式の理解読解段階における適応型注釈標準:古代文字段階(甲骨文字/青銅文字/篆書)では、単一文字レベルの境界ボックス座標+現代中国語文字マッピング。成熟文字段階(楷書/楷書/行書/草書)では、シーケンスレベルのテキストレイアウトと読解順序注釈。
  • 評価タスクを選択してください研究目的に基づき、以下の4つのタスクが選定された。すなわち、時代を跨いだ文字の位置特定、高精度な古代文字認識、古代テキストの解析、およびフォント分類である。
  • テスト対象モデルを準備する評価対象となるビジュアルラージランゲージモデル(VLLM)をデプロイし、モデルが画像入力とテキスト出力の両方の機能をサポートしていることを確認します。
  • 実行モデル推論データセットの画像をモデルに入力し、タスクの要件(境界ボックスの座標、現代中国語の文字表記、フォントカテゴリなど)に従って対応する結果を出力します。
  • 評価スクリプトを実行しますリポジトリが提供する公式評価コードを使用して、モデルの出力を標準アノテーションと比較し、各タスクの指標(位置精度、NED編集距離、分類精度など)を自動的に計算します。
  • 分析および評価結果ベンチマークレポートのモデル性能データを比較することで、古代文字の認識、歴史的なレイアウトの理解、フォントの進化の認識といった観点から、テスト対象モデルの限界と欠点を診断することができる。
  • 引用とフィードバック関連する研究論文ではarXiv:2605.11960v1を引用し、使用上の問題点や改善点に関するフィードバックはGitHub Issuesを通じて著者チームに提供してください。

Chronicles-OCRの主な利点

  • 業界初の時系列評価システム中国語の「七つの書体」(甲骨文字、青銅文字、篆書体、字体、楷書体、行書体、草書体)の完全な進化の軌跡を網羅する初のシステムは、視覚的認識評価の基準を提供し、殷王朝から現代までの期間にわたる評価のギャップを埋めるものである。
  • 一流の学術機関が共同で支持する本製品は、テンセント渾源、中国科学院情報工学研究所、安陽師範大学甲骨文字情報処理重点実験室、南開大学、故宮博物院が共同で開発・発表しました。データソースと注釈の品質は、厳格な学術審査を受けています。
  • 段階的適応型アノテーションパラダイムの先駆者異なる歴史的時代におけるフォントの劇的な形態変化に対処するため、このアプローチでは、古代の文字段階における単一文字の配置とマッピングと、成熟したフォント段階におけるシーケンスレベルのレイアウト理解を区別し、より正確な評価基準を実現している。
  • モデル能力の限界を深く明らかにする本研究は評価データを提供するだけでなく、古代文字のきめ細かな空間位置特定と意味解読における現在の主流のVLLMの壊滅的な失敗を体系的に明らかにし、モデル最適化のための明確な方向性を示すものである。
  • 信頼できるデータソースと専門家による注釈甲骨文字は安養師範大学の専門研究室から入手し、青銅器銘文・篆書は古文書学の博士号取得者チームによって収集し、楷書、行書、草書は故宮博物院の文化財データセットから抽出した。多段階の相互注釈により、高い精度を確保した。
  • 視覚参照分離評価メカニズム色付きのボックスを視覚的な参照として使用することで、文字レベルのデコード機能と空間位置特定機能を分離して評価することができ、特定のモデルの欠点を正確に診断することが可能になります。
  • 完全オープンソースで再現可能論文とデータセットの両方がオープンソース化されており、学術コミュニティによる再現、検証、比較、評価、およびさらなる研究が容易になっている。

Chronicles-OCRと類似の競合製品との比較

比較対象寸法 Chronicles-OCR AncientDoc ACCID
発行機関 テンセント渾源、中国科学院情報工学研究所、安陽師範大学、南開大学、故宮博物院 バイトダンス、北京交通大学など 学術研究機関(論文では特定の機関名は明記されていない)。
データセットのサイズ 厳密にバランスの取れた2,800枚の画像。7つの身体それぞれに400枚ずつ割り当てられている。 100冊以上の古代書物から抜粋した、約3000ページに及ぶ画像。 部首レベルの注釈を含む、2,892点の文字カテゴリ画像。
カバレッジ 主な書体様式は、甲骨文字、青銅文字、印章文字、事務用文字、整体文字、活字体、筆記体である。 古代文書の14のカテゴリー(古典、歴史、哲学、文学、医学、天文学および暦計算、楚辞など) 古代中国文字の画像(部首構造を強調)
期間 およそ3000年(殷王朝から現代まで)。 戦国時代、秦漢王朝から明清王朝まで 古代中国の文字(明確な時代区分なし)
評価課題 時代を跨いだ文字位置特定、高精度な古代文字認識、古代テキスト解析、およびフォント分類 ページレベルOCR、平易な言語翻訳、推論QA、知識QA、言語バリエーションQA ゼロサンプル文字認識、根号認識
ラベル付けの粒度 フェーズベースの適応型デザイン:単一文字レベルの境界ボックスにおける古代中国語文字+現代中国語文字のマッピング;成熟したフォントシーケンスレベルのレイアウト。 ページレベルのテキスト、質問と回答のペア、翻訳ペア 文字レベル+部首レベル(座標と構造を含む)
対象モデル ビジュアル大規模言語モデル(VLLM) 視覚言語モデル(VLM) ゼロショットOCR/深層学習モデル
コアイノベーション 同研究は、時代を横断した漢字の進化評価、段階適応型注釈パラダイム、および視覚参照の分離評価を先駆的に行った。 古代書籍を対象とした初のマルチタスク評価ベンチマーク。OCRから知識推論までを網羅する。 部門レベルでのきめ細かな注釈付けを先駆的に行い、ゼロショット学習を支援する。

Chronicles-OCRの応用事例

  • 古代文字のインテリジェントな認識これは、甲骨文字や青銅文字など、解読が不完全な古代文字の自動識別と専門家による検証を支援し、古文書学研究の敷居を下げる。
  • 古代書籍デジタル化プロジェクト高精度OCRと、様々な王朝の書、拓本、文書の構造化分析は、文化遺産のデジタルアーカイブ化を促進するだろう。
  • フォント進化研究AIモデルを用いて、甲骨文字から楷書体への漢字の形態的進化を分析し、言語学や歴史学における学際的研究を支援する。
  • VLLM能力評価標準化されたベンチマークとして、さまざまな視覚的大規模言語モデルの時間的知覚能力と堅牢性を評価および比較します。
  • 文化遺産情報抽出青銅器の碑文、竹簡、絹本写本などの文化遺物の画像からテキスト情報を抽出し、考古学的調査や遺物の真贋鑑定に役立てる。
  • 教育および一般科学への応用このツールは、漢字文化の教育において、古代の漢字の認識方法を示したり、漢字の進化を視覚化したりするために使用され、それによって一般の人々の漢字の歴史に対する理解を深める。