project
EAFormer - 復旦大学が開発したAIテキスト分割フレームワーク
EAFormerは、復旦大学が開発したAIテキスト分割フレームワークです。写真内のテキスト検出に優れており、背景からテキストを正確に分離できます。テキストの輪郭がぼやけていたり、背景が複雑だったりする場合でも、EAFormerは優れた性能を発揮します。
EAFormerとは何ですか?
EAFormerは、復旦大学が開発したAIテキスト分割フレームワークです。写真内のテキストを検出し、背景から正確に分離することに優れています。テキストの輪郭がぼやけていたり、背景が複雑だったりしても、EAFormerは素晴らしい性能を発揮します。画像からテキストを削除したり編集したりしたい人にとって、非常に便利なツールです。EAFormerは、画像内のテキスト操作を容易にするスマートアシスタントです。
EAFormerの主な機能
- テキストを検索EAFormerは、写真や画像内のすべてのテキストを素早く検索できます。
- アウトラインコーナー文字を検出できるだけでなく、文字の輪郭、さらには歪んだ部分までも非常に正確に描写できる。
- 背景を変更する画像からテキストを削除して新しい背景に置き換えたい場合、EAFormerを使えばテキストが最初から存在しなかったかのように見せることができます。
- 新しい技を習得しようEAFormerは、新しい言語や異なる言語に遭遇した場合、迅速に学習して認識能力を向上させることができます。
EAFormerの技術原則
- テキストエッジ抽出器Cannyアルゴリズムを用いて画像の輪郭を検出し、軽量なテキスト検出モデルを組み合わせることで、非テキスト領域の輪郭を除去し、テキスト領域の輪郭情報のみを保持する。
- エッジガイドエンコーダSegFormerフレームワークをベースに構築されたこのモデルは、対称的なクロスアテンション層を通してエンコード処理中にエッジ情報を組み込むことで、テキストのエッジを認識する能力を向上させています。
- MLPデコーダーこの手法では、多層パーセプトロン(MLP)層を用いて特徴を融合し、最終的なテキストマスクを予測することで、テキスト領域の正確なセグメンテーションを実現します。
- 損失関数設計この手法では、最適化のために、テキスト検出損失とテキスト分割損失という2種類の交差エントロピー損失を使用します。ハイパーパラメータによってこれら2つの損失の重みのバランスを取ることで、ハイパーパラメータ選択の複雑さを軽減します。
- データセットのラベル付け直しCOCO_TSやMLT_Sなどのデータセットにおけるアノテーション品質の問題に対処するため、評価結果の信頼性とモデルトレーニングの精度を確保するために、これらのデータセットを再アノテーションしました。
- 機能融合戦略エッジ誘導エンコーダでは、設計された対称的なクロスアテンション機構により、エッジ情報は第1層でのみ融合され、すべての層でエッジ情報を融合することによって生じる可能性のある性能低下を回避します。
- 軽量テキスト検出器ResNetベースのバックボーンネットワークやMLPデコーダーなど、テキストエッジ抽出器で使用され、テキスト領域の特徴を抽出し、エッジフィルタリングを支援します。
EAFormerプロジェクトのアドレス
-
GitHub倉庫:https://hyangyu.github.io/EAFormer/
-
arXiv技術論文:https://arxiv.org/abs/2407.17020
EAFormerの応用シナリオ
- シーンテキスト認識自然な風景や画像の中からテキストを識別・分割し、情報抽出やデータマイニングに活用します。
- 画像編集これは、画像編集ソフトウェアが画像内のテキストを正確に消去または置換する際に、背景の自然さと一貫性を維持するのに役立ちます。
- 広告ブロック動画ストリームや画像内の広告やその他の不要なテキストを自動的に検出し、ブロックします。
- 著作権保護著作権で保護されたテキストを特定して保護し、無断複製や配布を防止するのに役立ちます。
- 文書処理自動文書スキャンおよびデジタル化におけるテキスト認識は、文書処理の効率と精度を向上させる。