AB
AiBoss
project

SmolDocling - 軽量なマルチモーダル文書処理モデル

SmolDocling(SmolDocling-256M-preview)は、高効率かつ軽量なマルチモーダル文書処理モデルです。文書画像をエンドツーエンドで構造化テキストに変換でき、テキスト、数式、グラフなど様々な要素の認識をサポートします。

SmolDoclingとは何ですか?

SmolDocling(SmolDocling-256M-preview)は、高効率かつ軽量なマルチモーダル文書処理モデルです。文書画像をエンドツーエンドで構造化テキストに変換でき、テキスト、数式、グラフなど様々な要素の認識をサポートします。学術論文や技術レポートなど、様々な種類の文書に適しています。このモデルはパラメータ数がわずか256M個で、高速な推論速度(A100 GPUで1ページあたりわずか0.35秒)を実現し、Doclingと完全に互換性があり、複数のフォーマットへのエクスポートが可能です。

SmolDoclingの主な機能

  • マルチモーダル文書変換画像ドキュメントを効率的に構造化テキストに変換でき、科学文書と非科学文書の両方をサポートします。
  • 迅速な推論A100 GPUでは、文書の1ページを処理するのにわずか0.35秒しかかからず、使用するビデオメモリは500MB未満です。
  • OCRとレイアウト認識光学文字認識(OCR)をサポートし、文書構造と要素の境界ボックスを保持します。
  • 複合要素認識コードブロック、数式、図表、表などの複雑な文書要素を認識できます。
  • Doclingとのシームレスな統合結果を複数の形式(Markdown、HTMLなど)に変換することをサポートしており、Doclingとの互換性があります。
  • 指揮支援ページをDocling形式に変換したり、グラフを表に変換したり、数式をLaTeXに変換したりするなど、さまざまなコマンドをサポートしています。

SmolDoclingの技術原則

  • 軽量設計SmolDocling-256M-previewは、わずか256M個のパラメータしか含まないビジュアル言語モデルで、文書の光学文字認識(OCR)と変換に特化して設計されています。500MB未満のビデオメモリを使用し、コンシューマー向けGPU上で文書を高速に処理でき、1ページあたりの処理時間はわずか0.35秒です。
  • ビジュアルバックボーンネットワークこのモデルは、視覚的なバックボーンネットワークとしてSigLIPベースパッチ16/512を使用し、9300万個のネットワークパラメータを持つことで、画像入力の効率的な処理を可能にしています。ピクセル圧縮技術により、各512×512ピクセルの画像パッチは64個の視覚タグに圧縮され、計算リソースの必要量を大幅に削減します。
  • テキストエンコーダーSmolDocling-256M-previewは、1億3500万個のエンコーダパラメータを持つテキストエンコーダとしてSmolLM-2を使用しており、テキスト入力を処理して視覚情報と融合させることができます。
  • マルチモーダル融合と出力このモデルは、画像とテキストのマルチモーダル入力を受け取り、構造化されたテキスト出力を生成できます。文書画像を構造化テキストに変換したり、グラフや表から情報を抽出したり、数式をLaTeX形式に変換したりするなど、さまざまな文書処理機能をサポートしています。
  • 最適化されたデータセットとトレーニング戦略SmolDocling-256M-previewのトレーニングデータセットには、科学文書と非科学文書の両方が含まれており、文書理解が全体の41%を占めています。トレーニング中は、より高いピクセルラベル付け率(4096ピクセル/ラベル)が使用され、以前の1820ピクセル/ラベルと比較して効率が大幅に向上しました。

SmolDoclingのプロジェクトアドレス

SmolDoclingの応用シナリオ

  • 文書変換とデジタル化SmolDocling-256M-previewは、画像ベースのドキュメントを構造化されたテキスト形式に効率的に変換し、元のドキュメントのレイアウトや複雑な要素(コードブロック、数式、グラフなど)を保持します。MarkdownやHTMLを含む複数の出力形式をサポートしているため、デジタルドキュメント処理に適しています。
  • 科学文書および非科学文書の処理非科学的なコンテンツ(ビジネス文書、特許文書など)も処理できます。また、数式、図表、表など、文書から重要な情報を識別して抽出することも可能です。
  • 高速OCRとレイアウト認識SmolDocling-256M-previewは、効率的な光学文字認識(OCR)機能を提供し、文書の構造と要素の境界ボックスを維持しながら、画像からテキストを正確に抽出します。
  • モバイル端末および低リソース端末のサポートSmolDocling-256M-previewは、スマートフォンやノートパソコンなどのモバイルデバイスやリソースが限られた環境でも動作します。