project
Dolphin - ByteDanceのオープンソース文書解析モデル
Dolphinは、ByteDanceがオープンソース化した軽量かつ効率的な文書解析モデルです。構造を先に解析し、次に内容を解析するという2段階のアプローチに基づいており、第1段階では一連の文書レイアウト要素が生成され、第2段階ではこれらの要素がアンカーポイントとして使用されます。
Dolphinとは何ですか?
Dolphinは、ByteDanceがオープンソース化した軽量かつ効率的な文書解析モデルです。構造を先に解析し、次に内容を解析するという2段階のアプローチを採用しており、第1段階では文書レイアウト要素のシーケンスを生成し、第2段階ではこれらの要素をアンカーとしてコンテンツを並列に解析します。Dolphinは、GPT-4.1やMistral-OCRといったモデルを凌駕する、様々な文書解析タスクにおいて卓越した性能を発揮します。パラメータ数はわずか3億2200万個と小型で高速なDolphinは、テキスト、表、数式など、様々な文書要素の解析に対応しています。Dolphinのコードと事前学習済みモデルは、開発者が利用・研究できるよう公開されています。
Dolphinの主な機能
- レイアウト分析文書内の様々な要素(見出し、図表、表、脚注など)を識別し、自然な読み順で要素のシーケンスを生成します。
- コンテンツ抽出: ドキュメントページ全体を構造化されたJSONまたはMarkdown形式に解析し、後続の処理と表示を容易にします。
- テキスト段落分析文書からテキストコンテンツを正確に識別・抽出するだけでなく、中国語や英語など複数の言語にも対応しています。
- 数式認識インライン数式やブロック数式を含む複雑な数式の認識をサポートし、LaTeX形式で出力します。
- 表分析複雑な表構造の解析、セル内容の抽出、HTML形式の表の生成をサポートしています。
- 軽量建築このモデルは3億2200万個のパラメータを持ち、サイズが小さく、動作が高速で、リソースが限られた環境での使用に適しています。
- 複数の入力フォーマットに対応学術論文、ビジネスレポート、技術文書など、さまざまな種類の文書画像の処理をサポートしています。
- 多様な出力形式解析結果をJSON、Markdown、HTMLなど複数の形式で出力できるため、さまざまなシステムとの統合が容易です。
ドルフィンの技術原理
- ページレベルのレイアウト分析入力文書画像は、Swing Transformerを使用してエンコードされ、視覚的特徴が抽出されます。デコーダに基づいて文書要素のシーケンスが生成され、各要素にはカテゴリ(タイトル、表、グラフなど)と座標位置が含まれます。この段階の目的は、自然な読み順で構造化されたレイアウト情報を生成することです。
- 要素レベルのコンテンツ分析第1段階で生成されたレイアウト情報に基づいて、各要素の部分ビューが元の画像から切り取られます。各要素の内容は、特定のプロンプトを使用して並行して解析されます。たとえば、表はHTML形式専用のプロンプトを使用して解析され、数式とテキスト段落はLaTeX形式専用のプロンプトを共有します。デコーダは、切り取られた要素画像とプロンプトに基づいて、最終的な解析済みコンテンツを生成します。
ドルフィンのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/bytedance/Dolphin
- ハギングフェイスモデルライブラリ:https://huggingface.co/ByteDance/Dolphin
- arXiv技術論文:https://arxiv.org/pdf/2505.14059
- オンラインでデモを体験してください:http://115.190.42.15:8888/dolphin/
Dolphinの応用シナリオ
- 学術研究学術論文中のテキスト、数式、図表を分析し、文献レビューやデータ分析を支援します。
- 商業オフィス契約書のレビューやレポート作成を容易にするため、ビジネス文書から重要な情報を抽出します。
- 教育オンライン学習や多言語教育を支援するため、教科書やテスト用紙をデジタル化する。
- 技術開発技術文書を解析し、コード管理と技術的なコミュニケーションを円滑化する。
- 日常的な用途日々の文書処理を迅速に行い、オフィス業務の効率性を向上させます。