project
NVIDIA Ingest - NVIDIAのオープンソースのインテリジェントな文書抽出および構造化ツール
NVIDIA Ingestは、複雑で整理されていない非構造化PDFやその他の企業文書を解析するための、NVIDIAが提供するオープンソースのマイクロサービス群です。NVIDIA Ingestは文書をメタデータとテキストに変換し、検索システムへの埋め込みを容易にします。
NVIDIA-Ingestとは何ですか?
NVIDIA Ingestは、複雑で扱いにくい非構造化PDFやその他の企業文書を解析するためのNVIDIAのオープンソースマイクロサービス群です。NVIDIA Ingestは文書をメタデータとテキストに変換し、検索システムへの埋め込みを容易にします。PDF、Word、PowerPoint、画像など、複数の文書形式をサポートし、スループットと精度をバランスよく調整する様々な抽出方法を提供します。NVIDIA Ingestは、テキスト分割、変換、フィルタリング、埋め込み生成、画像保存などの前処理および後処理操作をサポートします。並列文書処理に基づいて、NVIDIA Ingestは抽出効率を向上させ、抽出したコンテンツをMilvusなどのベクターデータベースに埋め込むことをサポートするため、大規模な文書処理や生成アプリケーションに適しています。
NVIDIA-Ingestの主な機能
- 複数フォーマットのドキュメントをサポートPDF、Word(Docx)、PowerPoint(Pptx)、画像など、さまざまな複雑な企業向け文書形式の解析をサポートしています。
- 複数の抽出方法複数の抽出方法に対応しており、処理能力と精度のバランスを取ることができます。例えば、PDF文書はpdfium、Unstructured.io、Adobe Content Extraction Servicesなどを使用して抽出できます。
- コンテンツの分類と抽出文書の内容は、テキスト、表、グラフ、画像に分類され、それぞれのカテゴリから内容が抽出されます。抽出された内容をさらに文脈化し、明確に定義されたJSON形式に変換するために、光学文字認識(OCR)技術が使用されます。
- 並列処理ドキュメントをページに分割し、各ページからコンテンツを並行して抽出する機能をサポートしており、処理効率を向上させます。
- 前処理と後処理テキストの分割とチャンキング、コンテンツ変換、フィルタリング、埋め込み生成、画像保存など、さまざまな前処理および後処理操作をサポートしています。
NVIDIA-Ingestの技術的原理
- マイクロサービスアーキテクチャマイクロサービスアーキテクチャに基づき、各マイクロサービスはテキスト抽出、画像抽出、表抽出などの特定の処理タスクを担当することで、システムの拡張性と柔軟性を向上させています。
- GPUアクセラレーションNVIDIAのGPU技術、特にH100およびA100 GPUをベースとしており、文書の解析とコンテンツ抽出処理を高速化します。GPUの並列処理能力により、特に大量の文書を処理する際に、処理効率が大幅に向上します。
- 光学文字認識(OCR)OCR技術を用いて、文書内の画像や表を読みやすいテキストに変換します。NVIDIA-Ingestは、PaddleOCRなどの複数のOCRエンジンを統合することで、テキスト認識の精度と効率を向上させています。
NVIDIA-Ingestプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/NVIDIA/nv-ingest
NVIDIA-Ingestのアプリケーションシナリオ
- エンタープライズコンテンツ管理紙文書、PDF、Word文書、PowerPointプレゼンテーションを検索可能で編集可能なデジタル形式に変換し、知識共有とコラボレーションを支援します。
- インテリジェントカスタマーサービスシステムユーザーがアップロードした文書を解析し、重要な情報を抽出し、自動応答を生成することで、顧客サービスの効率とユーザー満足度を向上させます。
- 法律およびコンプライアンス分野契約書や法的文書を分析し、重要な条項や条件を抽出し、コンプライアンスチェック、リスク評価、およびケース管理を支援します。
- 金融業界財務報告書、契約書、市場調査文書を分析して重要なデータを抽出し、リスク評価、コンプライアンス監視、顧客デューデリジェンスを支援します。
- 健康管理医療記録を構造化データに変換し、電子カルテ管理、臨床研究、および医用画像解析を支援する。