project
Mistral OCR 4 - Mistral AIの最新世代文書理解モデル
Mistral OCR 4は、Mistral AIが開発した最新世代の文書理解モデルです。このモデルは、PDF、画像、プレゼンテーションなどの複雑な文書からテキストを抽出することをサポートしており、境界ボックスの位置特定、領域タイプの分類、信頼度スコアなどを返すことができます。
Mistral OCR 4とは何ですか?
Mistral OCR 4は、Mistral AIが提供する最新世代の文書理解モデルです。このモデルは、PDF、画像、プレゼンテーションなどの複雑な文書からテキストを抽出することができ、境界ボックスによる位置特定、領域タイプの分類、信頼度スコアを含む構造化された出力を返します。170言語に対応し、RAG(リソースアクセスグループ)、エージェントワークフロー、エンタープライズ検索などの下流シナリオ向けに設計されています。
Mistral OCR 4の主な機能
- 高精度文書解析PDF、DOC、PPT、OpenDocumentなどの一般的な企業向けフォーマットをサポートし、テキスト、表、数式、画像、署名などの豊富な要素を抽出します。
- 構造化された出力各コンテンツブロックには、境界座標、タイトル、表、数式、署名などのタイプタグ、およびページごと/単語ごとの信頼度スコアが含まれています。
- 多言語対応このシステムは10の言語族にわたる170の言語を網羅しており、特にリソースの少ない言語において優れた性能を発揮する。
- デュアルモード出力同じエンドポイントは、純粋な抽出モード、Markdown + 構造化メタデータ、およびドキュメントAIモード(カスタムスキーマに従って構造化JSONを出力)をサポートしています。
- 超高スループット単一ノードで毎分最大2,000ページの文書を処理できるため、大規模なバッチ処理シナリオに適しています。
Mistral OCR 4の技術的原理
- 視覚的なテキスト検出と分類CNN/Transformerアーキテクチャに基づいて、文書内のテキスト領域を特定し、各領域を意味的に分類することで、元の文書の階層構造を復元します。
- シーケンス・ツー・シーケンスのテキスト認識検出された文字ストリームは、Seq2SeqまたはCTCモデルを使用して編集可能なテキストに変換され、認識精度を向上させるために画像前処理が組み合わされます。
- 構造化された意味的チャンキングこれは、文書をタイプラベルと座標を持つ意味的なブロックに分割し、下流のRAGシステムに検索に直接使用できる参照可能な単位を提供するとともに、エージェントが構造化された操作を実行できるように支援します。
- 単一コンテナによる軽量展開このモデルは、単一コンテナ内での自己ホスト型デプロイメントを可能にするほどコンパクトであり、データ所在地の要件とコンプライアンス要件を満たします。
Mistral OCR 4 の使い方
- APIキーを取得するには登録してくださいMistral AI開発者プラットフォーム(La Platformforme)にアクセスし、アカウントを登録した後、「APIキー」ページに移動してキーを作成して保存してください。
- SDKをインストールするPython環境で実行する
pip install mistralai公式SDKをインストールしてください。 - ドキュメントを処理するためにAPIを呼び出す 使用
client.ocr.process()このメソッドは、ドキュメントのURLまたはローカルファイルを入力として受け取り、設定します...model="mistral-ocr-latest"そして電源を入れるinclude_blocks=True境界線や文字情報を取得するには、他にも以下の方法があります。confidence_scores_granularity="word"一語一語に自信をつけて。 - 構造化された結果を解析するAPIは、以下の情報を返します...
pagesページごとの配列のJSONmarkdown文章、images、tables、hyperlinks、dimensionsそしてconfidence_scoresこのようなフィールドは、RAGやエージェントのワークフローに直接統合できます。 - コスト削減のためのバッチ処理高スループットのシナリオでは、バッチ推論APIを介してタスクを送信することで、50%の割引料金が適用されることをお勧めします。
Mistral OCR 4の主な利点
-
人間はリードすることを好む独立した人間による評価において、OCR 4は平均勝率72%を達成し、OmniDocBenchで93.07、OlmOCRBenchで85.20のスコアを記録しました。その出力品質は人間から高く評価され、GPT 5.5 ProやGemini 3.1 Pro Previewといった最先端のモデルを凌駕しました。
-
究極のコスト効率とスピードRogoの実際のテスト結果によると、1,000ページあたりわずか4ドル(バッチ処理の場合は2ドル)のコストで、1つのノードで毎分2,000ページを処理できる。コストは主要なインテリジェントエージェントパーサーの約8分の1、レイテンシは17分の1と非常に低い。
-
参照可能なきめ細かな出力境界線、種類、信頼度レベルの3つのラベル付けにより、RAGシステムはクリック可能な参照情報付きのソース追跡回答を提供し、信頼度の低い領域を自動的に人間のレビューに振り分けることができます。
- 統合エンドポイントデュアルモードインターフェースを切り替える必要はありません。同じエンドポイントで、エンジニアの当初のデータ抽出ニーズと、ビジネス担当者のスキーマベースの構造化出力ニーズの両方を満たすことができます。
ミストラルOCR 4プロジェクトの住所
- プロジェクト公式サイト:https://mistral.ai/news/ocr-4/
Mistral OCR 4と類似の競合製品との比較
| 比較対象寸法 | Mistral OCR 4 | MOCR |
|---|---|---|
| 研究開発 | ミストラルAIフランス | 華中科技大学 + 暁紅樹hi研究室 |
| リリース時間 | 2026年6月 | 2026年3月 |
| モデルサイズ | 非公開(小規模集中型モデル) | 3Bパラメータ(ビジュアルエンコーダー1.2B + Qwen2.5-1.5Bデコーダー) |
| オープンソース/クローズドソース | 非公開ソース(クラウドAPI+単一コンテナによるセルフホスティング) | オープンソース(Apache 2.0,HuggingFace / ModelScope / GitHub) |
| OmniDocBench | 93.07 | 具体的なスコアは公表されていない(バージョン1.5でテスト済み)。 |
| OlmOCR Bench | 85.20 | 83.9(オープンソースモデル、自社所有) |
| OCR Arena Elo | 非公開 | 2位(ジェミニ3プロに次ぐ性能) |
| 勝率の人間による評価 | 平均72%(全競合他社との比較) | 非公開の独立した人間による評価データ |
| 言語対応範囲 | 170言語(10の言語グループ) | 多言語対応(具体的な言語数は明記されていないが、中国語、日本語などがサポートされている)。 |
Mistral OCR 4の応用シナリオ
-
エンタープライズレベルのRAGナレッジベースこのシステムは、契約書、研究報告書、マニュアルなどのスキャンされた文書を、引用情報を含む構造化された検索単位に変換し、Mistral Search Toolkitと統合することで、追跡可能な質問応答を実現します。
-
インテリジェントエージェントによる自動化されたワークフロー請求書処理やフォーム入力などのインテリジェントエージェント向けに、タイプラベルと座標を備えた構造化フィールドを提供し、文書からアクションへの自動的な流れを可能にします。
-
信頼度レベルレビューパイプライン単語ごとの信頼度スコアに基づいて、信頼度の高いコンテンツは自動的にデータベースに保存され、信頼度の低い領域は手動検証に回されることで、効率性と正確性のバランスが取られています。
-
エンタープライズ検索とコンプライアンス監査データアクセスコンポーネントとして、金融、法律、政府などの業界におけるコンプライアンスおよび監査のニーズを満たすために、膨大な非構造化文書に対してエンティティ抽出とインデックス構築を実行します。