project
Phi-4-reasoning-vision-15B - マイクロソフトのオープンソースのマルチモーダル推論モデル
Phi-4-reasoning-vision-15Bは、Microsoftが開発したオープンソースの150億パラメータを持つマルチモーダル推論モデルであり、Phi-4-Reasoning言語モデルとSigLIP-2ビジュアルエンコーダーに基づいて構築されています。
Phi-4-reasoning-vision-15Bとは何ですか?
Phi-4-reasoning-vision-15Bは、Microsoftが開発したオープンソースの150億パラメータのマルチモーダル推論モデルで、Phi-4-Reasoning言語モデルとSigLIP-2ビジュアルエンコーダーを基盤としています。「ハイブリッド推論」設計を採用したこのモデルは、深い思考(数学/科学の問題)が必要な場合と、迅速な対応(OCR/記述タスク)が必要な場合を自動的に判断します。わずか2000億トークンのトレーニングデータで、精度と効率のバランスを実現しています。特にGUIの理解、数学的推論、文書分析に優れており、推論速度は同様の大規模モデルよりも10倍以上高速です。
Phi-4-reasoning-vision-15Bの主な機能
-
一般的な視覚理解このモデルは、画像コンテンツを分析して説明文を生成したり、画像に関する質問に答えたり、物体、場面、テキスト情報を識別したりすることができる。
-
文書および図表分析このモデルは、さまざまな文書、領収書、請求書、複雑なグラフを読み取り理解し、定量分析のための重要な情報を抽出することができる。
-
数学的および科学的推論このモデルは、数式や図を含む数学や科学の問題を解くことに優れており、手書きの内容を認識して完全な解答過程を表示することもできます。
-
GUI操作と画面理解このモデルは、コンピュータや携帯電話のインターフェースにおけるインタラクティブな要素を認識し、正確な境界ボックス座標を提供し、自動操作エージェントをサポートすることができます。
-
複数画像シーケンス解析このモデルは、複数の画像を処理し、時系列変化を分析し、画像間の相関関係や変化傾向を理解することができる。
-
適応推論モードシステムは、タスクの複雑さに基づいて、直接的な応答と詳細な思考を自動的に選択します。ユーザーは、特別なマーカーを使用して、推論方法を指定するように強制することもできます。
Phi-4-reasoning-vision-15Bの技術的原則
- 建築設計本システムは、中間融合アーキテクチャを採用し、SigLIP-2 Naflex動的解像度ビジュアルエンコーダを使用して画像入力を処理し、ビジュアルトークンを生成し、それらをPhi-4-Reasoning言語モデルの埋め込み空間に投影することで、クロスモーダルな共同推論を実現します。
- ハイブリッド推論メカニズムこのモデルは、推論機能を備えた言語モデルの基盤を継承しています。教師ありファインチューニングにより、推論を必要とするタスク(数学/科学)と知覚タスク(OCR/記述)を区別することを学習します。トレーニングデータは、推論サンプル20%と非推論サンプル80%で構成されており、モデルが推論の深さを適応的に選択できるようになっています。
- 高解像度処理このモデルは、最大3600個のビジュアルトークン(ネイティブ720p解像度に相当)による動的解像度をサポートするSigLIP-2 Naflexバリアントを使用しており、高密度情報インターフェースや小型インタラクティブ要素の認識精度を大幅に向上させます。
- データ戦略このモデルは主に厳選されたオープンソースデータを使用し、手動レビュー、エラー修正、合成データ生成によって品質を向上させています。さらに、ドメイン固有の数学データセットとGUIデータセットを補完的に使用することで、わずか2000億トークンで数兆トークン規模のモデルに匹敵する性能を実現しています。
Phi-4-reasoning-vision-15B のプロジェクトアドレス
- プロジェクト公式サイト:https://www.microsoft.com/en-us/research/blog/phi-4-reasoning-vision-and-the-lessons-of-training-a-multimodal-reasoning-model/
- GitHubリポジトリ:https://github.com/microsoft/phi-4-reasoning-vision-15B
- ハギングフェイスモデルライブラリ:https://huggingface.co/microsoft/Phi-4-reasoning-vision-15B
- 技術論文:https://www.microsoft.com/en-us/research/wp-content/uploads/2026/03/Phi-4-reasoning-vision-15B-Tech-Report.pdf
Phi-4-reasoning-vision-15Bの応用シナリオ
-
教育支援生徒が数学の宿題や物理の図を写真に撮ると、このモデルは手書きの内容を認識し、解答手順の誤りをチェックし、正しい導出過程を提供する。
-
スマートオフィスこのモデルは、請求書や領収書の自動解析、金額、日付、品目などの情報の抽出、会計計算の実行、構造化データ出力の生成をサポートしています。
-
インターフェースオートメーションコンピュータ利用エージェントの基本モデルとして、画面上のボタン、入力ボックス、メニュー要素を識別し、クロスプラットフォームでの自動操作とワークフロー実行を可能にする。
-
モバイルデバイスのサポートこのモデルは、モバイルアプリケーションのインターフェースの理解をサポートし、ユーザーが機能のエントリーポイントを見つけたり、フォームに入力したり、複雑な複数ステップのタスクを実行したりするのに役立ちます。
-
文書分析このモデルは、スキャンされたPDF、グラフ、レポートを処理し、情報抽出、傾向分析、文書間の内容比較を実行できます。