project
Florence-2 - Microsoft Azure AIチームが開発した、汎用性の高いビジュアル言語モデル。
Florence-2は、Microsoft Azure AIが開発した汎用性の高いビジョンモデルであり、画像キャプション生成、物体検出、視覚的位置特定、画像セグメンテーションなど、さまざまなコンピュータビジョンタスクを実行できます。Florence-2はTransformerアーキテクチャに基づいています。
フローレンス2とは何ですか?
Florence-2は、Microsoft Azure AIが開発した汎用性の高いビジョンモデルで、画像キャプション生成、物体検出、視覚的位置特定、画像セグメンテーションなど、さまざまなコンピュータビジョンタスクを実行できます。TransformerアーキテクチャをベースとするFlorence-2は、シーケンス・トゥ・シーケンス学習アプローチを採用しており、エンコーダーが画像をシーケンス表現に変換し、デコーダーがこれらの表現をテキスト出力に変換します。Florence-2は、1億2600万枚の画像と54億件のアノテーションを含む大規模なFLD-5Bデータセットを使用してトレーニングされており、自動画像アノテーション技術とモデルの反復処理を組み合わせることで、高品質で多様なデータを確保しています。
フローレンス2の主な機能
- 画像の説明生成された画像の詳細な説明。画像キャプションに似ています。
- ターゲット検出画像内の特定の物体を識別し、対象物の位置を特定する。
- 視覚的な位置決め画像の中から、テキストプロンプトに関連するオブジェクトまたは領域を特定してください。
- 画像セグメンテーションこれは、画像を異なる領域に分割し、その中の特定の物体を識別して分離する処理です。
フローレンス2号の技術原理
- 統一表現Florence-2は、統一されたフレームワークに基づいて様々な種類の視覚情報と言語情報を統合し、多様な視覚タスクを処理するための統一モデルとして設計されています。
- シーケンス・ツー・シーケンス学習(Seq2Seq)このモデルはシーケンス・トゥ・シーケンス学習方式を採用しており、エンコーダーとデコーダーで構成されています。エンコーダーは入力画像をシーケンス表現に変換する役割を担い、デコーダーはその表現を出力テキストに変換します。
- トランスフォーマーアーキテクチャTransformerアーキテクチャに基づき、自己注意機構を用いて視覚データと言語データを処理し、マルチモーダル情報の融合を実現する。
- 画像エンコーダーDaViTは画像エンコーダーとして使用され、画像の特徴を抽出し、それを視覚的なトークン埋め込みに変換します。
- マルチモーダルエンコーダー・デコーダー標準的なTransformerアーキテクチャに基づいており、自己注意機構を用いて画像情報とテキスト情報を融合し、視覚コンテンツに関連するテキストを理解・生成する。
- ロケーションコーディングこれは領域レベルの空間情報を提供し、物体検出やセグメンテーションなどのタスクにとって不可欠であり、モデルが画像内の特定の領域を識別することを可能にする。
フローレンス2プロジェクトの住所
- プロジェクト公式サイト:florence-2.com
- GitHubリポジトリ:https://github.com/retkowsky/florence-2
- ハギングフェイスモデルライブラリ:https://huggingface.co/microsoft/Florence-2-large
- arXiv技術論文:https://arxiv.org/pdf/2311.06242
Florence-2の応用シナリオ
- 画像および動画分析セキュリティ監視の分野において、Florence-2はビデオ映像内の特定の物体を識別・追跡し、異常な動作を検出します。
- コンテンツモデレーション暴力的なコンテンツ、ポルノ、その他プラットフォームのポリシーに違反する画像や動画など、不適切なコンテンツを自動的に検出してフィルタリングします。
- 運転支援および自動運転自動運転システムにおいては、道路標識、歩行者、車両、その他の障害物を識別するのに役立ち、運転の安全性を向上させる。
- 医用画像解析これは、医師が腫瘍や病変などの医療画像における異常を特定するのに役立ち、それによって診断の精度と効率を向上させる。
- 小売業および在庫管理小売環境においては、棚分析に用いられ、在庫レベルや商品配置を自動的に監視するために使用される。