project
SAM 3 - Metaのオープンソース画像セグメンテーションモデル
SAM 3(Segment Anything Model 3)は、Meta AIの最新の高度なコンピュータビジョンモデルであり、テキスト、例、視覚的な手がかりを用いて、画像や動画内の物体を検出、セグメント化、追跡することができます。
SAM 3とは何ですか?
SAM 3(Segment Anything Model 3)は、Meta AIの最新の高度なコンピュータビジョンモデルであり、テキスト、例、視覚的な手がかりを用いて画像や動画内のオブジェクトを検出、セグメント化、追跡することができます。このモデルは、オープンボキャブラリーのフレーズ入力に対応し、強力なクロスモーダルインタラクション機能を備え、セグメンテーション結果をリアルタイムで修正できます。SAM 3は、画像および動画のセグメンテーションタスクにおいて優れたパフォーマンスを発揮し、既存システムを2倍上回る性能を実現し、ゼロショット学習にも対応しています。このモデルは3D再構成にも対応しており、ホームプレビュー、クリエイティブな動画編集、科学研究など、さまざまなシナリオにおけるアプリケーションをサポートし、コンピュータビジョンの将来的な発展に強力な推進力をもたらします。
SAM 3の主な機能
-
マルチモーダルなプロンプトのサポートSAM 3は、テキスト、例、クリックや選択ボックスなどの視覚的な手がかりを用いて、画像や動画内のオブジェクトの検出とセグメンテーションをサポートし、多様なユーザーニーズに対応します。
-
画像と動画のセグメンテーションSAM 3は、画像内のすべての一致するオブジェクトを検出してセグメント化することができ、ビデオ内のオブジェクト追跡をサポートし、セグメンテーション結果をリアルタイムで対話的に修正することができます。
-
ゼロショット学習SAM 3は、オープンボキャブラリーを用いたテキストプロンプトを通して未知の概念を処理することができ、追加のトレーニングなしに新しいオブジェクトカテゴリを分類することができます。
-
リアルタイムのインタラクティブ性これにより、ユーザーは追加のプロンプト(クリックや選択ボックスなど)を追加することでモデルのエラーを修正でき、セグメンテーション結果をさらに最適化し、ユーザーエクスペリエンスを向上させることができます。
-
クロスドメインアプリケーションSAM 3は、クリエイティブメディアツール(Instagramの編集機能など)、インテリアのプレビュー(Facebook Marketplaceなど)、科学分野(野生生物のモニタリングなど)で幅広く使用されています。
SAM 3 技術原理
- 統一モデルアーキテクチャSAM 3は、画像と動画の両方におけるセグメンテーションタスクをサポートする統一モデルアーキテクチャに基づいています。このモデルは、強力なビジュアルエンコーダ(メタ知覚エンコーダなど)と、オープンワードを含むテキストキューを処理できるテキストエンコーダを組み合わせています。モデルアーキテクチャには、画像レベルの検出器とメモリベースのビデオトラッカーが含まれており、どちらも同じビジュアルエンコーダを共有しています。
- マルチモーダル入力処理:
- テキストエンコーダーテキストプロンプトは、セグメンテーションタスクをガイドするために特徴ベクトルにエンコードされます。
- ビジュアルエンコーダー画像またはビデオフレームを、物体検出およびセグメンテーションのための特徴ベクトルにエンコードします。
- フュージョンエンコーダーこの手法は、テキスト特徴と視覚特徴を融合させ、後続のセグメンテーションタスクのための条件付き画像特徴を生成する。
- プレゼンスヘッドモデルの分類能力を向上させるため、SAM 3ではプレゼンスヘッドが導入されました。これは、画像や動画内にターゲットとなる概念が存在するかどうかを予測するために特化して使用されます。これにより、認識タスクと位置特定タスクが分離され、モデルの精度と効率が向上します。
- 大規模データエンジンSAM 3のトレーニングのために、Metaは人間とAIによるアノテーションを組み合わせた高効率データエンジンを構築し、400万を超える固有の概念に対して高品質なラベル付きデータを生成することに成功しました。このデータは様々な視覚領域とタスクを網羅しており、モデルの幅広い汎化能力を保証しています。
- ゼロショット学習SAM 3はゼロショット学習をサポートし、未知の概念にも対応できます。オープンボキャブラリーを用いたテキストキューを使用することで、モデルは事前学習済みの視覚エンコーダーと言語エンコーダーを用いて、新しいオブジェクトカテゴリを識別し、セグメント化します。
- リアルタイムのインタラクティブ性SAM 3はリアルタイムのインタラクティブ機能をサポートしており、ユーザーはモデルのエラーを修正したり、クリックや選択ボックスなどの追加のプロンプトを追加することでセグメンテーション結果をさらに最適化したりできます。インタラクティブ機能により、モデルはユーザーの意図により適切に対応できるようになります。
- ビデオの追跡とセグメンテーションビデオ処理において、SAM 3はメモリベースのトラッカーを使用してオブジェクトの時空間的な一貫性を処理します。このトラッカーは、検出器の出力とメモリからの履歴情報を使用して高品質のセグメンテーションマスクを生成し、それをビデオフレーム間で伝播させます。
SAM 3プロジェクトの住所
- プロジェクト公式サイト:https://ai.meta.com/sam3/
- GitHubリポジトリ:https://github.com/facebookresearch/sam3/
- オンラインでデモを体験してください:https://www.aidemos.meta.com/segment-anything
SAM 3の応用シナリオ
-
クリエイティブメディアツールクリエイターは動画内の人物や物体に特殊効果を素早く適用できるため、制作効率が向上します。
-
ホームデコレーションプレビューFacebook Marketplaceでは、SAM 3は「ルームプレビュー」機能をサポートしており、ユーザーは自分の空間に家具を配置した際のイメージを事前に確認できるため、購入の意思決定に役立ちます。
-
科学的応用SAM 3は、野生生物のモニタリングや海洋探査において、例えばビデオを通して野生生物の行動を分析するなど、研究者が自然環境をより深く理解し、保護するために活用されています。
-
3D再構成SAM 3Dは、1枚の画像から3Dオブジェクトや人体を再構築することができ、現実世界のシーンにおける3D再構築の新たな標準を提供するとともに、仮想現実や拡張現実アプリケーションを促進する。
-
動画制作SAM 3は、既存のAI生成動画のミキシングや編集をサポートするAIビジュアル制作ツールを提供し、クリエイティブな柔軟性を向上させます。