project
SAM Audio - Metaのオープンソース音声セグメンテーションモデル
SAM Audioは、Metaが開発したオープンソースの音声セグメンテーションモデルで、テキスト、視覚情報、時間的断片などのマルチモーダルな手がかりを用いて、複雑な音声混合物から特定の音を分離することができます。そのコア技術は、Perception Encoder Audioviです。
SAM Audioとは何ですか?
SAM Audioは、Meta社が開発したオープンソースの音声セグメンテーションモデルで、テキスト、ビジュアル、時間的キューなど、複数のモーダルなキューを活用して、複雑な音声ミックスから特定の音を分離します。そのコア技術は、Meta社のオープンソースPerception EncoderモデルをベースにしたPerception Encoder Audiovisual(PE-AV)です。このモデルは、オーディオビジュアル情報を融合し、正確な時間的注釈を行うことで、高精度な音声分離を実現します。ユーザーは、簡単なテキストによる説明(例:「ギターの音」)、動画内の音源オブジェクトをクリック、または音の発生時間範囲を指定することで、SAM Audioを利用できます。
SAM Audioの主な機能
-
マルチモーダル音声分離テキストによる説明、視覚的な選択(ビデオ内のオブジェクト)、または時間セグメントマーカーを使用して、複雑なオーディオミックスから特定のサウンドを分離します。
-
複数のオーディオタスクをサポート音声、音楽、一般的な効果音など、さまざまな音声分離タスクに対応でき、さまざまなシナリオに適しています。
-
参考資料なしのオーディオレビューSAM Audio Judgeは、知覚的な観点から音声分離品質を評価するために参照音声を必要としない客観的な評価モデルです。
-
実世界でのベンチマークSAM Audio-Benchは、実環境における初のオーディオ分離ベンチマークであり、様々なオーディオ領域とキュータイプを網羅し、参照なしの評価にも対応しています。
-
高効率なリアルタイム処理リアルタイム処理よりも高速に動作し、リアルタイム係数は約0.7であるため、大規模な音声処理に適している。
-
アクセシビリティ技術の支援関連組織と協力して、補聴器との統合などのアクセシビリティ技術の応用を探求し、オーディオAIの包括的な開発を促進する。
SAM Audioの技術原則
-
知覚エンコーダーオーディオビジュアルモジュール(PE-AV)Metaのオープンソースの知覚エンコーダーモデルに基づいて、PE-AVはフレームごとのビデオ特徴を抽出し、それを音声表現と整合させることで、視聴覚情報を融合し、正確な時間注釈と意味的に豊富な特徴表現を提供し、音声分離を可能にします。
-
ストリームマッチング拡散トランスフォーマーアーキテクチャこのシステムは、生成モデリングフレームワークを採用し、混合された音声情報とキュー情報を共通の表現にエンコードすることで、ターゲットとなる音声トラックと残りの音声トラックを生成し、複数のモダリティでのキュー入力をサポートします。
-
大規模マルチモーダルデータトレーニング音声、音楽、一般的な効果音など、さまざまな音響イベントを網羅する、実際の音声データと合成音声データを組み合わせた学習を行い、高度な音声合成戦略を組み合わせることで、モデルの堅牢性と汎化能力が向上します。
-
参照なし音声評価モデルSAM Audio Judgeは、基準となるオーディオトラックを必要とせず、知覚的な側面に基づいてオーディオ品質を評価するため、人間の聴覚体験により近い客観的な評価基準を提供します。
-
実世界でのベンチマークSAM Audio-Benchは、初の実際のオーディオ分離ベンチマークとして、さまざまなオーディオタスクとモードキューを網羅し、参照なしの評価をサポートし、実用的なアプリケーションにおけるモデルの有効性を保証します。
SAM Audioのプロジェクト住所
- プロジェクト公式サイト:https://ai.meta.com/samaudio/
- GitHubリポジトリ:https://github.com/facebookresearch/sam-audio
SAMオーディオアプリケーションシナリオ
-
音声のクリーンアップと背景ノイズの除去音声ファイルから不要な背景ノイズを除去します。例えば、ポッドキャストの録音から犬の鳴き声や交通騒音などを除去することで、音質を向上させます。
-
クリエイティブメディア制作これは、クリエイターが楽曲から特定の楽器の音を抽出したり、ボーカルを分離したり、オーディオをリミックスして創造的な表現力を高めるのに役立ちます。
-
アクセシビリティ技術補聴器メーカーと協力し、聴覚補助機器への応用を模索することで、難聴者が音声コンテンツをよりよく理解できるよう支援する。
-
動画編集映像制作においては、視覚的な手がかりを利用して特定の物体の音を分離することができる。例えば、映像中のギタリストをクリックしてギターの音を抽出するなど、映像編集の柔軟性を向上させることができる。
-
音声分析と研究これは音声分析のためのツールを提供し、研究者が特定の音響イベントを分離して研究するのに役立ち、音楽分析や音響生態学などの分野に応用可能です。