project
CoGenAV - 同義大学と深圳科技大学が共同開発したマルチモーダル音声表現モデル
CoGenAV - 同義大学と深圳科技大学が共同開発したマルチモーダル音声表現モデル
CoGenAVとは何ですか?
CoGenAV(Contrastive-Generative Audio-Visual Representation Learning)は、音声信号と映像信号の整合と融合に焦点を当てた高度なマルチモーダル学習モデルです。同期された音声、映像、テキストデータを利用して時間的対応関係と意味情報を学習・取得することで、対照的な特徴の整合とテキスト予測生成という2つの目的を達成します。CoGenAVは極めて高いデータ効率を実現しており、学習に必要なラベル付きデータはわずか223時間です。
CoGenAVの主な機能
- 音声・映像・音声認識(AVSR)CoGenAVは、音声情報と視覚情報(話者の口の動きなど)を組み合わせることで、音声認識の精度を向上させることができます。
- 視覚音声認識(VSR)音声認識は、音声信号ではなく、視覚情報(話者の口の動きなど)のみを使用します。
- 騒がしい環境下での音声処理騒音の多い環境において、CoGenAVは視覚情報を用いて音声信号を補助することで、音声処理の堅牢性を向上させます。
- 音声再構成および音声増強CoGenAVは、音声の再構築や強調といったタスクに利用でき、マルチモーダル情報の融合によって音声品質を向上させる。
- アクティブスピーカー検出(ASD)音声信号と映像信号を分析することで、現在話している人物を検出する。
CoGenAVの技術原理
- 特徴抽出特徴抽出段階では、CoGenAVはResNet3D CNNを用いて動画内の話者の唇の動きを分析し、音と唇の形状の動的な関係性を捉えます。音声から音声情報を抽出するためにTransformerエンコーダーを使用し、音声と動画の特徴を正確に位置合わせします。
- 比較と同期Seq2Seq対照学習法を採用することで、音声と映像の特徴間の対応関係を強化し、ReLU活性化関数を導入することで干渉フレームを除去し、複雑な環境におけるモデルの安定性を向上させています。
- 同期を生成する事前学習済みのASRモデル(Whisperなど)を活用して、音声と映像の特徴を音響テキスト表現と整合させることで、軽量な適応モジュール(Delta Upsampler + GatedFFN MHA)が設計され、クロスモーダル融合の効率を効果的に向上させます。
CoGenAVのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/HumanMLLM/CoGenAV
- ハギングフェイスモデルライブラリ:https://huggingface.co/detao/CoGenAV
- arXiv技術論文:https://arxiv.org/pdf/2505.03186
CoGenAVの応用シナリオ
- スマートアシスタントとロボットCoGenAVのマルチモーダル表現は、インテリジェントアシスタントやロボットに統合することで、複雑な環境下でも音声コマンドをより適切に理解し、応答できるようになる。
- 動画コンテンツ分析CoGenAVは、動画コンテンツの分析と理解に利用できます。動画内の音声情報と映像情報を分析することで、字幕生成やコンテンツ推薦など、より精度の高い機能を提供できます。
- 産業用途産業環境において、CoGenAVは音声制御機器や音声モニタリングなどのシナリオで使用でき、マルチモーダル情報融合を通じてシステムの堅牢性と信頼性を向上させることができる。
- 健康管理CoGenAVは、インテリジェント医療アシスタントや音声制御医療機器など、医療機器における音声対話に利用でき、医療機器の使いやすさとインタラクティブ性を向上させる。