AB
AiBoss
project

MEMO - 音声駆動型の生成型ポートレート動画フレームワーク。人物のアイデンティティの一貫性と表現力を維持します。

MEMO(Memory-Guided EMOtionaware diffusion)は、Skywork AI、南洋理工大学、シンガポール国立大学が共同開発した、音声駆動型のポートレートアニメーションフレームワークです。一貫性のあるアイデンティティと表現力を持つ画像を生成するために使用されます。

MEMOとは何ですか?

MEMO(Memory-Guided EMOtionaware diffusion)は、Skywork AI、南洋理工大学、シンガポール国立大学が共同開発した、音声駆動型のポートレートアニメーションフレームワークで、人物の個性と表現力に優れた話し動画を生成します。MEMOは、メモリ誘導型時間モジュールと感情認識型音声モジュールの2つのコアモジュールを中心に構築されています。メモリ誘導型モジュールは、長期的な動き情報を記憶することで、人物の個性と動きの滑らかさを向上させます。一方、感情認識型モジュールは、マルチモーダルな注意機構を用いて、音声と映像の相互作用を改善し、音声に含まれる感情に基づいて表情を洗練させます。MEMOは、様々な画像や音声タイプの話し動画において、最先端の手法と比較して、全体的な品質、音声と唇の同期、人物の個性と表現の一貫性、感情の一致において優れた性能を発揮します。

MEMOの主な機能

  • 音声連動型ポートレートアニメーションMEMOは、入力された音声と参照画像に基づいて、同期が取れ、同一人物が認識できる話し動画を生成します。
  • 多様なコンテンツ生成さまざまな画像スタイル(肖像画、彫刻、デジタルアートなど)と音声タイプ(スピーチ、歌、ラップなど)による音声付き動画の生成をサポートします。
  • 多言語対応英語、北京語、スペイン語、日本語、韓国語、広東語など、複数の言語の音声入力に対応しています。
  • 表現力豊かな動画を作成する音声の感情的な内容に基づいて、対応する表情を伴う話し方の動画を生成します。
  • 長尺動画生成機能最小限のエラー蓄積で、長時間の音声動画を生成できます。

MEMOの技術原則

  • メモリ誘導型時間モジュール
    • メモリ状態: より長い過去のコンテキストからの情報を提供し、時間的モデリングを導くためのメモリ状態ストレージを開発する。
    • 線形アテンション線形注意機構に基づき、長期的な動き情報を用いて顔の動きの一貫性を向上させ、誤差の蓄積を低減する。
  • 感情感知オーディオモジュール
    • マルチモーダルな注意映像と音声の両方の入力を同時に処理できるため、両者の相互作用が強化されます。
    • 音声による感情検出音声から感情的な手がかりを動的に検出し、感情情報を映像生成プロセスに統合し、顔の表情を洗練させる。
  • エンドツーエンドのフレームワーク
    • 参照ネット空間および時間モデリングで使用するための識別情報を提供する。
    • 拡散ネットワーク中核となる革新技術には、記憶誘導のための時間ベースモジュールと、感情認識のためのオーディオモジュールが含まれる。
  • データ処理フローこれには、データ品質を確保するための、シーン遷移検出、顔検出、画像品質評価、音声と唇の同期検出などの手順が含まれます。
  • トレーニング戦略トレーニングは2つのフェーズに分かれており、修正されたフロー損失を用いた顔領域適応と感情分離のための堅牢なトレーニングが行われる。

MEMOのプロジェクトアドレス

MEMOの適用シナリオ

  • バーチャルアシスタントとチャットボット仮想アシスタントやチャットボットのリアルな動画を生成することで、ユーザーとのやり取りをより自然でパーソナルなものにする。
  • エンターテインメントとソーシャルメディアエンターテインメント業界では、バーチャルアイドル、ゲームキャラクター、ソーシャルメディアインフルエンサーなどをフィーチャーした、ダイナミックなビデオコンテンツを制作する。
  • 教育と訓練教師やトレーナーの画像が授業内容に応じて動的に変化する教育ビデオを作成し、学習体験のインタラクティブ性と魅力を高める。
  • ニュースとメディアニュース放送においては、特に多言語放送が必要な場合、アンカービデオを該当言語で迅速に生成する。
  • 広告とマーケティングさまざまな市場やターゲット層に合わせて、製品のスポークスパーソンを起用した、カスタマイズされた広告ビデオを作成します。