AB
AiBoss
project

ReSyncer - 清華大学と百度が共同開発したAI動画編集ツール

ReSyncerは、清華大学と百度が共同開発したAI動画編集ツールです。音声処理によって、音声と同期した高品質なリップモーション動画を生成します。ReSyncerはStyle-SyncFormerを用いて音声を分析し、3D顔モデルを作成します。

ReSyncerとは何ですか?

ReSyncerは、清華大学と百度が共同開発したAI動画編集ツールです。音声を駆動力として、音声と同期した高品質なリップシンク動画を生成します。ReSyncerはStyle-SyncFormerを用いて音声を分析し、3D顔モデルを作成し、それを対象動画と組み合わせることで、同期のとれた表情豊かな仮想キャラクターを生成します。ReSyncerは、パーソナライズされた微調整、話し方の切り替え、顔の入れ替え機能をサポートしており、仮想ホストやパフォーマーの作成、ライブ配信などのシナリオに適しています。特に、音声と顔情報の同期に優れています。

ReSyncerの主な機能

  • リップシンク指定された音声に合わせて唇の動きを生成します。
  • スタイル転送特定の話し方や表情を対象動画に反映させる。
  • パーソナライズされた微調整生成された顔のアニメーションを、特定の人物の顔の特徴に合わせて素早く調整します。
  • 動画主導のリップシンク対象動画から抽出した顔画像を使用して、リップシンクアニメーションを生成します。
  • 顔交換技術別人の顔の特徴と入れ替えることで、人物の変装や特殊効果を行う。

ReSyncerの技術原理

  • 3D顔面モデル生成深層学習モデルであるStyle-SyncFormerを用いて、音声の特徴に基づいて3D顔面ダイナミクスを予測する。
  • 様式化された顔のアニメーションTransformerアーキテクチャを通じて様式化された3D顔の動きを学習し、顔の表情と唇の動きを正確に同期させる。
  • スタイルベースのジェネレーター予測された3D顔面ダイナミクスは、対象動画内の顔画像と組み合わされ、高精細な顔画像を生成する。
  • 顔の特徴の融合生成プロセスにおいて、シンプルな挿入メカニズムを用いて3D顔面メッシュ情報を様式化された特徴と融合させることで、唇の同期の品質と安定性を向上させる。

ReSyncerプロジェクトのアドレス

ReSyncerの応用シナリオ

  • 映画およびビデオ制作映画やビデオ制作において、ReSyncerは顔の入れ替えやリップシンクといった複雑な特殊効果を実現し、視覚的な魅力を高めるために使用できます。
  • 広告業界広告制作において、スタイル転送機能は、独自の視覚効果を生み出し、視聴者の注意を引くために活用できる。
  • ソーシャルメディアとコンテンツ制作コンテンツ制作者はReSyncerを使って、顔交換技術を用いた面白いパロディ動画を作成するなど、動画コンテンツをより魅力的にすることができます。
  • 教育と訓練語学学習や職業訓練において、口パクは学習者が発音をよりよく理解し、模倣するのに役立つ。