project
FLOAT - ストリームマッチングに基づく音声駆動型スピーカーアバター生成モデル
FLOATは、DeepBrain AIと韓国科学技術院(KAIST)が開発した、音声駆動型のスピーカーアバター生成モデルです。フローマッチング生成モデルに基づき、動きの潜在空間を学習することで、効率的かつ時間的に一貫性のある動きのデザインを実現します。このモデルは…
FLOATとは何ですか?
FLOATは、DeepBrain AIと韓国科学技術院(KAIST)が共同開発した、音声駆動型話者アバター生成モデルです。フローマッチング生成モデルに基づき、動きの潜在空間を学習することで、効率的かつ時間的に一貫性のある動きのデザインを実現します。このモデルは、Transformerベースのベクトル場予測器を用いてフレーム間の時間的一貫性を実現し、音声駆動型の感情表現強化をサポートすることで、生成される音声の動きをより自然で表現豊かにします。FLOATは、既存の拡散ベースおよび非拡散ベースの手法を視覚品質、動きの忠実度、生成効率の面で凌駕し、業界最高水準を達成しています。
FLOATの主な機能
- 音声駆動型スピーカーイメージ生成この技術は、単一のソース画像と駆動音声に基づいて、話す人物のポートレート動画を生成し、音声と同期した頭部の動き(発話時の動きと非発話時の動きを含む)を実現します。
- 時間的に一貫性のあるビデオ生成FLOATは、モーションポテンシャル空間内でモデリングを行うことで、時間的に高い一貫性を持つ動画を生成し、従来の拡散ベースの動画生成における時間的整合性の問題を解決します。
- 感情の向上音声による感情タグは動画における感情表現を強化し、生成される音声や動作をより自然で表現力豊かなものにします。
- 高効率サンプリングストリームマッチング技術に基づき、ビデオ生成のサンプリング速度と効率を向上させる。
FLOATの技術原理
- 移動のための潜在的な空間生成モデリングをピクセル潜在空間から学習済みモーション潜在空間に移行することで、時間的に一貫性のある動きをより効果的に捉え、生成します。
- ストリームマッチングフローマッチングに基づいて、動きの潜在空間において効率的なサンプリングを行い、時間的に一貫性のある動きのシーケンスを生成する。
- トランスフォーマーベースのベクトル場予測器Transformerベースのアーキテクチャは、生成されたストリームのベクトル場を予測します。この予測器は、フレーム条件を処理し、時間的に一貫性のある動きを生成できます。
- フレーム条件機構シンプルなフレーム条件メカニズムに基づき、駆動音声やその他の条件(感情タグなど)を生成プロセスに統合することで、モーションポテンシャル空間を効果的に制御します。
- 感情のコントロール感情ラベルは、事前学習済みの音声感情予測器を用いて生成され、その後、ベクトル場予測器への条件付き入力として使用されます。感情制御は、生成プロセス中に導入されます。
- 高速サンプリングと効率的な生成ストリームマッチング技術に基づき、生成プロセスにおける反復回数を削減することで、高速サンプリングと高品質な生成ビデオの維持を実現しています。
FLOATのプロジェクトアドレス
- プロジェクト公式サイト:deepbrainai-research.github.io/float
- arXiv技術論文:https://arxiv.org/pdf/2412.01064
FLOATの応用シナリオ
- バーチャルアンカーとバーチャルアシスタントニュース放送、天気予報、オンライン教育などの分野では、まるで生きているかのような仮想アンカーを生成し、24時間365日の番組制作を提供する。
- ビデオ会議と遠隔通信ビデオ会議では、ユーザーがウェブカメラを持っていなくてもビデオでコミュニケーションできるように、仮想アバターを作成します。
- ソーシャルメディアとエンターテイメントソーシャルメディアプラットフォームでは、ユーザーはライブストリーミング、インタラクティブなエンターテイメント、または仮想的な社会的交流で使用するために、独自の仮想アバターを作成する。
- ゲームとバーチャルリアリティゲームやバーチャルリアリティアプリケーションでは、ゲームキャラクターの表情や動きを作成またはカスタマイズして、没入感を高めるために使用できます。
- 映画およびアニメーション制作映画のポストプロダクションにおいて、キャラクターの表情や口の動きを生成または強化することで、従来のモーションキャプチャの必要性を軽減する。