project
OmniAvatar - 浙江大学とアリババが共同開発した、音声駆動型の全身動画生成モデル。
OmniAvatarは、浙江大学とアリババグループが共同開発した、音声駆動型の全身動画生成モデルです。入力された音声とテキストプロンプトに基づいて、キャラクターの動きが音声と完全に同期した、自然でリアルな全身アニメーション動画を生成します。
OmniAvatarとは何ですか?
OmniAvatarは、浙江大学とアリババグループが共同開発した、音声駆動型の全身動画生成モデルです。入力された音声とテキストプロンプトに基づいて、キャラクターの動きと音声が完璧に同期し、表情豊かな、自然でリアルな全身アニメーション動画を生成します。このモデルは、ピクセルレベルのマルチレベル音声埋め込み戦略とLoRA学習法を採用しており、リップシンク精度と全身の動きの自然さを効果的に向上させています。キャラクターとオブジェクトのインタラクション、背景制御、感情制御などの機能をサポートしており、ポッドキャスト、インタラクティブ動画、仮想シーンなど、幅広い分野で活用されています。
OmniAvatarの主な機能
- 自然なリップシンクロ音声と完全に同期した唇の動きを生成でき、複雑な状況でも高い精度を維持します。
- 全身アニメーション生成自然で滑らかな全身の動きの生成をサポートし、アニメーションをより鮮やかでリアルなものにします。
- テキストコントロールテキストプロンプトに基づいて、キャラクターの行動、背景、感情など、ビデオコンテンツを正確に制御できるため、高度にカスタマイズされたビデオ生成が可能になります。
- 人と物との相互作用キャラクターが周囲の物体と相互作用するシーン(例えば、物を拾ったり、機器を操作したりするシーン)の生成をサポートしており、アプリケーションの範囲を拡大します。
- バックグラウンド制御背景はテキストプロンプトに応じて変更でき、さまざまなシーンの要件に適応できます。
- 感情のコントロールテキストプロンプトに基づいて、キャラクターの喜び、悲しみ、怒りといった感情表現を制御することで、動画の表現力を高める。
OmniAvatarの技術原理
- ピクセルレベルのマルチレベル音声埋め込み戦略この手法では、音声の特徴をモデルの潜在空間にマッピングし、ピクセルレベルで埋め込むことで、音声の特徴が全身の動きの生成により自然に影響を及ぼすようにし、リップシンクの精度と全身の動きの自然さを向上させます。
- LoRAトレーニング方法この手法は、低ランク適応(LoRA)技術を用いて事前学習済みモデルを微調整します。モデルの重み行列に低ランク分解を導入することで、モデルの本来の機能を維持しながら学習パラメータの数を削減し、学習効率と生成品質を向上させます。
- 長尺動画生成戦略OmniAvatarは、長尺動画を生成するために、参照画像埋め込みとフレームオーバーレイの手法を採用しています。参照画像埋め込みは動画内の人物の同一性の一貫性を確保し、フレームオーバーレイは時間的な連続性を保証し、動作の急激な変化を回避します。
- 拡散モデルに基づく動画生成この手法は拡散モデルに基づいており、ノイズを段階的に除去して動画を生成します。高品質な動画コンテンツを生成し、長時間のデータシーケンスを処理する際に特に優れた性能を発揮します。
- トランスフォーマーアーキテクチャ拡散モデルに基づき、動画における長期的な依存関係と意味的な一貫性をより適切に捉えるためにTransformerアーキテクチャが導入され、生成される動画の品質と一貫性がさらに向上する。
OmniAvatarプロジェクトのアドレス
- プロジェクト公式サイト:https://omni-avatar.github.io/
- GitHubリポジトリ:https://github.com/Omni-Avatar/OmniAvatar
- ハギングフェイスモデルライブラリ:https://huggingface.co/OmniAvatar/OmniAvatar-14B
- arXiv技術論文:https://arxiv.org/pdf/2506.18866
OmniAvatarの応用事例
- 仮想コンテンツ制作これは、ポッドキャスターやビデオブロガーなどのための仮想アバターを生成するために使用でき、制作コストを削減し、コンテンツのプレゼンテーションを豊かにすることができます。
- インタラクティブなソーシャルプラットフォーム仮想ソーシャルシーンにおいては、ユーザーにパーソナライズされた仮想アバターを提供し、行動や表情を通して自然なインタラクションを可能にする。
- 教育・研修分野音声入力に基づいて仮想の教師アバターを生成し、授業内容を説明することで、教育の楽しさと魅力を高める。
- 広告とマーケティング仮想スポークスパーソン画像を生成し、ブランドのニーズに合わせて画像やアクションをカスタマイズすることで、精度の高い広告を実現します。
- ゲームとバーチャルリアリティ自然な動きや表情を持つ仮想ゲームキャラクターを迅速に生成できるため、ゲームコンテンツを豊かにし、仮想現実体験のリアリティを高めることができる。