AB
AiBoss
project

StableAvatar - 復旦大学が開発した音声駆動型動画生成モデル

StableAvatarは、復旦大学、マイクロソフトリサーチアジアなどが開発した、音声駆動型の革新的な仮想アバター動画生成モデルです。このモデルは、エンドツーエンドの動画拡散トランスフォーマーと、タイムステップ対応の音声アダプタ、ネイティブ音声などを組み合わせて利用しています。

StableAvatarとは何ですか?

StableAvatarは、復旦大学、マイクロソフトリサーチアジアなどが開発した、音声駆動型の革新的な仮想アバター動画生成モデルです。エンドツーエンドの動画拡散トランスフォーマーと、タイムステップ認識型オーディオアダプタ、ネイティブオーディオガイダンス機構、動的に重み付けされたスライディングウィンドウ戦略を組み合わせることで、長さ無制限の高品質な仮想アバター動画を生成できます。このモデルは、既存モデルが長尺動画生成で直面する、同一性、音声同期、動画の滑らかさといった問題を解決し、生成される動画の自然さと一貫性を大幅に向上させ、仮想現実やデジタルヒューマン作成などのシナリオに適しています。

StableAvatarの主な機能

  • 高品質な長尺動画の生成3分を超える高品質な仮想アバター動画の生成をサポートし、アイデンティティの一貫性と音声の同期を維持します。
  • 後処理は不要です顔交換ツールや顔復元モデルなどの後処理ツールを使用せずに、直接動画を生成できます。
  • 多様な用途全身、半身、複数キャラクター、漫画キャラクターなど、様々な仮想キャラクターのアニメーション生成をサポートしており、仮想現実、デジタルヒューマン作成、仮想アシスタントなどのシナリオに適しています。

StableAvatarの技術的原理

  • タイムステップセンシングオーディオアダプタ時間ステップを考慮した変調と相互注意メカニズムを用いることで、音声埋め込みは潜在表現および時間ステップ埋め込みと相互作用し、潜在分布におけるエラーの蓄積を低減する。これにより、拡散モデルは音声特徴と潜在特徴の同時分布をより効果的に捉えることができる。
  • オーディオネイティブブートメカニズム従来の分類フリーガイダンス(CFG)とは異なり、拡散モデルのサンプリング分布を直接操作し、生成プロセスを音声と潜在信号の結合分布へと誘導する。拡散モデルのノイズ除去プロセス中に継続的に変化する音声潜在予測を動的な誘導信号として使用することで、音声同期と表情の自然さが向上する。
  • 動的加重スライディングウィンドウ戦略長尺動画を生成する際には、動的重み付きスライディングウィンドウ戦略を用いて潜在表現を融合し、対数補間を用いて動的に重みを割り当てることで、動画セグメント間の遷移における不連続性を低減し、動画の滑らかさを向上させます。

StableAvatarのプロジェクトアドレス

  • プロジェクト公式サイト:https://francis-rings.github.io/StableAvatar/
  • GitHubリポジトリ:https://github.com/Francis-Rings/StableAvatar
  • ハギングフェイスモデルライブラリ:https://huggingface.co/FrancisRing/StableAvatar
  • arXiv技術論文:https://arxiv.org/pdf/2508.08248

StableAvatarの応用事例

  • 仮想現実(VR)と拡張現実(AR)高品質な仮想アバター動画を生成することで、ユーザーによりリアルで自然な仮想現実および拡張現実体験を提供し、ユーザーの没入感を高めます。
  • バーチャルアシスタントとカスタマーサービス仮想アシスタントやカスタマーサービス担当者向けに自然な表情や動きを生成し、音声コマンドに対してリアルタイムでアニメーションによる応答を提供することで、ユーザーエクスペリエンスを向上させます。
  • デジタルヒューマンクリエーション高度に一貫性があり自然な動きのデジタル人間動画を迅速に生成でき、全身、半身、複数人、漫画キャラクターなど、さまざまなフォーマットをサポートして、さまざまなシナリオのニーズに対応します。
  • 映画およびテレビ制作これは、高品質な仮想キャラクターアニメーションの生成、特殊効果制作の時間とコストの削減、映画やテレビ番組制作の効率と品質の向上に利用されます。
  • オンライン教育とトレーニングこの機能は、オンライン教育プラットフォーム向けに、音声コンテンツに基づいて自然な表情や動きを表示する仮想教師やトレーナーのアニメーション動画を生成し、教育のインタラクティブ性と楽しさを向上させます。