AB
AiBoss
project

SkyReels-A1 - 崑崙万威氏によるオープンソースの制御可能な顔表情・動作アルゴリズム

SkyReels-A1は、Kunlun Wanweiが開発したオープンソースの、中国初の最先端(SOTA)顔表情・動作制御アルゴリズムで、ビデオ台座モデルに基づいています。SkyReels-A1は、より正確で制御可能な人物動画の生成を可能にし、さらに…

SkyReels-A1とは何ですか?

SkyReels-A1は、Kunlun Wanweiが開発したオープンソースの中国初の最先端(SOTA)顔表情・モーション制御アルゴリズムで、ビデオ台座モデルに基づいています。SkyReels-A1は、より高精度で制御性の高い人物動画生成を可能にし、ポートレート、上半身、全身など、あらゆる人物像に基づいた非常にリアルな動的動画を生成します。SkyReels-A1は、表情の変化、感情、肌の質感、体の動きといった細部を正確にシミュレートすることで、高忠実度の微表情再現を実現します。SkyReels-A1は、横顔の表情制御、眉毛と目の微表情生成、そしてより広い頭部と体の動きをサポートし、類似製品を凌駕する性能を発揮します。

SkyReels-A1の主な機能

  • 高精細な肖像画アニメーション生成静止画から動的な動画を生成し、頭部、上半身、全身など、さまざまな体型に対応します。被写体の表情や動きを、元の動画からターゲットの動画に正確に転送し、人物の個性を維持します。
  • 顔の表情や動きを正確に制御する複雑な表情(眉や唇の微妙な動きなど)や全身の動きを自然に再現します。高精細な顔認識機能とモーション駆動機能を備え、バーチャルアバター、遠隔通信、デジタルメディア制作などに最適です。
  • アイデンティティの維持と自然との融合アニメーション生成プロセスにおいては、生成されたキャラクターが元の肖像画と高い整合性を持つようにし、同一人物の歪みが生じないようにしてください。

SkyReels-A1の技術原理

  • ビデオ拡散モデルこの手法は、ランダムノイズを段階的に逆変換することで、構造化されたビデオコンテンツに変換します。拡散モデルは各タイムステップでノイズを推定し、徐々に高品質のビデオフレームを生成します。Transformerの自己注意機構に基づき、ビデオから時空間情報を抽出し、一貫性のある自然な動的コンテンツを生成します。
  • 顔認識ランドマーク運転中の動画から顔の特徴点(キーポイントなど)を抽出し、アニメーション生成のためのモーション記述子として使用します。3Dニューラルレンダリングモジュールに基づいて、眉や唇の動きといった微妙な顔の変化を正確に捉え、生成プロセスに統合します。
  • 時空間アライメントランドマークガイダンスモジュール3D因果エンコーダを用いてランドマーク情報をビデオの潜在空間にマッピングすることで、駆動信号と生成ビデオの時空間的な一貫性を確保します。微調整を行うことで、モーション信号の捕捉能力が向上し、生成ビデオのモーションコヒーレンスが保証されます。
  • 顔画像とテキストの位置合わせモジュールこの手法は、顔の特徴をテキスト特徴空間にマッピングすることで、本人確認の一貫性を高めます。視覚的特徴とテキスト特徴を融合することで、生成される結果の精度と本人確認の保持能力が向上します。
  • 段階的トレーニング戦略
    • 実践重視のトレーニング: 動きの表現を最適化するために、動きの条件をビデオ生成プロセスに統合することに重点を置いています。
    • 本人確認管理トレーニング顔の特徴の投影レイヤーを最適化し、同一性の一貫性を向上させる。
    • 複数モジュールのジョイント微調整モデルの汎化能力と生成品質を向上させるため、すべてのモジュールを総合的に最適化する。

SkyReels-A1プロジェクトの住所

SkyReels-A1の応用事例

  • 仮想アバターとデジタルヒューマン仮想キャラクターに自然な表情や動きを生成し、パーソナライズされたカスタマイズを提供します。
  • 遠隔通信顔の表情や動きをリアルタイムで反映することで、遠隔でのやり取りの自然さと楽しさが向上します。
  • デジタルコンテンツ制作短編動画、広告、映画やテレビ番組制作に適した、高品質なアニメーション動画を素早く生成します。
  • ゲームとVRキャラクターの表情や動きの自然さを高め、没入感を向上させる。
  • 教育と訓練自然な演技を通して教育効果を高めるため、仮想教師キャラクターを生成する。