project
Wan-Animate-2 - Wanxiangチームがオープンソース化した、新世代のキャラクターアニメーションモデル。
Wan-Animate-2は、Wanxiangチームがオープンソース化した新世代のキャラクターアニメーションモデルです。Wan-Animateの大幅なアーキテクチャアップグレードとして、明示的なポーズスケルトンと補助的なポーズ抽出ネットワークへの依存を廃止し、エンドツーエンドのデュアルブランチアーキテクチャを採用しています。
Wan-Animate-2とは何ですか?
Wan-Animate-2 は Wanxiang です同チームが開発したオープンソースの次世代キャラクターアニメーションモデルは、Wan-Animateのアーキテクチャを大幅にアップグレードしたもので、明示的なポーズスケルトンや補助的なポーズ抽出ネットワークへの依存を廃止し、参照ビデオからモーションの事前情報を直接キャプチャするエンドツーエンドの2分岐拡散トランスフォーマー(DiT)に置き換えています。このモデルはテキストによる視点制御をサポートし、最大24fpsのリアルタイムストリーミングバージョンを提供します。
Wan-Animate-2の主な機能
-
動画をキャラクターアニメーションに活用する入力参照画像
reference.pngドライバーテンプレートビデオ付きtemplate.mp4これにより、参照キャラクターはビデオ内の動作やカメラのリズムを再現することができる。 -
エンドツーエンドのモーション転送再設計されたDiTの直接消費型ビデオは、中間的なモーション抽出器の必要性を排除し、モーションの忠実度とアイデンティティの一貫性を同時に向上させることを目指しています。
-
アイデンティティ/外見の維持アテンション計算において参照画像トークンと参照動画トークンを使用することで、参照となる外観が生成プロセスに注入され、「動作は似ているが顔が歪んでいる」という状況が軽減されます。
-
テキスト正規化制御推論を行う前に、LLMを使用して固定パラダイムのキャプションを生成し、「キャラクターの外見の説明 + 背景の説明」のみを記述し、行動の説明や感情の推測は行わず、それをWan-Animate-2のプロンプトとして使用します。
-
テキスト駆動型の視点制御テキストを使用して出力カメラビューを運転ビデオから切り離すことをサポートしており、「同じ一連の動作、異なるカメラ位置/ビュー」を簡単に生成できます。
-
基本高画質モードデフォルトの推論スクリプトは標準構成を使用します。公式の例では、デフォルトでディフューザーが使用されます。
num_inference_steps=40品質を最優先する。 -
蒸留低ステップモード蒸留における重量計算の例は10段階です。
guidance_scale=1.0オイラーソルバー(CFGなし)を使用し、より高速な出力と低遅延の検証を目指しています。 -
リアルタイムの将来予測機能本論文では、教師強制、エラーバッファ、自己強制蒸留、チャンク単位のバックプロパゲーションを用いてレイテンシをリアルタイムの閾値まで削減し、ストリーミングキャラクターアニメーションに適したWan-Animate-2-Liteを提案している。
-
地域とオンラインでの体験Baseで使用するためのローカルGradioスクリプトを提供します。
wan_animate_2_gradio.py蒸留wan_animate_2_gradio_distillation.pyREADMEファイルには、ModelScope Studioのオンラインデモへのリンクも記載されています。 -
工学生態学的入口重みはHuggingFace/ModelScopeを介して適用され、モデルIDの例は以下のとおりです。
Wan-AI/Wan2.2-Animate-2-14Bディフューザーはソースコードからインストールおよび統合できるようになりましたが、ComfyUI/DiffSynth-StudioはまだToDoリストに残っています。 -
設定可能な並列生成デフォルト設定は8×A800、720Pですが、2×A800、480Pもテスト済みです。異なるハードウェアを使用する場合は、YAML並列構成を変更する必要があります。
使用方法Wan-Animate-2
-
ハードウェアの準備公式のデフォルト設定を優先的に使用してください。 8×A800、720P 計画;公式試験は別々に実施される 2×A800、480P一般消費者向けのシングルカードは、プログラムを実行できるとは限らないので、そのように考えるべきではありません。
-
リポジトリのクローン作成:
git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git。 -
環境を構築するPython 3.11; torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0、CUDA 12.6リポジトリをインストールします。次に、...をインストールします。
requirements.txt、flash-attn、やっとpip install -e .。 -
ダウンロード重量ハグ顔
huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/モデルスコープmodelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/。 -
まず、キャプションQwen3.7-PlusのようなLLMを使用し、公式の中国語テンプレートに従って「キャラクターの外見描写+背景描写」のみを記述し、行動、感情、評価は記述しないでください。
-
ランベース:入力
infer、埋め込むwan_animate_2_demo.py、合格--prompt、--refer-img-file、--refer-video-file、--config ./wan_animate_2.yaml。 -
蒸留バージョンを実行中: 変化
wan_animate_2_distillation.yaml、そして追加--sample_guide_scale 1.0 --step 10ディフューザー側に対応するguidance_scale=1.0、flow_solver="euler"。 -
並列構成を変更するGPU数やビデオメモリ数が公式仕様と一致しない場合は、まずYAMLの並列構成を変更し、次にメモリ不足エラーや速度異常がないか確認してください。
-
クイックエクスペリエンスデプロイしたくない場合は、まずModelScope Studioを試してみてください。そうでない場合は、ローカルで実行してください。
wan_animate_2_gradio.pyまたはwan_animate_2_gradio_distillation.py。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Wan-Animate-2の主な利点
-
動きの信憑性とアイデンティティとの一貫性が、主なセールスポイントです。中間モーション抽出器を削除することで、理論的には誤差の蓄積層を1つ減らすことができる。
-
生産チェーンに近い公式の方針では、キャプションを固定フォーマットとし、安定した再現性を確保するため、キャラクターの外見や背景の説明は必須とするが、行動の説明は不要としている。
-
低遅延ルートはクリアです蒸留処理はすでに10段階の推論を実行可能であり、Lite論文ではリアルタイム/ストリーミングのデジタルヒューマンに直接言及している。
-
商業的に非常に友好的Apache-2.0は二次開発に対してより友好的ですが、実際の商用利用においては、素材の著作権、肖像権、プラットフォームのルールに対処する必要があります。
Wan-Animate-2プロジェクトのアドレス
- プロジェクト公式サイト:https://humanaigc.github.io/wan-animate-2
- GitHubリポジトリ:https://github.com/Wan-Video/Wan-Animate-2
- ModelScope:https://modelscope.cn/models/Wan-AI/Wan2.2-Animate-2-14B
- arXiv技術論文:https://arxiv.org/pdf/2608.06009
- オンラインでデモを体験してください:https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
Wan-Animate-2と類似の競合製品との比較
| 比較対象寸法 | Wan-Animate-2 | MagicAnimate | MusePose |
|---|---|---|---|
| 中核ミッション | 参照画像とドライバービデオからキャラクターアニメーションが生成され、エンドツーエンドの動きの転送とアイデンティティの保持が重視されます。 | アニメーションは、単一の画像と動画を組み合わせることによって生成され、タイミングの一貫性と参照画像への忠実度が優先されます。 | この動画は、参考画像とポーズのシーケンスを組み合わせることで生成され、ダンスや全身の動きに焦点を当てています。 |
| テクニカルルート | DiTの直接消費型ビデオを再設計し、中間モーション抽出機能を削除し、テキスト駆動型の視点制御機能を追加する。 | 初期の拡散スキームは、デフォルトでDensePoseドライバに依存しています。SD1.5、MSE VAE、およびプロジェクトチェックポイントが必要です。 | 拡散ベース+ポーズ誘導型。Moore-AnimateAnyoneのルートに基づいて最適化されており、ポーズアライメント機能を提供します。 |
| 動作信号 | 運転中の映像を直接使用することで、姿勢や重要点を表現する中間層が不要になります。 | モーションビデオ/DensePoseクラスの条件によります。 | 明示的なdwposeシーケンスは、推論を行う前に、まずダンスビデオを基準画像に位置合わせします。 |
| 身元情報/詳細 | 目標は、高精細な動きと高い人物同一性の保持です。リアルな効果を得るためには、顔、手、ちらつきを同じ素材でテストすることをお勧めします。 | 公式サイトでは、顔や手が歪んで見える場合があること、またデフォルト設定ではアニメ調から写実的なスタイルへと変化する可能性があることを認めている。 | 公式の制限事項によると、顔の描写や複雑な衣服のディテールは不安定なままであり、複雑な背景ではノイズやちらつきが発生する可能性があるとのことです。 |
| 速度/リアルタイム | 蒸留の例:10ステップ、CFGなし、オイラー法。論文では、Liteリアルタイムストリーミングについても言及している。 | これは、早期に高品質な情報を発信するルートに属し、リアルタイム更新を主なセールスポイントとはしていません。 | これは主にリアルタイム性能に重点を置いているわけではなく、低遅延アーキテクチャではなく、姿勢アラインメントを使用して可用性を向上させることに重点を置いている。 |
| 解像度/ハードウェア | デフォルトは8×A800、720Pですが、公式テストでは2×A800、480Pという結果が出ています。異なるハードウェアでは、並列処理のためにYAMLを修正する必要があります。 | 公式のインストール要件は、Python 3.8、CUDA 11.3、およびffmpegです。次世代ビデオメモリについては、特に保証はありません。 | 公式仕様によると、512×512×48モデルは約16GBのVRAMを搭載し、768×768×48モデルは約28GBのVRAMを搭載しています。トレーニングマシンの例では8×80GBとなっています。 |
| 環境に優しい/使いやすい | HuggingFace/ModelScopeの重み、グラデーション、ディフューザーのソースコード統合。ComfyUIはまだToDoリストに残っています。 | HuggingFace、Replicate、Colabなどの早期アクセスポイントは存在するものの、アーキテクチャは時代遅れである。 | Comfyui-MusePoseがサポートされるようになりました。トレーニングコードは2025年3月4日に公開されました。 |
Wan-Animate-2の応用シナリオ
-
バーチャルアンカー/デジタルヒューマンライブストリーミングLite方式は、リアルタイムのしきい値とストリーミングキャラクターアニメーションに明確に焦点を当てており、「仮想アバターを操作する実在の人物」による低遅延のライブストリーミングルームの作成に適しています。
-
短編ビデオ/短編ドラマのキャラクタースタントダブルこのアイデアは、俳優の演技映像をメイン映像として使用し、それをキャラクターのイラストや参考画像に重ね合わせるというものです。ファンタジーキャラクター、IPキャラクター、低コストのスタントダブル撮影に適しています。核となるのは、エンドツーエンドのモーション転送とアイデンティティの保持です。
-
ダンス、ミュージックビデオ、ハンドジェスチャーダンスのファン作品ダンステンプレートを使用して、さまざまなキャラクターイメージを生成したり、複数のキャラクターによるダンスカバー、同一フレーム内での衣装チェンジ、スタイリッシュなミュージックビデオを作成したりできます。また、パースペクティブコントロールを使用すると、「同じアクションを異なるカメラアングルで撮影する」編集映像を作成することもできます。
-
Eコマースとブランドコンテンツブランドマスコットやバーチャルモデルが、新製品発表ビデオ、イベントページビデオ、ソーシャルメディア素材で使用するための統一テンプレートに従って動作することを許可する。商用利用の前に、肖像権、衣服の著作権、プラットフォームのコンプライアンスを処理する。
-
教育/知識ブロガー向けコースウェアこのシステムは、講師の画像または漫画風の講師を固定アクションのテンプレートに入力し、オープニング、トランジション、知識ポイントの提示ショットをバッチ処理で生成することで、繰り返し撮影するコストを削減します。
-
ゲームNPC / カットシーンプレビューまず、実写演技を用いてキャラクターのプロトタイプを迅速に作成し、動きのリズム、カメラアングル、感情表現などを検証した上で、正式なモーションキャプチャとレンダリングのパイプラインに進むかどうかを決定する計画だ。