project
SCAIL-2 - 志浦大学と清華大学が共同開発したキャラクターアニメーションモデル。
SCAIL-2は、Zhipuが清華大学の劉永金教授の研究グループと共同でオープンソース化した、第2世代の映画グレードのキャラクターアニメーションフレームワークです。拡散トランスフォーマー(DiT)アーキテクチャに基づいており、エンドツーエンドのトレーニングを通じて高品質なアニメーション転送を直接実現し、従来の手法を不要にします。
SCAIL-2とは何ですか?
SCAIL-2は、Zhipuが清華大学の劉永金教授の研究グループと共同でオープンソース化した、映画グレードのキャラクターアニメーションフレームワークの第2世代です。拡散トランスフォーマー(DiT)アーキテクチャをベースとし、エンドツーエンドのトレーニングを通じて高品質なアニメーション転送を直接実現することで、従来のポーズ推定の中間段階を不要にし、骨格図の曖昧さを回避します。アニメーション生成モードとキャラクター置換モードの両方をサポートし、SAM3マスクの強化により正確なマッチングを実現します。人間のキャラクターだけでなく、動物や手描きキャラクターなどの非人間キャラクターにも対応し、複数キャラクターのインタラクションをサポートすることで、映画、ゲーム、バーチャルアイドルなどの分野に効率的なアニメーションソリューションを提供します。
SCAIL-2の主な機能
-
エンドツーエンドのアニメーション生成DiT拡散変換器アーキテクチャに基づいて、従来の姿勢推定の中間ステップを直接バイパスし、参照画像から駆動ビデオアクションへの高品質なエンドツーエンド転送を実現し、スケルトングラフの曖昧性問題を回避します。
-
アニメーションモード参照キャラクターの外観を、駆動ビデオのモーションシーケンスに完全に転送することで、キャラクターの動きの再現を実現する。
-
交換モード動画内の指定された文字を、元の動きの軌跡と背景環境を維持しながら正確に置き換えます。
-
SAM3マスクの強化SAM3を参照画像として使用し、運転シーケンスから明示的なマスクを条件付き入力として抽出することで、キャラクターとアクションのマッチング精度が大幅に向上する。
-
多様なドライバソースのサポート人間の動作による操作をサポートするだけでなく、動物、手描きのキャラクター、ロボットといった人間以外の対象物にも対応でき、動物の訓練データがなくても四足動物を制御することさえ可能です。
-
複数文字間の対話処理キャラクターの動きの調整や、複数人が登場するシーンにおける相対位置の処理をサポートし、複雑なインタラクティブアニメーションを実現します。
-
三次元の一貫した態度表現生成されるアニメーションの空間的な整合性を確保するために、奥行き情報と遮蔽関係を保持する。
-
完全なコンテキストポーズ注入P-RoPE(ポーズシフトRoPE)を組み合わせることで、時空間的な共同推論を実現し、長尺シーケンスアニメーションの一貫性を向上させる。
SCAIL-2の技術的原理
-
拡散変換器(DiT)インフラストラクチャ: Diffusion Transformer をベースに、その強力なシーケンスモデリング機能を活用して長期的なアニメーション生成タスクを処理する生成モデルを構築します。
-
文脈に沿った学習DiTの持つ本来のコンテキスト学習能力を直接利用してモーション転送を行うため、NLFPoseなどの姿勢推定手法を中間表現として用いる必要がなく、複雑なシーンにおける骨格図の曖昧さの問題を回避できます。
-
3D空間に整合した姿勢表現生成されるアニメーションの空間次元における合理性と一貫性を確保するため、モデル内の奥行き情報と遮蔽関係を保持する。
-
フルコンテキストポーズインジェクションP-RoPE(ポーズシフトRoPE)メカニズムを使用することで、ポーズ情報がシーケンス全体のコンテキストに注入され、時空間的な関節推論が可能になり、長いシーケンスアニメーションの一貫性が向上します。
-
SAM3 明示的なマスク条件SAM3は、参照画像および駆動ビデオシーケンスとして使用され、明示的な条件付き入力として正確なマスクを抽出することで、キャラクターの外観と動きによる動作との間の正確な位置合わせを強化します。
-
エンドツーエンドの統合トレーニング従来の「姿勢推定→アニメーション生成」という2段階のパイプラインを廃止し、エンドツーエンドの統一されたトレーニング戦略を採用して、運転動画から直接動作を学習し、それを参照キャラクターに転送します。
-
高品質データフィルタリングパイプラインモデルの汎化能力と生成品質を確保するため、人間、動物、手描きキャラクターなど多様な対象を網羅した、厳格なスクリーニングと手動レビューを経た高品質なトレーニングデータセットを構築しました。
SCAIL-2の使い方
-
リポジトリをクローンして環境を構成するGitHubリポジトリより
https://github.com/zai-org/SCAIL-2README に従ってコードを取得し、依存関係をインストールします(通常は PyTorch、ディフューザー、および関連するビジョンライブラリが含まれます)。 -
事前学習済みモデルをダウンロードハギングフェイスより
https://huggingface.co/zai-org/SCAIL-2SCAIL-2モデルの重みファイルをダウンロードし、指定されたローカルディレクトリに配置してください。 -
材料入力の準備参照画像と、目標とする動作シーケンスを含む走行動画を準備してください。システムは、SAM3を条件入力として使用し、参照画像と走行シーケンスから明示的なマスクを自動的に抽出します。
-
生成モードを選択してくださいニーズに合わせてお選びください Animation Mode(参照文字の外観を駆動ビデオモーションに転送する)または Replacement Mode(運転動画内の指定されたキャラクターを、元のアニメーションと背景を維持したまま置き換えます。)
-
アニメーション生成コマンドを実行しますターミナルで対応するモードでスクリプトを実行します。例えば、エンドツーエンドのアニメーションモードを使用する場合:
python NLFPoseExtract/process_animation_aio.py --subdir <example_dir> --e2e_modeまたは置換モードを使用してください。python NLFPoseExtract/process_replacement.py --subdir <example_dir>。 -
生成された結果を取得するスクリプトの実行が完了すると、生成されたキャラクターアニメーション動画は出力ディレクトリに保存され、後処理やさらなる加工に直接使用できます。
SCAIL-2プロジェクトの住所
- プロジェクト公式サイト:https://teal024.github.io/SCAIL-2/
- GitHubリポジトリ:https://github.com/zai-org/SCAIL-2
- ハギングフェイスモデルライブラリ:https://huggingface.co/zai-org/SCAIL-2
SCAIL-2の主な利点
-
中間状態のないエンドツーエンドアニメーション転送はDiT拡散変換器に基づいて直接行われるため、中間表現としての従来の姿勢推定(NLFPoseなど)が不要になり、骨格図の曖昧さが回避され、プロセスが簡素化され、結果の信頼性が向上します。
-
映画並みのクオリティの制作高品質なデータスクリーニングパイプラインと3D一貫性のある姿勢表現を採用し、深度情報と遮蔽関係を保持することで、映画やテレビの基準を満たす結果を出力します。
-
デュアルモードの柔軟なアプリケーションアニメーションモード(外観転送)と置換モード(キャラクター置換)をサポートしており、アニメーション制作とビデオ編集という2つの主要なニーズを満たしています。
-
多様な運転能力人間の動作による操作をサポートするだけでなく、動物、手描きのキャラクター、ロボットなどの人間以外の対象物も扱うことができ、対応する訓練データなしで四足動物を制御することも可能です。
-
精密なマスク位置合わせSAM3の統合により、明示的なマスクが条件付き入力として抽出され、キャラクターの外見と運転動作のマッチング精度が大幅に向上します。
-
複数キャラクター間のインタラクションをサポート複数人によるシナリオにおいて、キャラクターの動きを調整し、相対的な位置関係を処理する能力を備えており、複雑なインタラクティブなシナリオにも適応できる。
-
時空整合的推論時空間的な共同推論メカニズムは、完全なコンテキストポーズ注入(P-RoPE)によって実現され、長いシーケンスアニメーションの時間的な一貫性と動作の一貫性を保証します。
SCAIL-2と類似の競合製品との比較
| 比較対象寸法 | SCAIL-2 (知埔×清華) | Viggle AI | MagicAnimate(アリババ) |
|---|---|---|---|
| 開発者 | Zhipu AI × 清華大学 | ヴィグルチーム | アリババ同義研究所 |
| オープンソースのステータス | 完全オープンソース(モデル+コード+論文) | クローズドソースの商用製品 | オープンソース(コード+モデル) |
| 技術アーキテクチャ | DiT拡散コンバータ、ミドルウェアなしのエンドツーエンド | 自社開発のクローズドソースモデル | 安定拡散+姿勢制御ネットワーク |
| 運転方法 | 直接ビデオ駆動、姿勢推定不要 | ビデオ/アクションテンプレートドライバー | OpenPoseなどの姿勢推定ミドルウェアに依存する |
| 脇役 | 人体、動物、手描き、ロボット、複数の人物 | 主に人体に焦点を当てており、一部様式化されたキャラクターにも対応しています。 | 人体を主な焦点とする |
| コアパターン | アニメーション移行+キャラクター置換デュアルモード | ミックス/アニメーション/ムーブなどのモード | 単一アニメーション生成モード |
| 質の高いものを生み出す | 映画品質、三次元的に一貫した姿勢、時空間的な一貫性 | 高品質で、ソーシャルシーンやエンターテイメントシーン向けに設計されています。 | 学業成績優秀者、複雑な動作時に震えやすい |
| 使用しきい値 | ローカルGPUの導入が必要であり、技術的なハードルが高い。 | ウェブ上ですぐに使用可能、学習不要 | ローカル展開が必要であり、設定は比較的複雑です。 |
SCAIL-2の応用シナリオ
-
映画およびアニメーション制作これは従来のモーションキャプチャプロセスに取って代わり、キャラクターデザインをあらかじめ設定された動きに素早く変換することで、アニメーション制作のコストと時間を削減します。
-
ゲーム開発ゲームキャラクターの歩行、戦闘、インタラクションなどのアニメーションリソースを生成したり、カットシーン(CG)の効率的な制作に利用されます。
-
バーチャルアイドルとデジタルヒューマンこれにより、バーチャルアンカーやデジタル従業員はライブストリーミングでのやり取りを行ったり、短いビデオコンテンツを作成したりすることができ、リアルタイムまたはバッチ処理によるアニメーション生成が可能になります。
-
広告およびブランドマーケティングブランドのIPキャラクターやバーチャルスポークスパーソンを動的な広告動画に組み込み、キャラクター置換モードをサポートすることで、複数のバージョンの素材に迅速に対応できます。
-
ソーシャルメディアコンテンツの作成手描きの画像、絵文字、または実際の写真を、ショートビデオプラットフォームでのコンテンツ制作と配信のためのダイナミックなビデオに変換します。
-
教育と訓練歴史上の人物の再現や教育的な役割の実演など、アニメーションコンテンツを作成することで、オンラインコースの楽しさと表現力を高める。