project
Wan2.1 - アリババのオープンソースAI動画生成モデル
Wan2.1は、Alibaba Cloudが提供するオープンソースのAI動画生成モデルで、強力な画像生成機能を備えています。Wan2.1はテキストベースと画像ベースの両方の動画タスクをサポートし、2種類のサイズのモデルが用意されています。14バイトのパラメータを持つプロフェッショナル版は、複雑な動きの生成に優れています。
WAN2.1とは何ですか?
Wan2.1は、Alibaba Cloudが提供するオープンソースのAIビデオ生成モデルで、強力なビジュアル生成機能を誇ります。Wan2.1は、テキストベースと画像ベースの両方のビデオ生成タスクをサポートし、2つのモデルサイズがあります。14Bパラメータのプロフェッショナルバージョンは、複雑なモーション生成と物理モデリングに優れ、優れたパフォーマンスを提供します。1.3Bパラメータの高速バージョンは、低メモリ要件のコンシューマーグレードのグラフィックカードで実行可能で、二次開発や学術研究に適しています。Wan2.1モデルは、因果関係に基づく3D VAEとビデオ拡散トランスフォーマーアーキテクチャに基づいており、効率的な時空間圧縮と長期依存性モデリングを実現しています。14Bバージョンは、権威あるVbenchベンチマークで、Sora、Luma、Pikaなどの国内外のモデルを大幅に上回り、合計スコア86.22%でトップの座を確固たるものにしました。 Wan2.1はApache 2.0ライセンスの下でオープンソースとして公開されており、複数の主要なフレームワークをサポートし、GitHub、HuggingFace、およびModaコミュニティで入手可能であるため、開発者の利用と展開が容易です。
WAN2.1の主な機能
- 文生ビデオ入力されたテキスト記述に基づいて対応するビデオコンテンツを生成し、中国語と英語の長文コマンドをサポートし、シーンの遷移やキャラクターのやり取りを正確に再現します。
- 画像と動画画像に基づいて動画を生成するため、より制御性の高い制作が可能になり、静止画像から動的な動画へと拡張するニーズに適しています。
- 複雑な動作生成回転、ジャンプ、旋回など、人や物体の複雑な動きを安定して表示でき、高度なカメラ動作制御にも対応しています。
- 物理法則シミュレーション衝突、跳ね返り、切断といった現実世界の物理的な状況を正確に再現し、物理法則に準拠したビデオコンテンツを生成します。
- マルチスタイル生成多様なクリエイティブニーズに対応するため、様々なビデオスタイルやテクスチャをサポートしており、異なるアスペクト比のビデオ出力にも対応しています。
- テキストエフェクト生成中国語のテキストを生成する機能を備え、中国語と英語のテキストエフェクトをサポートしているため、動画の視覚的な魅力を高めることができます。
WAN2.1の技術的原則
- 因果的3D VAE(変分オートエンコーダー)アーキテクチャWanxiangが独自開発した因果的3D VAEアーキテクチャは、動画生成に特化して設計されています。エンコーダを用いて入力データを潜在空間の表現に圧縮し、デコーダを用いて出力を再構築することで機能します。動画生成において、3D VAEは動画内の時空間情報を処理できるだけでなく、因果制約を組み込むことで生成される動画の一貫性と論理性を確保します。
- ビデオ拡散トランスフォーマーアーキテクチャこれは、主流のビデオ拡散モデルとTransformerアーキテクチャに基づいています。拡散モデルはノイズを徐々に除去してデータを生成し、Transformerは自己注意機構に基づいて長期的な依存関係を捉えます。
- モデルのトレーニングと推論の最適化:
- トレーニング段階テキストおよびビデオエンコーディングモジュールのトレーニングを高速化するために、DP(データ並列処理)とFSDP(完全シャーディングデータ並列処理)を組み合わせた分散戦略が用いられています。拡散モジュールについては、トレーニング効率をさらに向上させるために、DP、FSDP、RingAttention、およびUlyssesを組み合わせた並列戦略が採用されています。
- 推論段階分散型高速化は、CP(チャネル並列処理)を用いて個々の動画生成の遅延を低減することで実現されます。大規模モデルの場合、モデル分割技術に基づいて推論効率がさらに最適化されます。
WAN2.1のパフォーマンス上の利点
- 優れた生成品質Vbenchによる評価では、14のパラメータを備えたプロフェッショナル版が合計86.22%のスコアを達成し、他の国内外のモデル(Sora、Luma、Pikaなど)を大きく上回り、トップの座を確固たるものにした。
- コンシューマー向けGPUに対応超高速なパラメータを備えたバージョン1.3Bは、480Pビデオを生成するのに必要なビデオメモリがわずか8.2GBです。ほぼすべての一般消費者向けGPUと互換性があり、RTX 4090では約4分で5秒間の480Pビデオを生成できます。
- 多機能サポートテキストからビデオへの変換、画像からビデオへの変換、ビデオ編集、テキストから画像への変換、ビデオから音声への変換など、さまざまなタスクをサポートするだけでなく、視覚効果やテキストレンダリング機能も備えており、多様なシナリオにおけるクリエイティブなニーズに対応します。
- 高効率データ処理とアーキテクチャ最適化独自開発の因果的3D VAEと最適化されたトレーニング戦略に基づき、任意の長さの動画の効率的なエンコードとデコードをサポートし、推論メモリ使用量を大幅に削減し、トレーニングと推論の効率を向上させます。
Wan2.1プロジェクトアドレス
- プロジェクト公式サイト:https://wanxai.com
- GitHubリポジトリ:https://github.com/Wan-Video/Wan2.1
- ハギングフェイスモデルライブラリ:https://huggingface.co/Wan-AI
WAN2.1 効果デモンストレーション
- 複雑な動き幅広い身体の動き、複雑な回転、ダイナミックなシーン遷移、滑らかなカメラワークなどを含む、リアルな動画を生成することに優れています。
- 物理シミュレーションこの技術は、現実世界の物理法則を正確にシミュレートし、物体間の相互作用をリアルに描写する動画を生成することができる。
- 映画並みの画質豊かな質感と多様な様式化された効果を備えた、映画のような視覚効果を提供します。
- 制御可能な編集汎用的な編集モデルを採用しており、画像や動画を参照しながら正確な編集を行うことができます。
WAN2.1のアプリケーションシナリオ
- 映画製作と特殊効果複雑なアクションシーン、特殊効果ショット、または仮想キャラクターアニメーションを生成することで、撮影コストと時間を削減します。
- 広告とマーケティング製品特性やブランドイメージに基づいてパーソナライズされた動画コンテンツを制作し、クリエイティブな広告動画を迅速に生成します。
- 教育と訓練学習体験を向上させるために、科学実験の実演、歴史的場面の再現、語学学習ビデオなどの教育ビデオを作成する。
- ゲーム開発ゲームの視覚効果と没入感を高めるために、ゲーム内のアニメーション、カットシーン、または仮想キャラクターの動きを生成するために使用されます。
- 個人的な創作活動とソーシャルメディアこれは、クリエイターがソーシャルメディアでの共有、Vlog制作、または個人プロジェクトの紹介のために、クリエイティブな動画を素早く作成するのに役立ちます。