Alibaba Cloud WAN2.1 ローカル展開チュートリアル - 8GB VRAM をビデオに生成できます
今日は、ローカルAI動画制作に適したツールをいくつかご紹介します。正直なところ、現在のAI動画生成技術はかなり成熟していますが、唯一の欠点は価格が高いことです。料金は基本的に秒単位で、完璧な映像を保証するのは難しく、私の財布には到底手が届きません…。
今日は、地元の料理に適したレシピをいくつかご紹介します。 AI 動画コンテンツ。
正直に言うと、今では AI 動画制作技術はすでにかなり成熟しているが、一つだけ欠点がある。それは高額なことだ。料金は基本的に秒単位で課金され、一発で完璧な映像を撮ることは難しい。私の財布には到底無理だ。
本日GitHubで公開されたAlibaba Wan2.1プロジェクトは非常に独創的です。8GBのビデオメモリがあればローカルで動作可能で、これは現在のほとんどのコンピュータが満たせるスペックだと思います。
Wan2.1はアリ・トンイー氏のチームによるものです。オープンソース動画生成のための基本モデル一式。
プロジェクトのアドレス:https://github.com/Wan-Video/Wan2.1
Wan2.1は、テキストからビデオへの変換だけでなく、画像からビデオへの変換、開始時と終了時のフレーム補間、ビデオ編集、参照対象物の生成、テキストから画像への変換といったタスクも網羅しています。
Wan2.2は既にリリースされているものの、Wan2.1は低VRAMでのゲームプレイという点ではより完成度が高く、特にローカルでの実験や二次開発に適している。
多くの動画生成プロジェクトは、テキストから動画を生成するものや画像から動画を生成するものなど、単一のモデルしかリリースしません。一方、Wan2.1は、さまざまなタスクを担う複数の動画モデルを収録したツールボックスのようなものです。
- Wensheng VideoはWan2.1-T2V-1.3Bから開始できます。これは主に480Pに対応しており、ローカルテストやビデオメモリ容量の少ないデバイスに適しています。
- より優れた画像ディテールと動画性能を実現するには、480Pと720Pに対応したWan2.1-T2V-14Bを選択してください。
- この動画はWan2.1-I2V-14Bに対応しており、公式サイトでは480P版と720P版がそれぞれ提供されています。
- ビデオフィードの開始と終了を制御するには、Wan2.1-FLF2V-14B-720Pを使用できます。
- Wan2.1-VACE-1.3Bは、480Pのシナリオを想定したビデオ制作および編集向けに設計されており、参入障壁が低いのが特徴です。
- Wan2.1-VACE-14Bは480Pと720Pに対応しており、基準となる被写体の生成、部分的な修正、ビデオ被写体の変更、より複雑なビデオ編集に適しています。
公式ドキュメントには、Hugging Face、ModelScope、Diffusers、ComfyUI、Gradioなど、いくつかの統合方法が記載されています。
今回は、動作に必要なVRAMが8GBのみのWan2.1-T2V-1.3Bを選択しました。RTX 4090で480pの動画を約5秒間生成しましたが、公式の基準時間は約4分です。1.3Bは720pも試用できますが、公式ドキュメントによると720pは480pよりも安定性が低いとのことです。
ユーザー入力プロンプトワード次に、Wan2.1はT5エンコーダを使用してテキストを意味ベクトルに変換します。意味ベクトルは、画像の内容、主な動作、シーン、カメラの動き、画像のスタイル、照明、および色を記述します。
後続の各Transformer Blockは、Cross-Attentionを通じて、テキストの意味情報をビデオ生成プロセスに注入します。Wan2.1は多言語入力に対応しており、公式ドキュメントでは特に中国語と英語が強調されています。プロンプトワード能力。
Wan2.1もサポートしていますプロンプトワードさらに詳しく説明してください。例えば、次のように書くことができます。
猫がキッチンでケーキを作っている。
モデルを拡張することで、猫の外見、キッチン環境、アニメーション、カメラの距離、照明、スタイル、動作の順序といった詳細を追加できます。
しかし実際の文章ではプロンプトワード時間、推薦する構造は以下のとおりです。
被写体 + アクション + シーン + カメラ + 照明 + スタイル + 動きのリズム
黄色いレインコートを着た少女が雨の降る通りに立っていて、ゆっくりと顔をカメラに向けている。遠くには車が通り過ぎ、水たまりにはネオンの光が反射している。カメラは被写界深度の浅いミディアムショットからゆっくりと前方にパンし、リアルな映画のようなスタイルとクールな青みがかった色調で撮影されている。
Wan2.1は拡散トランスフォーマーを使用しており、その生成プロセスはおおまかに以下のように理解できます。
- ランダムなノイズを生成する。
- このモデルはプロンプトワードノイズに何が含まれるべきかを決定する。
- 複数回の反復処理によるノイズ低減。
- 徐々に、物語の主要部分、背景、そして展開が形成されていく。
- VAEは潜在変数をビデオにデコードします。
Wan2.1を実行する前に、対応するPython環境を準備する必要があります。公式の依存関係は主に以下のとおりです。
- PyTorch ≥ 2.4.0
- torchvision ≥ 0.19.0
- Diffusers ≥ 0.31.0
- Transformers ≥ 4.49.0
- Accelerate
- Flash Attention
- Gradio
- OpenCV
- NumPy 1.x
基本的なインストール方法は以下のとおりです。ここではWindows PowerShellを例にとります。
1 Set-Location "想安装 Wan 2.1的文件夹路径"
2 git clone https://github.com/Wan-Video/Wan2.1.git
3 Set-Location .\Wan2.1
4
5 python -m venv .venv
6 .\.venv\Scripts\python.exe -m pip install --upgrade pip
7 .\.venv\Scripts\python.exe -m pip install -r requirements.txt
ここにある .venv ファイルは、Wan2.1 プロジェクト独自の Python 仮想環境です。システムの Python 環境を汚染しないように、以降の依存関係のインストールやスクリプトの実行には、.venv 内の Python ファイルを使用することをお勧めします。
次に、1.3Bモデルをダウンロードしてください。
1 Set-Location "Wan 2.1的文件夹路径"
2 .\.venv\Scripts\python.exe -m pip install "huggingface_hub[cli]"
3
4 .\.venv\Scripts\huggingface-cli.exe download Wan-AI/Wan2.1-T2V-1.3B `
5 --local-dir .\Wan2.1-T2V-1.3B
インストール後、Wan2.1プロジェクトディレクトリにある.venv仮想環境に入ることで使用できます。PowerShellで、次の形式を入力してください。
Set-Location "Wan 2.1的文件夹路径"
# 进入 Wan2.1 项目目录。后面的模型路径、输出路径、generate.py 都基于这个目录执行。
New-Item -ItemType Directory -Force .\outputs
# 创建 outputs 输出文件夹。如果文件夹已经存在,-Force 会让 PowerShell 继续执行,不报错。
.\.venv\Scripts\python.exe generate.py `
# 使用 Wan2.1 项目里的 .venv 虚拟环境 Python,运行 generate.py 生成脚本。末尾的 ` 表示命令还没结束,下一行继续。
--task t2v-1.3B `
# 指定任务类型。t2v 表示文生视频,1.3B 表示使用 13 亿参数版本。
--size 832*480 `
# 设置视频分辨率。这里是宽 832、高 480,也就是 480P 横屏。
--frame_num 65 `
# 设置生成帧数。Wan2.1 通常按 16 FPS 导出,65 帧大约是 4 秒。
--ckpt_dir .\Wan2.1-T2V-1.3B `
# 指定模型权重目录,也就是下载好的 Wan2.1-T2V-1.3B 文件夹。
--offload_model True `
# 开启模型卸载,把暂时不用的模型部分放到 CPU 内存里,降低显存压力,但会变慢。
--t5_cpu `
# 让 T5 文本编码器在 CPU 上运行,省显存。T5 负责理解提示词。
--sample_steps 20 `
# 设置采样步数。步数越高通常画面更稳,但耗时更久。20 步比较适合质量和速度平衡。
--sample_shift 8 `
# 控制采样过程的时间分布。1.3B 常用 8 到 12,8 是比较稳的默认选择。
--sample_guide_scale 6 `
# 控制提示词引导强度。数值越高越听提示词,但太高可能让画面变硬或变形。1.3B 用 6 比较稳。
--save_file .\outputs\moonlit_train_window.mp4 `
# 指定输出视频文件名和保存位置。这里会保存到 outputs 文件夹里。
--prompt "提示词放这里"
# 视频提示词。描述主体、场景、动作、镜头、光线、风格和运动节奏。这个也要这种格式
最初の案件に取り組んだ際、私たちはまず低いフレームレートから始めて、徐々にマシンの限界をテストしていきました。
Wan2.1のデフォルトのエクスポート速度は通常16 FPSなので、65フレーム ÷ 16 FPS ≈ 4秒となります。
一般的な目安:33フレーム ≈ 2秒、49フレーム ≈ 3秒、65フレーム ≈ 4秒、81フレーム ≈ 5秒。
ケース1:33フレーム、12サンプリングステップ
PowerShell 入力:
Set-Location "D:\360MoveData\Users\win\Desktop\Distillation\Wan2.1"
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 33 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 12 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\quick_test.mp4 `
–prompt "A small robot walking through a rainy neon street, cinematic lighting."
フレーム33、12ステップ後、主要被写体ははっきりと見え、ロボットの形状はほぼ安定しており、ネオン街と湿地の反射も確認できます。問題は、画像がやや空虚で、雨の効果が不明瞭であり、ロボットの動きがぎこちないことです。
ケース2:33フレーム、20サンプリングステップ
PowerShell 入力:
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 33 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 20 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\robot_neon_street.mp4 `
–prompt "A small friendly robot walking alone through a rainy neon street at night, wet asphalt reflecting red and blue signs, soft steam rising from street vents, cinematic cyberpunk atmosphere, low-angle tracking shot, slow camera movement, detailed metal body, glowing eyes, realistic rain, volumetric lighting, shallow depth of field, high detail, smooth motion, 35mm film look"
映像は以前よりも格段に良くなっている。赤と青のネオンライト、濡れた路面、夜の雰囲気など、すべてがより安定しており、ロボットは画面中央に位置し、被写体も容易に識別できる。しかし、2秒という時間は短すぎ、動きも不十分だ。ロボットは「歩いている」というよりは、路上に立ってわずかに動いているように見える。
ケース3:49フレーム、20サンプリングステップ
PowerShell 入力:
Set-Location "D:\360MoveData\Users\win\Desktop\Distillation\Wan2.1"
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 49 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 20 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\robot_neon_street_v2.mp4 `
–prompt "A cinematic 3-second video of a small friendly robot walking alone through a rain-soaked neon street at night. The robot has a compact metal body, round glowing eyes, and subtle reflections on its wet surface. Red, blue, and purple neon signs reflect on the asphalt. Light rain falls through the frame, steam rises from street vents, and distant shop lights glow softly in the background. Low-angle tracking shot, slow forward camera movement, realistic rain, volumetric lighting, shallow depth of field, smooth walking motion, detailed cyberpunk street, moody atmosphere, 35mm film look, high detail."
このバージョンでは空間表現が格段に向上している。霧、地面の反射、遠くの店の明かりなど、すべてがより鮮明に表現され、ロボットも周囲の環境に自然に溶け込んでいる。3.06秒のクリップは、以前の2つのクリップよりも動きが滑らかで、映像全体がより完成度の高いショットのように感じられる。
ケース4:65フレーム、20サンプリングステップ
PowerShell 入力:
Set-Location "D:\360MoveData\Users\win\Desktop\Distillation\Wan2.1"
.\.venv\Scripts\python.exe generate.py `
–task t2v-1.3B `
–size 832*480 `
–frame_num 65 `
–ckpt_dir .\Wan2.1-T2V-1.3B `
–offload_model True `
–t5_cpu `
–sample_steps 20 `
–sample_shift 8 `
–sample_guide_scale 6 `
–save_file .\outputs\moonlit_train_window.mp4 `
–prompt "A cinematic 4-second video seen from inside an old night train. A young traveler sits beside a rain-covered window, watching a quiet countryside pass by under moonlight. Reflections of warm carriage lamps shimmer on the glass. Outside the window, distant trees, small houses, and silver mist slide slowly across the frame. The camera begins with a close-up of raindrops on the window, then gently shifts focus to the traveler's calm face and the moving landscape beyond. Soft film grain, realistic rain, warm interior light, cool blue moonlight outside, slow emotional camera movement, shallow depth of field, natural motion, detailed train cabin, quiet poetic atmosphere, 35mm film look, high detail."
動画が進むにつれて、物語性は向上していった。車内の温かみのある照明、窓の外の涼しげな青い光、雨粒、そして旅人の横顔はどれも美しく、人物像は歪んで見えず、全体的な効果は非常に安定していた。しかし、再生にこれほど時間がかかったということは、私のマシンの性能限界にほぼ達していることを示している。
AI 動画はもはや、新しいことを試すための単なるツールではない。
ゴールドマン・サックスは、クリエイター経済が2027年までに約2500億ドルから4800億ドルに成長する可能性があると予測している。動画コンテンツへの需要は高まっているものの、クリエイターにとって最大の課題は依然としてコスト、試行錯誤を繰り返す期間、そして制作スピードである。
Wan2.1はプロのビデオ制作チームに取って代わるものではなく、すべてのビデオが初回で完璧なショットになることを保証するものでもありません。しかし、Wan2.1-T2V-1.3Bは、秒単位課金プラットフォームで行われていたビデオ制作プロセスを、ローカルグラフィックカードを使用して繰り返しテストできるワークフローへと回帰させます。プロンプトワード段階的に変更したり、パラメータを自分で調整したりできるので、失敗した場合のコストははるかに低くなります。
Grand View Researchは、世界的に AI 動画生成市場は、2025年の7億8850万ドルから2033年には34億4160万ドルに成長すると予測されており、年平均成長率は約20.3%となる。
Wan2.1は、実際の生産チェーンのフロントエンドに配置するのに適しています。まず、低コストでサンプル画像を生成し、レンズを検証し、テストを行います。プロンプトワードスタイルやその他の要素に基づいて、どのセグメントにレタッチ、編集、フレーム補間、またはより高価な商用モデルへの外注を行う価値があるかを判断します。
WAN2.1は、従来高価で頻度も低く、予算を圧迫するビデオ制作の試行錯誤プロセスを、一般的なコンピュータでも参加できるルーチン的な制作ワークフローへと変革します。