project
Waver 1.0 - ByteDanceが発表したAI動画生成モデル
Waver 1.0は、ByteDanceが発表した次世代ビデオ生成モデルです。改良されたストリームトランスフォーマーアーキテクチャに基づいており、テキストからビデオへの変換(T2V)、画像からビデオへの変換(I2V)、テキストから画像への変換(T2I)をサポートし、単一の環境で使用できます。
Waver 1.0とは何ですか?
Waver 1.0は、ByteDanceが発表した次世代ビデオ生成モデルです。改良型ストリームトランスフォーマーアーキテクチャをベースとしており、テキストからビデオへの変換(T2V)、画像からビデオへの変換(I2V)、テキストから画像への変換(T2I)を、モデルを切り替えることなく単一のフレームワーク内でサポートします。最大1080pの解像度と2秒から10秒までの柔軟なビデオ長をサポートし、複雑な動きのキャプチャと、動きの振幅とタイミングの一貫性に優れたビデオ生成に優れています。Waver-Bench 1.0およびHermesモーションテストスイートにおいて、Waver 1.0は既存のオープンソースおよびクローズドソースモデルを凌駕する性能を発揮します。超リアル、アニメーション、クレイアニメ、ぬいぐるみなど、さまざまな芸術スタイルでのビデオ生成をサポートします。
Waver 1.0の主な機能
-
統合発電モデルを切り替えることなく、テキストからビデオへの変換(T2V)、画像からビデオへの変換(I2V)、およびテキストから画像への変換(T2I)をサポートします。
-
高解像度で長さも柔軟に対応可能最大1080pの解像度と2~10秒の動画長に対応し、解像度とアスペクト比を柔軟に調整できます。
-
複雑な動作モデリング複雑な動きを捉えることに優れており、生成される動画は動きの振幅と時間的な一貫性の点で非常に優れた性能を発揮します。
-
マルチカメラによる物語複数のショットを組み合わせた、一貫性のある物語性のある動画を生成できるため、中心となるテーマ、ビジュアルスタイル、全体的な雰囲気において高い一貫性を確保できます。
-
芸術的なスタイルのサポート超写実的、アニメーション、粘土細工、ぬいぐるみなど、さまざまなアートスタイルでの動画生成をサポートします。
-
パフォーマンス上の利点Waver-Bench 1.0およびHermesモーションテストスイートにおいて、既存のオープンソースおよびクローズドソースのモデルを上回る性能を発揮する。
-
推論最適化APG技術は、生成されるビデオのアーティファクトを低減し、リアリティを向上させるために使用されます。
-
トレーニング戦略動き生成能力は、低解像度の動画で学習させ、徐々に解像度を上げていくことで最適化される。
-
チップラベルプロンプトラベルを使用して異なる種類のトレーニングデータを区別することで、生成効果を向上させることができる。
Waver 1.0の技術的原理
-
モデルアーキテクチャWaver 1.0はハイブリッドストリームDiTアーキテクチャを採用しており、圧縮ビデオから潜在変数を取得するためにWan-VAEを使用し、テキスト特徴を抽出するためにflan-t5-xxlとQwen2.5-32B-Instructを使用しています。DiTモデルは、改良されたストリームトランスフォーマーに基づいて構築されています。ビデオとテキストのモダリティは、デュアルストリーム+シングルストリームのアプローチを使用して融合されます。
-
1080p世代Waver-RefinerはDiTアーキテクチャを採用し、ストリームマッチング手法を用いて学習されます。まず、低解像度ビデオ(480pまたは720p)を1080pにアップサンプリングし、次にノイズを加えます。このノイズを含む低解像度ビデオを入力として使用し、高品質な1080pビデオを出力します。ウィンドウアテンション機構を用いることで推論ステップを削減し、推論速度を大幅に向上させています。
-
トレーニング方法低解像度動画でのトレーニングは、動きの学習において非常に重要です。192p動画でのトレーニングには十分な計算リソースを割り当て、その後徐々に解像度を480p、720pへと上げていきます。SD3のストリームマッチングトレーニング設定に従い、480pおよび720p動画でのトレーニング中にシグマシフト値を徐々に上げていきます。
-
チップラベルキューラベリング法は、異なる種類のトレーニングデータを区別するために使用され、ビデオのスタイルと品質に基づいてトレーニングデータに異なるラベルを割り当てます。トレーニング中は、ビデオのスタイルを表すキューがタイトルの前に追加され、ビデオの品質を表すキューがトレーニングタイトルの末尾に追加されます。推論中は、低品質(低解像度やスローモーションなど)を表すキューがネガティブキューとして含まれます。
-
推論最適化APGは、APGをビデオ生成に拡張し、リアリズムを高め、アーティファクトを低減します。APGは、CFGの更新項を並列成分と直交成分に分解し、並列成分の重みを減らすことで、過飽和を起こさずに高品質な生成を実現します。
Waver 1.0プロジェクトのアドレス
- プロジェクト公式サイト:http://www.waver.video/
- GitHubリポジトリ:https://github.com/FoundationVision/Waver
- arXiv技術論文:https://arxiv.org/pdf/2508.15761
Waver 1.0の応用シナリオ
-
コンテンツ作成テキストによる説明を鮮やかな動画に変換することで、物語の創作、広告、短編ドラマなどに活用できます。
-
製品紹介商品画像を動的な表示動画に変換することができ、ECサイトのライブ配信、商品展示、バーチャル試着などに適しています。
-
教育と訓練教育コンテンツや研修資料は、学習体験を向上させるために、インタラクティブな動画に変換することができます。
-
ソーシャルメディアソーシャルメディアへの投稿に適した動画コンテンツを素早く生成し、ユーザーの注目を集めましょう。
-
アニメーション制作静止画像をアニメーションに変換します。アニメーション制作、キャラクター主導型アニメーション、特殊効果生成に適しています。
-
ゲーム開発ゲーム内のダイナミックなシーンやキャラクターアニメーションを生成し、ゲームの没入感を高めます。