project
Open-Sora 2.0 - Luchen Technology社によるオープンソースのAI動画生成モデル。
Open-Sora 2.0は、Luchen Technologyが発表した最新のオープンソース最先端(SOTA)ビデオ生成モデルです。Open-Sora 2.0は、20万ドル(224個のGPU)を投じて、11個のパラメータを持つ商用グレードのモデルのトレーニングに成功しました。
Open-Sora 2.0とは何ですか?
Open-Sora 2.0は、Luchen Technologyが発表した、全く新しいオープンソースの最先端(SOTA)ビデオ生成モデルです。Open-Sora 2.0は、20万ドル(224個のGPU)を使用して11個のパラメータを持つ商用グレードのモデルを正常にトレーニングし、従来の高性能ビデオ生成モデルと比較してトレーニングコストを大幅に削減しました。このモデルは、VBenchおよびユーザー嗜好テストで非常に優れたパフォーマンスを発揮し、HunyuanVideoや30個のパラメータを持つStep-Videoなどの主流のクローズドソースモデルと同等、あるいはそれ以上のパフォーマンスを実現しています。Open-Sora 2.0は、3Dオートエンコーダ、3Dフルアテンションメカニズム、MMDiTアーキテクチャをベースに、効率的な並列トレーニングスキームと高圧縮オートエンコーダを組み合わせることで、トレーニング効率と推論速度を大幅に向上させています。
Open-Sora 2.0の主な特徴
- 高品質なビデオ生成滑らかな720p解像度、24fpsの動画を生成し、様々なシーンやスタイルに対応し、自然風景から複雑でダイナミックなシーンまで優れた性能を発揮します。
- 可動範囲を制御可能ユーザーのニーズに合わせて動画内の人物や物体の動きの範囲を調整することで、より繊細で正確な動的な表現を実現します。
- テキストからビデオへの変換(T2V)テキストの説明文から直接対応する動画コンテンツを生成する機能をサポートしており、クリエイティブな動画制作やコンテンツ生成のニーズを満たします。
- 画像から動画への変換(I2V)オープンソースの画像モデルを組み合わせることで、画像に基づいて動画を生成することが可能になり、生成効果と多様性をさらに向上させることができる。
Open-Sora 2.0の技術原理
- モデルアーキテクチャこのシステムは、3Dオートエンコーダーに基づいてビデオデータを効率的に処理し、時間軸における動的な情報を捉えます。また、フルアテンションメカニズムを導入することで、ビデオ生成の時空間的な一貫性を向上させています。さらに、マルチモーダル拡散(MMDiT)アーキテクチャと組み合わせることで、テキストとビデオコンテンツ間の相関関係をより正確に捉えます。
- 高圧縮率自己エンコーダー4×32×32の高圧縮率オートエンコーダーに基づいて、推論コストが大幅に削減されます。
- 高効率なトレーニング方法多段階・多レベルのデータフィルタリング機構に基づき、高品質なデータ入力を確保することで、学習効率を向上させます。学習は低解像度で優先的に行い、重要な動的特徴を学習した後、徐々に解像度を上げて計算負荷を大幅に削減します。画像から動画への変換タスクを優先的に学習することで、画像の特徴に基づいて動画生成を行い、モデルの収束を加速します。
- 並列トレーニングと最適化ColossalAIとシステムレベルの最適化を組み合わせることで、コンピューティングリソースの利用効率が向上します。主な技術最適化には、シーケンス並列処理、ZeroDP、きめ細かな勾配チェックポイント、自動復旧メカニズム、効率的なデータロードとメモリ管理などが含まれ、トレーニング効率を最大限に高めます。
- モデルの初期化と蒸留初期化にはオープンソースのグラフベース動画モデルFLUXを利用することで、学習コストを削減します。蒸留ベースの最適化戦略により、オートエンコーダの特徴空間の表現力が向上し、必要なデータ量と学習時間を削減します。
Open-Sora 2.0のパフォーマンス
- HunyuanVideoや30B Step-Videoに匹敵するOpen-Sora 2.0は、わずか11個のパラメータしか持たないにもかかわらず、VBenchや人間の嗜好テストにおいて、30個のパラメータを持つHunyuanVideoやStep-Videoといった高価で主流のクローズドソースの大規模モデルと同等の性能を実現しています。
- ユーザー嗜好評価視覚性能、テキストの一貫性、モーション性能という3つの主要な側面において、Open-Sora 2.0は、オープンソースの最先端モデルであるHunyuanVideoと商用モデルであるRunway Gen-3 Alphaを少なくとも2つの指標で上回り、より少ないリソースでより優れたパフォーマンスを実現しています。
- VBenchの指標は優れたパフォーマンスを示している動画生成の主要ベンチマークであるVBenchによると、Open-Sora 2.0は優れた性能を発揮しています。Open-Sora 1.2から2.0にアップグレード後、業界をリードするクローズドソースのOpenAI Soraモデルとの性能差は4.52%からわずか0.69%に縮小し、ほぼ完全な性能一致を実現しました。Open-Sora 2.0のベンチマークスコアはTencentのHunyuanVideoを上回り、より低いトレーニングコストでより高い性能レベルを達成し、オープンソースの動画生成分野における新たなマイルストーンを打ち立てました。
Open-Sora 2.0プロジェクトのアドレス
- GitHubリポジトリ:https://github.com/hpcaitech/Open-Sora
- 技術論文:https://github.com/hpcaitech/Open-Sora-Demo/blob/main/paper/Open_Sora_2
Open-Sora 2.0 の生成結果
- プロンプトワードレタスに乗ってランチドレッシングの滝を滑り降りるトマト。誇張されたサーフィンの動きとクリーミーな波の効果が、3Dアニメーションの楽しさを際立たせている。
- プロンプトワードドローンカメラがアマルフィ海岸沿いの岩場に建つ歴史的な教会を旋回し、その見事な建築、段々になったパティオ、そして眼下に打ち寄せる波と、暖かい午後の光の中で景色を楽しむ人々など、ドラマチックな海岸線を映し出している。
- プロンプトワードまるで災害映画のワンシーンのようだ。
- プロンプトワード古代中国の様式を写実的に描いた作品。刺繍の施された赤いチャイナドレスを身にまとった若い女性が、賑やかな中国の町の古風な通りを歩いている。彼女の頭上に吊るされた赤い提灯は夕暮れのそよ風に優しく揺れ、彼女の穏やかで自信に満ちた足取りは、周囲の商人や芸人たちの活気ある雰囲気と鮮やかなコントラストを成している。
Open-Sora 2.0 の使い方
- ソースコードからインストール:
- 仮想環境を作成します(Condaの使用を推奨します)。:
conda create -n opensora python=3.9
conda activate opensora
-
- リポジトリのクローン作成:
git clone https://github.com/hpcaitech/Open-Sora
cd Open-Sora
-
- 依存関係をインストールします:
- お使いのCUDAバージョン(例:CUDA 12.1)に応じて、基本的な依存関係をインストールしてください。:
- 依存関係をインストールします:
pip install
-r requirements/requirements-cu121.txt
-
-
- 設置プロジェクト:
-
pip install
-v
.
# 或使用开发模式:pip install -v -e .
-
-
- アクセラレーション関連の依存関係をインストールします(任意ですが、推奨します):
-
pip install git+https://github.com/hpcaitech/TensorNVMe.git
pip install git+https://github.com/hpcaitech/ColossalAI.git
pip install packaging ninja
pip install flash-attn --no-build-isolation
pip install
-v --disable-pip-version-check --no-cache-dir --no-build-isolation --config-settings "--build-option=--cpp_ext" --config-settings "--build-option=--cuda_ext" git+https://github.com/NVIDIA/apex.git
- Dockerを使用してインストールする:
- Dockerイメージの構築:
docker build -t opensora .
-
- Dockerコンテナを実行します(GPUと作業ディレクトリがマウントされていることを確認してください)。:
docker run -ti
--gpus all -v .:/workspace/Open-Sora opensora
Open-Sora 2.0の応用シナリオ
- ビデオ制作広告やアニメーションなどのクリエイティブな動画を迅速に作成し、制作コストを削減します。
- 映画やテレビ番組のポストプロダクション特殊効果ショットやバーチャルシーンの生成を支援し、制作効率を向上させます。
- 教育教育の楽しさと効果を高めるための教育ビデオを作成する。
- ゲーム開発ゲームアニメーションや仮想シーンの生成に使用され、ゲームコンテンツを豊かにします。
- VR/ARアプリケーション没入感のある仮想シーンを作成し、ユーザーエクスペリエンスを向上させる。