project
Step-Video-T2V - Step-Starのオープンソースのテキストからビデオへの変換モデル
Step-Video-T2V は、Step-Stars チームによって開発されたオープンソースのテキストからビデオへの事前学習済みモデルです。300 億個のパラメータを持ち、最大 204 フレームの高品質なビデオを生成できます。このモデルは、ディープ圧縮された変分オートエンコーダ (Video-...
Step-Video-T2Vとは何ですか?
Step-Video-T2Vは、Step-Leap Starチームが開発したオープンソースのテキストからビデオへの事前学習済みモデルです。300億個のパラメータを持ち、毎秒最大204フレームの高品質ビデオを生成できます。深層圧縮変分オートエンコーダ(Video-VAE)に基づいて、16×16の空間圧縮と8倍の時間圧縮を実現し、トレーニングと推論の効率を大幅に向上させています。Step-Video-T2Vは、中国語と英語の両方の入力プロンプトをサポートするバイリンガルテキストエンコーダを備え、直接選好最適化(DPO)メソッドによってビデオ品質をさらに向上させています。拡散ベースのTransformer(DiT)アーキテクチャと3Dフルアテンションメカニズムに基づくこのモデルは、強いモーションダイナミクスと高い美的品質を備えたビデオの生成に優れています。
Step-Video-T2Vの主な機能
- 高品質なビデオ生成Step-Video-T2Vは300億個のパラメータを誇り、毎秒最大204フレームの高画質ビデオを生成でき、544×992の解像度をサポートしています。
- バイリンガルテキスト対応バイリンガルテキストエンコーダーを搭載しており、中国語と英語のプロンプトを直接入力でき、テキストの説明に合致する動画を理解・生成できます。
- 動的かつ美的最適化3DフルアテンションDiTアーキテクチャとフローマッチングトレーニング手法を用いて、強力なダイナミック効果と高い美的品質を備えた動画を生成します。
ステップビデオT2Vの技術原理
- 高度に圧縮された変分オートエンコーダー(Video-VAE)Step-Video-T2Vは、深層圧縮変分オートエンコーダ(Video-VAE)を用いて、16×16の空間圧縮と8倍の時間圧縮を実現します。これにより、優れたビデオ再構成品質を維持しながら、ビデオ生成タスクの計算量を大幅に削減できます。
- バイリンガルテキストエンコーダーこのモデルには、中国語と英語の両方のプロンプトを処理できる、事前学習済みの2つのバイリンガルテキストエンコーダーが搭載されています。Step-Video-T2Vは、中国語と英語の入力を直接理解し、テキストの説明に一致するビデオを生成できます。
- 拡散ベーストランスフォーマー(DiT)アーキテクチャStep-Video-T2Vは、拡散ベースのTransformer(DiT)アーキテクチャに基づいており、3Dフルアテンションメカニズムを組み込んでいます。フローマッチング学習を通じて、テキスト埋め込みとタイムステップを条件因子として使用し、入力ノイズを潜在フレームへと段階的に除去します。動きのダイナミクスが強く、美的品質の高い動画を生成することに優れています。
- 直接選好最適化(DPO)生成される動画の品質をさらに向上させるため、Step-Video-T2Vは動画直接選好最適化(Video-DPO)手法を導入しました。DPOは人間の選好データを用いてモデルを微調整し、アーティファクトを低減し、視覚効果を高めることで、より滑らかでリアルな動画を生成します。
- カスケード型トレーニング戦略このモデルは、テキストから画像への事前学習(T2I)、テキストから動画/画像への事前学習(T2VI)、テキストから動画への微調整(T2V)、および直接選好最適化(DPO)学習を含む、段階的な学習プロセスを採用しています。これにより、モデルの収束が加速され、品質の異なる動画データを最大限に活用できます。
- システム最適化Step-Video-T2Vは、効率的な分散学習を実現するために、テンソル並列処理、シーケンス並列処理、Zero1最適化などのシステムレベルの最適化を実施しました。また、データ伝送効率の最適化とパフォーマンスボトルネックの特定を目的として、高性能通信フレームワークであるStepRPCと2層監視システムであるStepTelemetryを導入しています。
Step-Video-T2Vプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/stepfun-ai/Step-Video-T2V
- ハギングフェイスモデルライブラリ:https://huggingface.co/stepfun-ai/stepvideo-t2v
- arXiv技術論文:https://arxiv.org/pdf/2502.10248
Step-Video-T2Vの応用シナリオ
- 動画コンテンツ制作Step-Video-T2Vは、テキストプロンプトに基づいてクリエイティブな動画を素早く生成できるため、クリエイターは時間と労力を節約し、動画制作のハードルを下げることができます。
- 広告制作これは、ブランドや広告主向けにパーソナライズされた動画広告コンテンツを生成し、広告の魅力とリーチを向上させることができます。
- 教育と訓練Step-Video-T2Vは、学生が知識をよりよく理解し、記憶するのに役立つ教育ビデオを生成できます。
- エンターテインメントと映画映画やテレビ番組制作のためのクリエイティブ素材を提供し、特殊効果、アニメーション、短編ドラマクリップの制作を支援し、クリエイティブプロセスを加速させる。
- ソーシャルメディアStep-Video-T2Vは、ユーザーにパーソナライズされた動画生成ツールを提供し、ソーシャルメディアプラットフォームのコンテンツエコシステムを充実させ、ユーザー間のインタラクションを強化します。生成された動画は、ソーシャルメディア上でのクリエイティブなコンテンツ共有に活用できます。