AB
AiBoss
project

Step-Video-TI2V - Step-Videoのオープンソースのグラフベースビデオモデル

Step-Video-TI2Vは、StepFunが開発したオープンソースの画像から動画への生成モデルです。300億個のパラメータを持ち、テキスト記述と画像入力に基づいて最大102フレームの動画を生成できます。

Step-Video-TI2Vとは何ですか?

Step-Video-TI2Vは、StepFunが開発したオープンソースの画像から動画への生成モデルです。300億個のパラメータを持ち、テキストによる説明と画像入力に基づいて最大102フレームの動画を生成できます。このモデルは、深層圧縮変分オートエンコーダ(Video-VAE)をベースとしており、16×16の空間圧縮と8倍の時間圧縮を実現し、学習と推論の効率を大幅に向上させています。ユーザーは、モーションスコアを設定することで、動画のダイナミズムと安定性のバランスを取ることができます。プッシュ、プル、パン、チルト、回転、フォローなど、さまざまなカメラ動作に対応しています。

Step-Video-TI2Vの主な機能

  • 画像生成ビデオユーザーは画像と関連するテキスト説明を入力することができ、モデルはこれらの入力に基づいて一貫性のある動画を生成します。
  • 高画質ビデオ出力最大102フレーム、5秒、540P解像度の動画生成に対応しており、多様なクリエイティブニーズを満たすことができます。
  • 動的調整ユーザーはモーションスコアを設定することで、動画のダイナミズムを制御できます。例えば、モーションスコアを2に設定すると、より安定した、しかし動きの少ない動画になります。一方、モーションスコアを10または20に設定すると、よりダイナミックな動画になります。
  • ダイナミクスと安定性のバランスモーションスコアを調整することで、ユーザーは動的な効果と安定性の最適なバランスを見つけることができます。
  • カメラのモーションコントロール固定レンズ、上下左右移動、上下左右パン、ズームイン/ズームアウト、回転、サラウンド、フォーカスシフトなど、複数のカメラ動作モードをサポートしています。
  • 映画的なカメラワーク映画のような複雑なカメラワークを生成でき、プロの制作ニーズを満たすことができる。
  • アニメ効果の最適化アニメ風動画の生成に優れており、背景のぼかしやダイナミックな動きなどのエフェクトを用いた動画を作成できます。アニメーション制作や短編動画制作などの用途に適しています。
  • 柔軟なビデオサイズ横長、縦長、正方形など、複数のサイズでの動画生成に対応しており、ユーザーは自身の創作ニーズやプラットフォームの特性に基づいて適切な動画サイズを選択できます。
  • 多言語対応バイリンガルテキストエンコーダーを搭載しており、中国語と英語の両方で入力プロンプトを表示できるため、言語背景の異なるユーザーにとって便利です。
  • 特殊効果生成能力初期段階では特殊効果を生成する能力を獲得しており、今後は技術的な最適化を通じて特殊効果生成の効果をさらに向上させていく予定です。

Step-Video-TI2Vの技術原理

  • 高度に圧縮された変分オートエンコーダー(Video-VAE)Step-Video-TI2Vは、深層圧縮変分オートエンコーダ(Video-VAE)を利用して、16×16の空間圧縮と8倍の時間圧縮を実現します。これにより、優れたビデオ再構成品質を維持しながら、ビデオ生成タスクの計算量を大幅に削減します。Video-VAEはデュアルパスアーキテクチャを採用しており、高周波情報と低周波情報を効果的に分離することで、ビデオ生成結果をさらに最適化します。
  • 拡散ベーストランスフォーマー(DiT)アーキテクチャこのモデルは、拡散ベースのTransformer(DiT)アーキテクチャに基づいており、3Dフルアテンションメカニズムを組み込んでいます。フローマッチング学習法を用いることで、入力ノイズは段階的に潜在フレームへと除去され、テキスト埋め込みとタイムステップが条件因子として使用されます。このアーキテクチャは、力強いモーションダイナミクスと高い美的品質を備えた動画の生成に優れています。
  • バイリンガルテキストエンコーダーStep-Video-TI2Vは、中国語と英語の両方のプロンプトを処理できるバイリンガルテキストエンコーダーを搭載しています。これにより、モデルは中国語または英語の入力を直接理解し、テキストの説明に一致するビデオを生成することができます。
  • 直接選好最適化(DPO)生成される動画の品質をさらに向上させるため、Step-Video-TI2Vは動画直接選好最適化(Video-DPO)手法を導入しました。DPOは人間の選好データを用いてモデルを微調整し、アーティファクトを低減し、視覚効果を高めることで、より滑らかでリアルな動画を生成します。
  • カスケード型トレーニング戦略このモデルは、テキストから画像への事前学習(T2I)、テキストから動画/画像への事前学習(T2VI)、テキストから動画への微調整(T2V)、および直接選好最適化(DPO)学習を含む、段階的な学習プロセスを採用しています。これにより、モデルの収束が加速され、品質の異なる動画データを最大限に活用できます。
  • システム最適化Step-Video-TI2Vは、効率的な分散学習を実現するために、テンソル並列処理、シーケンス並列処理、Zero1最適化などのシステムレベルの最適化を実施しました。また、データ伝送効率の最適化とパフォーマンスボトルネックの特定を目的として、高性能通信フレームワークであるStepRPCと2層監視システムであるStepTelemetryを導入しています。

Step-Video-TI2Vプロジェクトのアドレス

Step-Video-TI2Vの使い方

  • 越文ビデオをご覧くださいYuewen Videoの公式サイトまたはアプリをご覧ください。
  • 操作手順クリックして画像をアップロードし、テキストによる説明を入力してください。パラメーター(運動スコアなど)を調整してください。生成ボタンをクリックすると、動画をダウンロードまたは共有できます。

Step-Video-TI2Vの応用シナリオ

  • アニメーション制作Step-Video-TI2Vは、入力画像とテキスト説明に基づいて滑らかなアニメーションを生成する、アニメ風動画の生成に優れています。
  • 短編動画制作このモデルは、プッシュ、プル、パン、チルト、回転、サラウンドなど、さまざまなカメラ操作方法に対応しており、映画のような効果を持つ短い動画を生成できます。
  • 運動指導Step-Video-TI2Vは、スポーツ動作指導やダンス指導など、複雑な動的シーンを生成できます。
  • 特殊効果制作このモデルは、映画、テレビシリーズ、ゲームなどの特殊効果制作に適した、美的にも美しくリアルな動画を生成できます。
  • 製品紹介Step-Video-TI2Vは、製品の特徴やブランドストーリーを紹介する魅力的な広告動画を生成できます。