AB
AiBoss
project

STIV - Appleが発表した大規模ビデオ生成モデル。

STIV(Scalable Text and Image Conditioned Video Generation)は、Appleが発表した大規模ビデオ生成モデルです。STIVは8億7000万個のパラメータを誇り、テキストからビデオ(T2V)やテキストから画像への変換を処理できます。

STIVとは何ですか?

STIV(Scalable Text and Image Conditioned Video Generation)は、Appleが発表した大規模ビデオ生成モデルです。8億7000万個のパラメータを持つSTIVは、テキストからビデオへの変換(T2V)とテキストから画像への変換(TI2V)タスクを処理でき、Joint Image-Text Classifier Freely Guided(JIT-CFG)に基づいてビデオ生成品質を向上させます。STIVモデルはPixArt-Alphaアーキテクチャに基づいており、時空間アテンションメカニズム、Rotation-Position Encoding(RoPE)、およびストリームマッチングのトレーニング目標を統合することで、ビデオ生成の安定性と効率性を向上させています。STIVは、ビデオ予測、フレーム補間、長尺ビデオ生成など、さまざまな下流アプリケーションをサポートしています。

STIVの主な機能

  • テキストからビデオへの変換(T2V)およびテキストから画像への変換(TI2V)の生成STIVは、テキストプロンプトに基づいて、またはテキストと初期画像フレームを組み合わせることによって、ビデオコンテンツを生成できます。
  • マルチモーダル条件サポートこのモデルは、テキストと画像に基づいた条件付き動画生成をサポートしており、動画コンテンツと入力条件との一貫性を向上させます。
  • 動画予測このモデルは動画内の将来のフレームを予測するもので、自動運転や組み込みAIなどの分野に応用可能です。
  • フレーム補間指定されたフレーム間に中間フレームを生成することで、ビデオの滑らかさと連続性を向上させます。
  • マルチビュー生成単一の視点から動画に新たな視点をもたらし、動画の立体感とリアリティを高めます。
  • 長尺動画の生成キーフレーム予測とフレーム補間技術に基づいて、より長いビデオコンテンツを生成します。

STIVの技術原理

  • Diffusion Transformer(DiT)DiTアーキテクチャに基づいているため、時空間データを効率的に処理できる。
  • フレーム交換トレーニング中、ノイズのあるフレームはノイズのない画像条件付きフレームに置き換えられ、ビデオ生成の精度と一貫性が向上します。
  • 画像とテキストの統合分類器(JIT-CFG)テキストと画像の条件の重みを調整してビデオ生成プロセスを最適化する、分類器不要の誘導型手法。
  • 時空間的注意メカニズム分解に基づく時空間アテンションメカニズムにより、空間次元と時間次元の特徴が別々に処理され、モデルの効率と有効性が向上します。
  • 回転位置符号化(RoPE)RoPEは、モデルが相対的な時空間関係を処理する能力を向上させ、さまざまな解像度での生成タスクにより適したものにする。
  • ストリームマッチングのトレーニング目標従来の拡散損失を流量マッチング目標に置き換えることで、より優れた条件付き最適伝送戦略を実現し、生成品質を向上させる。

STIVのプロジェクト住所

STIVの応用シナリオ

  • エンターテインメントとソーシャルメディアユーザーは、ダンス、旅行、日常生活などの短い動画といった、パーソナライズされた動画コンテンツを作成し、TikTokやInstagramなどのソーシャルメディアプラットフォームで共有することができます。
  • 広告とマーケティング企業は、製品の特徴やサービスの利点に基づいた魅力的な動画コンテンツを迅速に作成することで、広告の魅力とコンバージョン率を向上させる、ダイナミックな広告動画を作成できます。
  • 教育と訓練教育機関は、実験や歴史的出来事のシミュレーションなど、教育用ビデオを作成し、学生により直感的でインタラクティブな学習体験を提供している。
  • ニュースとレポート報道機関はニュース記事を動画コンテンツに変換することで、ニュース記事の視覚的な表現を迅速に生成し、ニュース配信の効率化と視聴者の理解度向上を図ることができる。
  • 自動運転とシミュレーション自動運転技術企業は、自動運転システムの意思決定能力と反応能力をテストおよび訓練するために、さまざまな交通シナリオのビデオを作成している。