project
StreamingT2V - PicsArtのモデルで、最大2分間の動画を生成できます。
StreamingT2Vは、PicsArt AI研究チームが開発したテキストから動画を生成するモデルです。既存のモデルは、1秒あたり16フレームまたは24フレームの高品質な短い動画しか生成できず、より長い動画を生成する際に画質の問題が発生するなど、既存のモデルの限界を克服することを目的としています。
StreamingT2Vとは何ですか?
PicsArt AI研究チームが開発したStreamingT2Vは、テキストから動画を生成するモデルです。既存のモデルは、16フレームまたは24フレームの高品質なショートビデオしか生成できず、より長いビデオを生成する際に、画質の低下、シーン遷移の不整合、ビデオの遅延といった問題に直面していました。StreamingT2Vは、条件付きアテンションモジュール(CAM)、外観保存モジュール(APM)、および確率的混合法を導入することで、最大1200フレーム、長さ2分のロングビデオをスムーズに生成し、時間的な一貫性とテキスト記述との密接な一致を確保します。この手法は、ビデオ品質を向上させるだけでなく、ビデオコンテンツを豊かに強化し、ロングビデオ生成の分野における大きな進歩となります。
StreamingT2Vの公式ウェブサイトのエントリー
- 公式プロジェクトホームページ:https://streamingt2v.github.io/
- GitHubリポジトリ:https://github.com/Picsart-AI-Research/StreamingT2V(モデルとソースコードは公開待ちです)
- arXivの研究論文:https://arxiv.org/abs/2403.14773
StreamingT2Vの機能
- 長尺動画の生成StreamingT2Vは、テキストによる説明に基づいて長尺動画(80、240、600、1200フレーム以上)を生成することができ、従来のモデルで生成される短い動画の長さをはるかに超えています。
- 時間的コヒーレンス生成されたビデオフレームは、滑らかな遷移と一貫性を備えており、長尺ビデオを生成する際によく見られる、唐突な切り替えや不連続性を回避しています。
- 高品質の画像フレームこのモデルはフレームレベルの画質を優先し、長時間の動画でも各フレームが鮮明で詳細な状態を保つようにします。
- テキストの配置StreamingT2Vは、入力されたテキストプロンプトに密接に対応したビデオを生成し、ビデオコンテンツがユーザーのテキスト指示と一致することを保証します。
- 動画の画質向上StreamingT2Vは、ランダム混合方式を用いることで、ブロック間の不整合を生じさせることなく生成される動画の品質を向上させ、それによって動画の解像度と視覚効果を改善することができます。
StreamingT2Vワークフロー
StreamingT2Vのワークフローは、主に以下の段階に分けられます。
- 初期化段階:
- この段階では、まず事前学習済みのテキストからビデオへの変換モデル(Modelscopeなど)を使用して、最初のビデオチャンク(通常は16フレームの短いビデオシーケンス)を合成します。
- ストリーミングT2Vステージ:
- 次に、モデルは自己回帰的な長尺動画生成プロセスに入ります。この段階では、StreamingT2Vは条件付き注意モジュール(CAM)と外観保存モジュール(APM)を使用して、長尺動画の次のフレームを生成します。
- CAMは短期記憶を利用し、注意機構を通して前のビデオブロックの特徴に焦点を当てることで、ブロック間のスムーズな遷移を実現します。
- APMは長期記憶を利用して、初期のビデオチャンクから重要な視覚的特徴を抽出し、ビデオ生成プロセス全体を通してシーンとオブジェクトの一貫性を確保します。
- ストリーミング改善段階:
- 十分な長さの動画(例えば、80、240、600、1200フレーム以上)が生成された後、モデルは改良段階に入ります。
- この段階では、生成されたビデオは、自己回帰を通じて高解像度のテキスト・トゥ・ビデオモデル(例:MS-Vid2Vid-XL)を使用して拡張されます。
- ランダム混合方式を用いることで、24個の連続するビデオブロックの画質を向上させつつ、ブロック間のスムーズな遷移を維持し、ビデオ全体の品質と解像度を向上させる。