project
自己強制型 - Adobeがテキサス大学と共同で開発した動画生成モデル。
Self Forcingは、Adobe Researchとテキサス大学オースティン校が共同開発した、斬新な自己回帰型動画生成アルゴリズムです。従来の生成モデルにおけるトレーニング時とテスト時の露出バイアス問題を解決します。トレーニングを通じて…
自己強制とは何ですか?
Adobe Researchとテキサス大学オースティン校が共同開発した、新しい自己回帰型ビデオ生成アルゴリズム「Self Forcing」は、従来の生成モデルにおけるトレーニング時とテスト時の露出バイアス問題を解決します。トレーニング中に自己生成プロセスをシミュレートすることで、実際のフレームに依存するのではなく、以前に生成されたフレームに基づいて後続のフレームを生成するため、トレーニング分布とテスト分布のギャップを埋めることができます。Self Forcingは、ローリングキーバリューキャッシュメカニズムを導入し、理論上無制限のビデオ生成をサポートするとともに、単一のH100 GPUで1秒未満のレイテンシで17 FPSのリアルタイム生成機能を実現します。この画期的な技術は、ライブストリーミング、ゲーム、仮想背景やエフェクトのリアルタイム生成といったリアルタイムインタラクティブアプリケーションに新たな可能性を切り開きます。Self Forcingの効率性と低レイテンシは、将来のマルチモーダルコンテンツ制作にとって重要なツールとなるでしょう。
自己強制の主な機能
- 高効率リアルタイムビデオ生成セルフフォーシング機能により、単一のGPU上で効率的なリアルタイムビデオ生成が可能になり、1秒未満の遅延で17FPSのフレームレートを実現します。
- 無制限の長尺動画生成Self Forcingは、ローリングキーバリューキャッシュ機構により、理論上無制限の動画生成をサポートします。動画コンテンツは長さ制限による中断なく連続的に生成できるため、動的な動画制作を強力に支援します。
- トレーニングとテストのギャップを埋める自己強制法は、トレーニング段階で自己生成プロセスをシミュレートし、実際のフレームに依存するのではなく、生成されたフレームに基づいて後続のフレームを生成します。これにより、自己回帰生成における露出バイアス問題を効果的に解決し、トレーニング段階とテスト段階間の分布の差異を解消し、生成されるビデオの品質と安定性を向上させます。
- 資源需要が低いセルフフォーシングはコンピューティングリソースの使用を最適化し、単一のRTX 4090グラフィックカードでストリーミングビデオ生成を可能にすることで、ハードウェアリソースへの依存度を低減し、一般的なデバイスへの導入と使用を容易にします。
- マルチモーダルコンテンツの作成をサポートするSelf Forcingの効率性とリアルタイム機能により、ゲームストリーミング中にリアルタイムで背景やエフェクトを生成したり、仮想現実体験で視覚コンテンツを動的に生成したりするなど、マルチモーダルなコンテンツ制作をサポートし、クリエイターにより幅広い用途を提供します。
自己強制の技術原理
-
自己回帰展開と全体的な損失監視自己強制法は、学習フェーズにおける推論時に自己回帰生成プロセスをシミュレートします。つまり、各フレームは実際のフレームではなく、モデルによって以前に生成されたフレームに基づいて生成されます。フレームごとの評価だけでなく、ビデオレベルの全体的な分布マッチング損失関数を通して、生成されたシーケンス全体を監視します。モデルは自身の予測誤差から直接学習できるため、露出バイアスを効果的に軽減できます。
-
ローリングキーバリューキャッシュメカニズム長時間の動画生成をサポートするため、Self Forcingはローリングキーバリュー(KV)キャッシュ機構を導入しています。この機構は、最新のフレームのKV埋め込みを格納する固定サイズのバッファを維持します。新しいフレームが生成されると、バッファから最も古いエントリが削除され、新しい埋め込みが追加されます。
-
少数ステップ拡散モデルと勾配カットオフ戦略学習効率を向上させるため、Self Forcingは、確率的勾配切り捨て戦略と組み合わせた少数ステップ拡散モデルを採用しています。具体的には、学習中にモデルはノイズ除去ステップ数をランダムに選択し、最後のノイズ除去ステップでのみ逆伝播を実行します。
-
動的条件生成メカニズム各フレームを生成する際、Self Forcingは、過去のタイムステップで生成されたクリアなフレームと、現在のタイムステップで生成されたノイズの多いフレームという2種類の条件付き入力を動的に組み合わせます。生成は反復的なノイズ除去によって完了し、生成プロセスの一貫性と自然さを保証します。
自己強制プロジェクトのアドレス
- プロジェクト公式サイト:https://self-forcing.github.io/
- GitHubリポジトリ:https://github.com/guandeh17/Self-Forcing
- arXiv技術論文:https://arxiv.org/pdf/2506.08009
自己強制の応用シナリオ
- ライブストリーミングとリアルタイムビデオストリーミングセルフフォーシング機能により、単一GPUで1秒未満の低遅延で17FPSのリアルタイムビデオ生成が可能になります。ライブ配信中に仮想背景、エフェクト、動的なシーンをリアルタイムで生成するなど、ライブストリーミングのシナリオに最適で、視聴者に全く新しい視覚体験を提供します。
- ゲーム開発ゲーム開発において、セルフフォーシングはゲームシーンやエフェクトをリアルタイムで生成できるため、大量のビデオ素材を事前に制作する必要がなくなります。プレイヤーのアクションに基づいて動的な環境変化やエフェクトをリアルタイムで生成することで、ゲームの没入感とインタラクティブ性を向上させます。
- 仮想現実と拡張現実Self Forcingの低遅延かつ高効率な生成機能により、仮想現実(VR)および拡張現実(AR)アプリケーション向けのリアルタイムなビジュアルコンテンツを実現します。これにより、VR体験におけるリアルな仮想シーンのリアルタイム生成や、ARアプリケーションにおける仮想要素のリアルタイムオーバーレイが可能になります。
- コンテンツ制作と動画編集Self Forcingは、クリエイターが高品質な動画コンテンツを迅速に作成するのに役立つ、短い動画作成ツールとして使用できます。
- 世界規模のシミュレーションとトレーニング自己強制機能は、軍事訓練、都市計画、環境シミュレーションなどにおいて、現実的な自然環境や都市景観を生成するといった、世界シミュレーションや訓練シナリオに利用できます。