project
Loong - 香港大学とByteDanceが共同で立ち上げた長尺動画生成モデル
Loongは、香港大学とByteDanceが共同開発した、斬新な長尺動画生成モデルです。一貫した外観、豊かなダイナミクス、自然なシーン遷移を備えた1分間の動画を生成できます。このモデルは、自己回帰型大規模言語モデル(LLM)に基づいています。
Loongとは何ですか?
香港大学とByteDanceが共同開発した新しい長尺動画生成モデル「Loong」は、一貫した外観、豊かなダイナミクス、自然なシーン遷移を備えた1分間の動画を生成できます。自己回帰型大規模言語モデル(LLM)をベースとしたこのモデルは、テキスト情報と動画情報を統合して統一されたシーケンスを作成します。段階的な短尺から長尺へのトレーニング方式と損失重み付け戦略を用いることで、長尺動画のトレーニングにおける課題を克服しています。Loongの設計により、トレーニング中にテキストプロンプトから動画を生成することを学習し、トレーニング長を超える動画の生成にも対応できます。Loongの研究では、推論中のエラー蓄積を軽減するために、動画タグの再エンコードやサンプリング戦略などの推論戦略が組み込まれています。
Loongの主な機能
- 長尺動画の生成1分以上の動画コンテンツを作成してください。
- テキストからビデオへの変換指定されたテキストプロンプトに合致するビデオコンテンツを生成します。
- 内容の一貫性生成される動画の外観、動的な変化、シーンの遷移において、高い一貫性を確保する。
- ダイナミックな豊かさ動画内の複雑な動態や動きの変化を捉え、表現する。
- 自然な風景の変化映像内の異なるシーン間のスムーズな遷移を実現し、視覚的な連続性を維持する。
Loongの技術原理
- 統一シーケンスモデリング: Loongはテキストとビデオのタグを統一されたシーケンスとしてモデル化し、自己回帰型大規模言語モデル(LLM)がテキストの手がかりに基づいてビデオタグを予測することを可能にする。
- 段階的に短期から長期へと移行するトレーニング: 段階的な学習戦略を用いて学習用動画の長さを徐々に長くすることで、モデルはより複雑で一貫性のある動画コンテンツを学習し、生成することができる。
- 損失の重み付け調整: 長時間の動画学習における損失の不均衡問題に対処するため、初期フレームの損失に重み付けを行い、モデルの初期フレームの学習を強化する。
- 動画タグの再エンコード: 動画推論の過程では、予測された動画タグはピクセル空間の動画フレームにデコードされ、その後、動画コンテンツの一貫性と整合性を維持するために再エンコードされます。
- サンプリング戦略:トップkサンプリング戦略に基づき、最も可能性の高いラベルから選択を行うことで、潜在的なエラーが後続のラベル生成に与える影響を軽減し、エラーの蓄積という問題を緩和します。
Loongのプロジェクトアドレス
- プロジェクト公式サイト:epiphqny.github.io/Loong-video
- arXiv技術論文:https://arxiv.org/pdf/2410.02757v1
Loongのアプリケーションシナリオ
- エンターテインメントとソーシャルメディアユーザーは、ミュージックビデオ、旅行記、楽しいストーリーなど、パーソナライズされた長尺動画コンテンツを作成し、ソーシャルメディアプラットフォームで共有できます。
- 映画およびビデオ制作映画の予告編、特殊効果制作、長編動画コンテンツなどの初期の制作段階において、Loongは監督やプロデューサーがさまざまなストーリー展開や視覚効果を検討するのに役立つ動画スケッチを迅速に生成します。
- 広告とマーケティング企業は、魅力的な広告動画を作成することで、自社の商品やサービスをより鮮やかに紹介し、広告の魅力と記憶に残る度合いを高めることができる。
- 教育と訓練教育分野において、Lは歴史再現や科学実験シミュレーションといった教育コンテンツを制作し、より直感的でインタラクティブな学習体験を提供している。
- ニュースとレポート報道機関はニュース記事の要約動画を迅速に作成できるため、報道の効率性と魅力を向上させることができる。