AB
AiBoss
project

Goku - 香港大学とByteDanceが共同で発表した最新のビデオ世代モデル

Gokuは、香港大学とByteDanceが共同開発した新しい動画生成モデルで、画像と動画の同時生成に特化して設計されています。高度な整流変換フレームワークに基づいており、テキストベースの動画、画像ベースの動画などをサポートしています。

悟空とは何ですか?

Gokuは、香港大学とByteDanceが共同で発表した新しい動画生成モデルで、画像と動画の同時生成に特化して設計されています。高度な整流フローTransformerフレームワークに基づいており、テキスト生成動画、画像生成動画、テキスト生成画像など、さまざまなモードをサポートしています。Gokuの主な利点は、高品質な動画生成機能と、広告動画制作コストの極めて低いコスト(従来の方法の100分の1)です。Gokuは、大規模で高品質なデータセットと効率的なトレーニング設備に基づいて構築されています。研究者らは、約3,600万本の動画と1億6,000万枚の画像を含むデータセットを構築し、マルチモーダル大規模言語モデルを使用して文脈に一貫性のあるフレームワークを生成しました。Gokuは、高度な並列戦略とフォールトトレラントメカニズムを利用して、トレーニングプロセスの効率性と安定性を確保しています。

Goku+は、広告動画制作に特化したGokuモデルをベースにした拡張版です。20秒以上の動画にも対応し、高品質な広告動画を高速で生成できます。安定した手の動きや豊かな表情・体の動きが特徴です。Goku+は、商品画像を魅力的な動画に変換し、仮想アバターが商品とインタラクトすることで広告効果を高めます。ECサイト、ブランドプロモーション、ショート動画広告、商品デモンストレーションなど、様々なシーンに適しており、広告制作コストを大幅に削減し、クリエイティブ効率を向上させます。

悟空の主な機能

  • テキストから画像へ:テキスト記述に基づいて高品質な画像を生成でき、詳細に富み、テキスト記述と非常に整合性の高い画像を作成することができる。
  • テキストからビデオへテキストによる説明に基づいて、滑らかな動きと高品質な映像を特徴とする、一貫性のある動画を生成します。
  • 画像から動画へ画像を基に動画を生成し、画像の視覚的なスタイルと意味的な一貫性を維持します。静止画像から動的な動画を生成することも可能で、アニメーションや動画コンテンツ制作に適しています。
  • 広告動画生成(悟空+)人と製品の自然なインタラクションをサポートする高品質な広告動画を制作します。手の動きが安定し、表情豊かな動画を制作することで、広告動画制作コストを100分の1に削減できます。
  • 仮想デジタルヒューマンビデオ生成この技術は、高いリアリティと自然な動きを備えた仮想デジタル人間の動画を生成し、バーチャルアンカーやバーチャルカスタマーサービスといったシナリオに適しています。
  • マルチモーダル生成Gokuは、画像、動画、テキストの同時生成を含む、マルチモーダル生成タスクをサポートします。潜在空間を共有し、完全なアテンションメカニズムを採用することで、Gokuは画像や動画における複雑な時空間的依存関係をシームレスに処理できます。

悟空の技術原理

  • 画像・動画結合VAEGokuは、3D統合型画像・動画変分オートエンコーダー(VAE)を用いて、画像と動画の入力を共有潜在空間に圧縮します。これにより、モデルは画像や動画を含む複数のメディア形式を処理し、それらを統一されたフレームワーク内で表現することが可能になります。
  • トランスフォーマーアーキテクチャGokuモデルファミリーには、2Bおよび8Bパラメータを持つTransformerアーキテクチャが含まれています。このアーキテクチャは、完全なアテンションメカニズムに基づいており、画像や動画における複雑な時空間的依存関係を効果的に処理し、高品質で一貫性のある出力を実現します。
  • 修正された流量式Gokuは、Rectified Flow(RF)アルゴリズムに基づいて、線形補間を用いて事前分布と目標データ分布の間で学習を行います。従来の拡散モデルと比較して、収束速度が速く、理論的特性も優れています。
  • 多段階トレーニング戦略Gokuは、画像とテキストの意味的整合性事前学習、画像と動画の同時学習、および異なるモダリティに対する微調整を含む、多段階の学習戦略を採用しています。これにより、モデルの生成能力が段階的に向上し、大規模データセットでの効率的な学習が保証されます。
  • 大規模で高品質なデータセット研究者らは、約3600万本の動画と1億6000万枚の画像からなる大規模なデータセットを構築し、データ品質を向上させるために様々なデータフィルタリングおよびデータ拡張技術を用いた。このデータセットは、モデル学習のための豊富な素材を提供する。
  • 高効率なトレーニングインフラ悟空のトレーニングインフラには、並列戦略、きめ細かな起動チェックポイント、耐障害性メカニズム、そしてバイトチェックポイント技術が組み込まれています。これらにより、トレーニングの効率と安定性が大幅に向上しています。

悟空のプロジェクトアドレス

悟空の応用事例

  • 広告ビデオ制作Goku+は、テキスト説明に基づいて高品質な広告動画を生成できます。テキストから直接動画を生成する機能、商品画像からインタラクティブ動画を生成する機能、商品デモ動画を生成する機能などをサポートしています。
  • 仮想デジタルヒューマンビデオ生成Goku+は、テキストをシュールな人間動画に変換することができ、安定した手のジェスチャーと非常に表情豊かな顔や体の動きを備えた20秒以上の動画を生成します。
  • コンテンツ作成Gokuは、アニメーション、自然の風景、動物の行動など、さまざまなシーンをフィーチャーした動画を生成できます。例えば、スタイリッシュな女性が東京の街を散策する動画や、巨大なマンモスが雪の上を歩くシーンなどを生成できます。これにより、アーティストは豊富なインスピレーションと創作素材を得ることができます。
  • 教育と訓練Gokuは、教育ビデオやトレーニングコースの作成に利用でき、鮮やかなビデオコンテンツを生成することで、教育やトレーニングの効果と参加度を高めることができます。
  • エンターテインメント業界映画、テレビ、アニメーションなどのエンターテインメント業界において、Gokuはコンテンツ制作や特殊効果生成に活用できます。高品質なビデオコンテンツを生成できるため、クリエイターにさらなる可能性を提供します。