AB
AiBoss
project

ContentV - ByteDanceのオープンソースのテキストベース動画モデルフレームワーク

ContentVは、ByteDanceが開発した、80億個のパラメータを持つオープンソースの画像ベース動画モデルフレームワークです。Stable Diffusion 3.5 Largeの2D-VAEを3D-VAEに置き換え、3D位置エンコーディングを導入することで、画像モデルが動画生成機能を迅速に獲得できるようにしています。

ContentVとは何ですか?

ContentVは、ByteDanceが開発したオープンソースの80億パラメータのテキストベース動画モデルフレームワークです。Stable Diffusion 3.5 Largeの2D-VAEを3D-VAEに置き換え、3D位置エンコーディングを導入することで、画像モデルが動画生成機能を迅速に獲得できるようにしています。トレーニングは多段階戦略を採用しており、まず動画データを使用して時間表現を確立し、次に画像と動画の共同トレーニングを実行します。動画は、期間と幅/高さに基づいてビンに分割され、動的なバッチサイズメカニズムを使用してメモリが最適化されます。プログレッシブトレーニングでは、まず期間を増やし、次に解像度を上げ、フローマッチングアルゴリズムによって効率が向上します。強化学習には、コスト効率の高いフレームワークが使用され、追加の手動アノテーションが不要になります。教師ありファインチューニングと人間のフィードバックに基づく強化学習により、生成される動画の品質が向上します。64GBのNPUを使用して分散トレーニングフレームワークが構築され、480P、24FPS、5秒の動画の効率的なトレーニングを実現しています。 VBenchにおいて、ContentVは長尺動画で総合スコア85.14を達成し、Wan2.1-14Bに次ぐ2位となった。また、その人間による好みの評価は、複数の側面においてCogVideoXやHunyuan Videoを上回った。

ContentVの主な機能

  • テキストからビデオへの変換ユーザーがテキストによる説明を入力すると、ContentVはそのテキストコンテンツに基づいて様々な種類の動画を生成できます。
  • カスタムビデオパラメータユーザーは、動画の解像度、再生時間、フレームレートなどのパラメータを指定することで、特定のニーズに合った動画を生成できます。例えば、高解像度の1080p動画を生成したり、ソーシャルメディアに適した15秒の短い動画を作成したりできます。
  • スタイル転送ContentVは、生成された動画に特定のスタイルを適用する機能をサポートしています。例えば、油絵風、アニメ風、レトロ風などのスタイルを動画コンテンツに適用することで、生成された動画に独自の芸術的な効果を与えることができます。
  • スタイルの融合ユーザーは複数のスタイルを組み合わせることで、独自の視覚効果を生み出すことができます。例えば、SFとサイバーパンクのスタイルを組み合わせることで、未来的なビデオコンテンツを作成できます。
  • 動画の続きユーザーは入力として動画を提供することができ、ContentVは入力された動画の内容とスタイルに基づいて動画のストーリーを継続し、動画コンテンツを拡張することができます。
  • 動画編集ユーザーは、生成された動画を、シーンやキャラクターの行動を変更するなどして修正し、さまざまな創作ニーズに対応できます。
  • 動画のテキスト説明ContentVは生成された動画にテキストによる説明を提供することができ、ユーザーが動画コンテンツをよりよく理解するのに役立ち、動画とテキスト間の双方向のやり取りを可能にします。

ContentVの技術原則

  • ミニマリスト建築ContentVはミニマルなアーキテクチャを採用し、事前学習済みの画像生成モデルを動画生成に最大限活用しています。その核となる変更点は、Stable Diffusion 3.5 Large(SD3.5L)の2D-VAEを3D-VAEに置き換え、3D位置エンコーディングを導入したことです。
  • フローマッチングContentVはフローマッチングアルゴリズムを用いて学習され、連続時間における直接的な確率経路を通して効率的なサンプリングを実現します。このモデルは、ノイズの多いサンプルをデータサンプルに変換する際の速度を予測するように学習され、予測された速度と実際の速度との間の平均二乗誤差を最小化することでモデルパラメータが最適化されます。
  • 段階的なトレーニングContentVは、低解像度で短時間の動画から始め、徐々に時間と解像度を上げていくという段階的な学習戦略を採用しています。これにより、モデルは時間的なダイナミクスと空間的な詳細をより効果的に学習できます。
  • 多段階トレーニングトレーニングプロセスは、事前トレーニング、教師ありファインチューニング(SFT)、および人間からのフィードバックによる強化学習(RLHF)を含む複数の段階に分かれています。事前トレーニング段階では、大規模なデータを使用して基本的な画像および動画生成機能を学習します。SFT段階では、高品質のデータサブセットを使用して、モデルが指示に従う能力を向上させます。RLHF段階では、人間からのフィードバックを通じて生成品質をさらに最適化します。
  • 人間からのフィードバックによる強化学習ContentVは、コスト効率の高い強化学習と人間からのフィードバックを組み合わせたフレームワークを採用することで、追加の人間によるアノテーションを必要とせずに生成品質を向上させます。報酬モデルのスコアを最大化するようにモデルを最適化し、それを正則化し、参照モデルのKLダイバージェンスを調整することで、人間の期待により合致する動画を生成します。
  • 高効率分散トレーニングContentVは、64GBのNPUを活用して分散型トレーニングフレームワークを構築しています。特徴抽出とモデルトレーニングを分離し、非同期データパイプラインと3D並列処理戦略を統合することで、480P解像度、24FPS、5秒の動画において効率的なトレーニングを実現しています。

ContentVのプロジェクトアドレス

ContentVの応用シナリオ

  • 動画コンテンツ制作教師は、簡単なテキスト説明を入力するだけで、授業内容に関連したアニメーションや実写動画を作成でき、それによって授業の楽しさとインタラクティブ性を高めることができる。
  • ゲーム開発ゲーム開発において、ContentVはゲーム内のアニメーションクリップやカットシーンを生成することができ、開発者がリッチなゲームコンテンツを迅速に作成するのに役立ちます。
  • 仮想現実(VR)と拡張現実(AR)ContentVは、VRやARアプリケーションで使用できる動画を生成し、ユーザーに没入感のある体験を提供します。
  • 特殊効果制作映画やテレビ制作において、ContentVはSFシーンやファンタジー要素といった複雑な特殊効果シーンを生成することができ、特殊効果チームが創造的なアイデアを迅速に実現するのに役立ちます。