AB
AiBoss
project

Bernini - ByteDanceのオープンソース統合ビデオ生成・編集フレームワーク

BerniniはByteDanceが開発したオープンソースの統合ビデオ生成・編集フレームワークで、MLLMセマンティックプランニングとDiTビジュアルレンダリングの2段階分離アーキテクチャを採用しています。マルチモーダル大規模モデルが指示を理解し、セマンティックスケッチを計画する一方、拡散...

ベルニーニとは何ですか?

Berniniは、ByteDanceが開発したオープンソースの統合型動画生成・編集フレームワークです。MLLMセマンティックプランニングとDiTビジュアルレンダリングという2段階の分離型アーキテクチャを採用しています。大規模マルチモーダルモデルが指示を理解し、セマンティックスケッチを計画する一方、拡散トランスフォーマーが高品質な動画生成を実現します。このモデルは、テキスト/画像動画生成、環境/視点/アクション編集、マルチリファレンスガイダンス挿入などのタスクをサポートします。推論コードと重みは完全にオープンソースです。

ベルニーニの主な機能

  • テキスト/画像からビデオへの変換テキストプロンプトや参照画像から直接動画を生成する機能をサポートしており、単一画像、複数要素を組み合わせた画像、および複数角度からの参照画像に対応しています。
  • 動画編集環境編集、遠近法編集、フォーカス編集、および動作編集をサポートします。
  • 参考資料を用いた編集: 対象参照画像、素材参照画像、またはスタイル参照画像を使用して、指定されたオブジェクト、テクスチャ、またはスタイルをビデオに正確に統合します。
  • 画像/動画の埋め込み画面、看板、または画像のその他の領域をポスターやビデオで埋め尽くし、遠近感と時間の安定性を維持しながらカメラの動きに追従する。
  • 複数要素の組み合わせ複数の無関係な参照画像を組み合わせて単一のビデオキャラクターを作成したり、同じシーンのキーフレームに基づいて連続的なパンショットを生成したりできます。

ベルニーニの技術原理

  • 2段階分離アーキテクチャ第1段階では、マルチモーダル大規模言語モデル(MLLM)をセマンティックプランナーとして使用し、ViT埋め込み空間におけるターゲットセマンティック表現を予測します。テキスト指示、ソースビデオ、および参照資料を理解し、ターゲットコンテンツを計画する役割を担います。第2段階では、拡散トランスフォーマー(DiT)をレンダラーとして使用し、VAE潜在空間でストリームマッチングノイズ除去を実行し、セマンティックプランニングを高品質のビデオフレームに変換します。編集タスクでは、ソースビデオからのVAE特徴も注入され、編集されていない領域の詳細が保持されます。
  • Segment-Aware 3D RoPE(SA-3D RoPE)複数の参照画像、ソース動画、およびターゲット出力が連結されて単一のシーケンスになると、異なるセグメントのトークンが同じ時空間座標を共有する可能性があります。各視覚セグメントにセグメントインデックスを割り当て、それを回転位置エンコーディングに統合することで、モデルは元の時空間モデリング特性を維持しながら、異なるソースのトークンを区別することができます。
  • 思考連鎖推論と3段階トレーニングプランナーは潜在空間で思考連鎖推論を実行し、複雑な編集シナリオにおける意味的忠実度を高めます。トレーニングは、プランナーの事前トレーニング、レンダラーの事前トレーニング、およびプランナーとレンダラーの簡易的な共同トレーニングの3つの段階で構成され、事前トレーニングの利点を維持しつつ高い効率性を実現します。

ベルニーニの使い方

  • リポジトリのクローン作成GitHubからBerniniプロジェクトをローカルマシンにクローンしてください。
  • 依存関係をインストールしますrequirements.txtに記載されている依存パッケージをインストールするには、pipを実行してください。
  • モデルをダウンロードBernini-R-Diffusersの重量データはHuggingFaceからダウンロードできます。
  • 環境設定Python 3.11.2とCUDA 12.4以降を使用していることを確認してください。また、HopperアーキテクチャのGPUを推奨します。
  • 実行して生成するtorchrunを使用して、設定ファイルとテストケースを指定して、マルチGPU推論スクリプトを実行します。
  • 設定プロンプトの強化生成品質を向上させるために、OpenAI互換のAPIエンドポイントを設定してください。

ベルニーニの核となる利点

  • 生成する前に理解するMLLMは意味計画を担当し、DiTは視覚レンダリングを担当することで、従来のビデオモデルの「人間の言語を理解できない」という問題点を解決します。
  • 統一フレームワーク単一のアーキテクチャで、生成、編集、参照ガイダンスなどの複数のタスクをカバーできるため、モデルを切り替える必要がありません。
  • 複数の参照入力テキスト、画像、動画の同時入力に対応し、SA-3D RoPEによって時空間的な混同を回避します。
  • 詳細が保存されています編集時にソースビデオからVAEの特徴量を挿入することで、編集されていない領域の詳細を保持し、「1つ変更するとすべてが変わってしまう」という事態を回避できます。
  • 完全オープンソース推論コードと重みが公開されたことで、研究開発への障壁が低くなった。
  • 高い一般化能力訓練で明示的に扱われていない指示(因果推論や行動変更など)に対しても、依然として優れた性能を発揮する。

ベルニーニのプロジェクト住所

  • プロジェクト公式サイト:https://bernini-ai.github.io
  • GitHubリポジトリ:https://github.com/bytedance/Bernini
  • ハギングフェイスモデルライブラリ:https://huggingface.co/ByteDance/Bernini
  • arXiv技術論文:https://arxiv.org/pdf/2605.22344

ベルニーニの競合製品比較

比較対象寸法 Bernini Runway Gen-4
開発者 ByteDance(オープンソース) 滑走路(クローズドソース)
コアアーキテクチャ MLLM Planner + DiT Renderer 独自のビデオ生成モデル
タスク範囲 統合フレームワークを生成および編集する 生成+編集
制御可能な編集 強力(意味計画+複数の参照) 強い
参照図のサポート マルチエレメント/マルチアングル/マテリアル/スタイル サポート
オープンソースレベル 重み付け+オープンソースコード 非公開ソース
ハードウェア要件 推奨機種:H100/H800(8カードビデオ対応) クラウドAPI
動画編集 編集不可領域の詳細を保持する
視覚的な品質 素晴らしい(480p/16fps) 一流

ベルニーニの応用事例

  • 広告の創造性このモデルは、製品デモンストレーション動画を迅速に生成でき、製品画像の挿入やスタイルの調整にも対応しています。
  • Eコマースショーケース製品の多角度からの参照画像に基づいて、非常に一貫性の高い動的な表示ビデオを生成します。
  • 映画とテレビ番組のプレビューキーフレームを使用して連続ショットを生成し、仮想空間での探索やシーン構築を支援します。
  • 二次創造スタイル変換、天候変更、モーション編集に対応しており、ビデオ再制作のハードルを下げます。
  • バーチャルシューティングこれにより、ポスターや動画をスクリーンや看板に正確に挿入することが可能になり、仮想要素と現実要素のシームレスな融合を実現できます。