AB
AiBoss
project

OmniShow - ByteDanceが香港中文大学や香港大学などのオープンソース機関と共同で開発した動画生成モデル。

OmniShowは、ByteDanceが香港中文大学、モナシュ大学、香港大学と共同でオープンソース化した、マルチモーダルな人間と物体のインタラクション動画生成モデルです。RAP2V(参照画像+音声+姿勢)をサポートする初のエンドツーエンドフレームワークとして、このモデルはテキストを均一に処理します。

OmniShowとは何ですか?

OmniShowは、ByteDanceが香港中文大学、モナシュ大学、香港大学と共同でオープンソース化した、マルチモーダルな人間と物体のインタラクション動画生成モデルです。RAP2V(参照画像+音声+姿勢)をサポートする初のエンドツーエンドフレームワークとして、テキスト、画像、音声、姿勢の4種類の入力を統一的に処理します。123億個のパラメータを持つ単一のモデルで、10秒間の高品質動画を生成できます。このモデルは、ゲート付きローカルコンテキストアテンションなどの技術を用いて、音声と映像の正確な同期を実現し、HOIVG-Benchベンチマークで複数の最先端(SOTA)結果を達成しています。

OmniShowの主な機能

  • 完全モーダル条件付き入力OmniShowは、RAP2V(参照画像+音声+ポーズ・トゥ・ビデオ)を完全にサポートする初のエンドツーエンドフレームワークとして、参照画像、音声、ジェスチャー信号、テキスト説明という4つのモーダル入力を同時に受け取ることができ、人間と物体がインタラクティブに相互作用するビデオを包括的に制御できます。
  • 複数のタスクの統一生成このモデルは、参照グラフベースのビデオ生成(R2V)、音声駆動型デジタルヒューマンビデオ(RA2V)、ポーズ駆動型アニメーション(RP2V)、およびフルモーダル精密制御(RAP2V)など、さまざまな入力条件を柔軟に組み合わせることで、単一のアーキテクチャ内で多様なビデオ生成タスクを完了できます。
  • 高品質な長尺動画合成OmniShowは、最大10秒間の連続動画の生成をネイティブでサポートしており、口の動き、表情、体の動きを音声と正確に同期させながら、キャラクターの外見の一貫性を維持することで、業界最高水準の映像品質を実現します。
  • オブジェクトの置き換えとビデオモンタージュユーザーは、キャラクターの動きやポーズを維持したまま動画内のオブジェクトを置き換えたり、異なるソースからポーズ、オブジェクト、キャラクターの参照情報を再構築したりすることができ、柔軟なクリエイティブな動画編集と合成が可能になります。

OmniShowの技術原理

  • 統一チャネル条件注入参照画像と姿勢信号をチャネル次元に沿って結合することにより、マルチモーダル条件が効率的に事前学習済みのビデオ生成モデルに注入され、従来の変調方法による基本モデルの事前学習の事前情報の破壊を回避し、人体と物体の外観およびモーション制御を導入しながら、元の生成品質が維持されることが保証されます。
  • ゲート付きローカルコンテキストアテンションこの設計では、マスクド・アテンションと学習可能なゲーティングベクトルを組み合わせることで、音声特徴と顔や体の局所領域との相関関係にモデルが動的に焦点を当てることを可能にします。これにより、唇の動き、表情、体の動きと音声信号との間の正確な時間同期が実現し、マルチモーダル融合における特徴の競合問題を解決します。
  • 分離型合同訓練戦略R2VおよびA2Vタスクにおける異種データと不均衡データの課題に対処するため、各モダリティの独立したマッピング関係を学習する専用サブモデルをトレーニングし、重み補間によってそれらを融合し、結合データで微調整します。これにより、異種データセットを効果的に統合し、全モダリティ入力下での生成の一貫性を向上させます。

OmniShowの使い方

  • オープンソースコードを入手する公式ソースからコードリポジトリをローカルマシンにクローンし、READMEに従って依存関係を含むランタイム環境を設定してください。
  • マルチモーダル入力の準備生成されたタスクの要件に基づいて、参照画像(人物や物体の外観)、運転用音声、ポーズシーケンスファイル、およびテキストによる説明を整理します。
  • ビデオ生成を実行するモデルAPIを呼び出すか、推論スクリプトを実行し、複数のモーダル条件を組み合わせて入力し、最大10秒の高品質な人間と物体のインタラクション動画を生成して出力を保存します。

OmniShowの重要な情報と使用要件

  • プロジェクトの位置付けOmniShowは、ByteDance、香港中文大学、モナシュ大学、香港大学が共同でオープンソース化した、業界標準のマルチモーダルな人間と物体のインタラクション動画生成モデルです。複雑な人間と物体のインタラクションシナリオ向けに特化して設計されています。
  • 技術規模このモデルは123億個のパラメータを持つアーキテクチャを採用しており、これは類似モデル(HuMo-17BやPhantom-14Bなど)の中で最もパラメータ効率の良いソリューションであり、高いパフォーマンスを維持しながら計算リソースの要件を大幅に削減します。
  • 中核となる能力RAP2V(Reference+Audio+Pose-to-Video)を完全にサポートする初のエンドツーエンド統合フレームワークとして、参照画像、音声信号、ポーズシーケンス、テキスト記述という4つのモーダル入力を同時に受け取り、共同推論を行うことができます。
  • 質の高いものを生み出すネイティブで最大10秒間の連続動画生成をサポートし、ゲート付きローカルコンテキストアテンション技術により、唇の動き、表情、体の動き、音声の正確な同期を実現し、業界レベルの視覚的標準を達成しています。
  • パフォーマンス独自に開発したHOIVG-Benchベンチマークテストにおいて、OmniShowはR2V、RA2V、RP2V、RAP2Vの4つのタスクすべてで最先端(SOTA)のパフォーマンスを達成し、フルモーダル入力をサポートする唯一の主要ソリューションとなりました。

OmniShowの主な利点

  • フルモーダル統合アーキテクチャOmniShowは、RAP2V(参照画像+音声+姿勢→動画)を完全にサポートする業界初のエンドツーエンドフレームワークとして、テキスト、画像、音声、姿勢という4つの条件をネイティブに統合処理し、複数の専用モデルを組み合わせる必要なく、複雑なマルチモーダル入力の組み合わせを処理できます。
  • 極めて高いパラメータ効率12.3Bパラメータは、HOIVG-Benchベンチマークにおいて複数の最先端(SOTA)結果を達成し、HuMo-17B(17B)やPhantom-14B(14B)などのより大きなパラメータモデルを大幅に上回る性能を発揮しながら、業界最高水準の生成品質を維持し、推論コストを大幅に削減します。
  • マルチタスク対応の単一モデル柔軟な入力組み合わせ戦略により、OmniShowの単一モデルで、R2V(参照グラフ生成)、RA2V(音声駆動型デジタルヒューマン)、RP2V(ポーズ駆動型アニメーション)、および完全なRAP2V(完全なモーダル制御)の4種類のタスクを、異なるシナリオに合わせてモデルを切り替えることなく処理できます。
  • 正確な音声と映像の同期革新的なゲート付きローカルコンテキストアテンションメカニズムを採用することで、学習可能なゲート付きベクトルとマスク付きアテンションを通じて、唇の動き、顔の表情、体の動き、音声信号間の高度な同期を実現し、Sync-Cメトリックで8.612という最高レベルに達しています。
  • 長尺動画のネイティブ生成スライディングウィンドウに依存する外挿法とは異なり、OmniShowは一度に最大10秒間の連続ビデオを生成することをネイティブにサポートしており、キャラクターの外観、オブジェクトのスタイル、および時間的な一貫性を維持する上で大きな利点を提供します。

OmniShowプロジェクトの住所

  • プロジェクト公式サイト:https://correr-zhou.github.io/OmniShow/
  • GitHubリポジトリ:https://github.com/Correr-Zhou/OmniShow

OmniShow製品と類似競合製品との比較

比較対象寸法 OmniShow HuMo-17B Phantom-14B
パラメータサイズ 12.3B(最軽量) 17B(+38%) 14B(+14%)
サポートタスク R2V / RA2V / RP2V / RAP2V(フルモード) R2V / RA2V(姿勢制御なし) R2Vのみ(音声・ポーズなし)
建築的特徴 エンドツーエンドの統合フレームワーク、単一モデル、複数のタスク 人間と物体の相互作用に特化したモデルを構築するには、他のツールを使用する必要がある。 基本参照グラフ生成モデル
R2V品質(NexusScore) 0.389(SOTA) 0.346(11%減) 0.366(6%減)
RA2V同期(Sync-C) 8.612(SOTA) 8.028(7%減) サポートされていません
RP2V精度(PCK) 0.460(SOTA) サポートされていません サポートされていません
動画の長さ ネイティブ10秒 通常5~8秒 通常5秒
アプリケーションシナリオ デジタルヒューマン、アニメーション、オブジェクト置換、モンタージュなど、すべてを網羅しています。 人間と物体の相互作用が限定的 静的な外観の移行

OmniShowの応用事例

  • Eコマース商品の表示参照画像置換機能により、モデルの動きやポーズを維持したまま、衣服、アクセサリー、商品などを迅速に置き換えることができ、効率的な製品ビデオプレゼンテーションが可能になります。
  • デジタルヒューマン短編ビデオ制作RA2V(参照画像+音声)機能に基づき、人物の写真と音声を入力することで、口パクで話したり歌ったりする動画を生成できます。これは、バーチャルアンカーやソーシャルメディアコンテンツの作成に適しています。
  • クリエイティブなビデオマッシュアップマルチモーダルな再構成機能を活用することで、さまざまなソースからポーズ、オブジェクト、人物の参照情報を抽出し、創造的な合成を行うことで、動画全体にわたるパーソナライズされたコンテンツ編集や二次制作を可能にします。
  • インタラクティブなエンターテイメントとゲーム: ポーズ駆動型バリアント(RP2V)機能を活用することで、ユーザーの動きをキャプチャしたデータがリアルタイムでゲームキャラクターや仮想アバターのアニメーションに変換され、全身の姿勢制御によるリアルタイムのインタラクティブな体験をサポートします。
  • 広告およびマーケティングコンテンツの作成フルモーダル入力(RAP2V)と組み合わせることで、ブランドアンバサダーの容姿、音声、身体の動きを正確に制御し、統一されたスタイルのプロモーションビデオ素材を一括生成します。