project
OmniWeaving - テンセント渾源と浙江大学などが共同開発した動画生成フレームワーク。
OmniWeavingは、浙江大学、テンセント渾源、南洋理工大学が共同開発した統合ビデオ生成フレームワークです。このフレームワークは、従来のオープンソースモデルの単一タスクの制約を打破し、マルチモーダルデータの自由な組み合わせと高度な推論生成を可能にし、インターリーブされた...
オムニウィービングとは何ですか?
OmniWeavingは、浙江大学、テンセント渾源、南洋理工大学が共同開発した統合型ビデオ生成フレームワークです。従来のオープンソースモデルの単一タスクの制約を打破し、マルチモーダルデータの自由な組み合わせと高度な推論生成を可能にします。インターレースされたテキストと画像ビデオシーケンスを結合して一貫性のあるコンテンツを生成し、「インテリジェントディレクター」のように複雑な意図を積極的に推論します。このフレームワークは、MLLM意味理解、MMDit生成、VAEエンコーディングの3つのコンポーネントからなるアーキテクチャを採用しており、IntelligentVBench評価ベンチマークが付属しています。オープンソース統合型モデルで最先端の性能を実現し、オープンソースと商用ビデオ生成のギャップを埋める強力なオープンソースリファレンスを提供します。
OmniWeavingの主な機能
- 統合型マルチモーダル発電単一のフレームワーク内でテキスト、複数の画像、ビデオ入力をシームレスに統合し、インターリーブおよび自由な組み合わせをサポートし、多様なビデオ生成タスクを可能にし、従来の単一タスクモデルの断片的な制約を解消します。
- タイミングバインディング生成これは、異なるモダリティのコンテンツを時間的に整合させ、結合することで、モダリティ間で一貫性のある動的なビデオを生成します。
- 推論強化型創造MLLMの「思考モード」を用いることで、複雑で曖昧なユーザーの意図を先読みし、熟練した監督のようにカメラワークや物語の論理を自律的に計画することが可能になり、受動的なレンダリングから能動的な創造へと進化する。
- 高度な意味理解私たちは、マルチモーダルな大規模言語モデルを使用して、自由形式の入力を高レベルのセマンティック空間にマッピングし、それを拡散トランスフォーマーと組み合わせることで、きめ細かなビデオコンテンツを生成します。
- エンドツーエンドのビデオ生成コンセプトの理解からビデオ出力までの統合ワークフローは、役割の一貫性の維持やスタイルの伝達といった複雑なクリエイティブニーズをサポートし、IntelligentVBenchベンチマークテストにおいてオープンソースモデルの最先端レベルを達成しています。
OmniWeavingの使い方
-
環境準備GitHubからOmniWeavingリポジトリをクローンした後、requirements.txtに記載されているプロジェクトの依存関係をインストールし、推論パフォーマンスを最適化するために必要に応じてFlash AttentionまたはSageAttentionアクセラレーションライブラリのいずれかをインストールしてください。
-
モデルのダウンロードTencent HunyuanがHuggingFaceプラットフォームから公開したHY-OmniWeavingモデルの重みファイルを、指定したローカルディレクトリにダウンロードしてください。
-
文生ビデオ生成スクリプトを実行し、タスクタイプをt2vに指定します。テキストによる説明を入力し、画面比率と出力パスを設定します。必要に応じて、思考モードを追加して、モデルが動画を生成する前に意図を推測できるようにします。
-
画像と動画i2vタスクタイプを使用し、最初のフレーム画像へのパスとアクションの説明テキストを指定すると、モデルは静止画像とプロンプトに基づいて連続的な動的ビデオを生成します。
-
最初と最後のフレームの補間補間タスクを選択し、2つの画像(開始フレームと終了フレーム)と遷移の説明を入力すると、モデルが自動的に中間処理を埋めるための整合性のあるビデオを生成します。
-
複数画像合成生成reference2vタスクを通して、人物、小道具、背景などの参考画像を1枚から4枚アップロードし、テキストプロンプトと組み合わせて、複数の要素を自由に組み合わせた動画を作成してください。
-
動画編集編集タスクを使用してソース動画をアップロードし、編集指示(スタイル変換やオブジェクト置換など)を入力してください。モデルはテキストによる指示に基づいて、動画コンテンツをインテリジェントに修正します。
-
テキスト、画像、動画の共同編集このツールは、tiv2vタスクを使用してソースビデオと参照画像を同時に入力し、参照画像からの視覚要素を動的なビデオシーンに統合することで、高度な編集を可能にします。
OmniWeavingのプロジェクトアドレス
- プロジェクト公式サイト:https://omniweaving.github.io/
- GitHubリポジトリ:https://github.com/Tencent-Hunyuan/OmniWeaving
- ハギングフェイスモデルライブラリ:https://huggingface.co/tencent/HY-OmniWeaving
- arXiv技術論文:https://arxiv.org/pdf/2603.24458
OmniWeavingに関する重要な情報と使用要件
- プロジェクトの位置付けテンセント渾源が浙江大学および南洋理工大学と共同で、統一された動画生成フレームワークを2026年4月3日にオープンソース化しました。
- コアテクノロジー:
-
MLLM+MMDiT+VAEアーキテクチャマルチモーダル大規模言語モデルは、テキスト、画像、ビデオが混在した入力を解析します。拡散トランスフォーマーはビデオを生成し、変分オートエンコーダーは視覚信号を圧縮します。
-
自由形状の組み合わせタイミングバインディングをサポートし、テキスト、複数の画像(1~4枚)、およびビデオ入力の柔軟な組み合わせに対応しています。
-
推論強化型生成MLLMの「思考モード」をアクティブ化することで、複雑なユーザーの意図を先読みし、意味的に正確なビデオコンテンツを生成します。
-
- 使用要件:
-
ハードウェアマルチGPU環境(公式の例では8枚のカードを使用)に対応し、メモリ最適化オプション(Flash Attention/SageAttention)をサポートしています。
-
ソフトウェアPyTorchをベースとしたPython環境では、HunyuanVideo-1.5の依存関係がインストールされている必要があります。
-
OmniWeavingの主な利点
- 総合的なオールラウンダーOmniWeavingは、テキストからビデオへの変換、画像からビデオへの変換、複数画像の組み合わせ、ビデオ編集という6つの主要なタスクカテゴリを単一のフレームワークで統合し、複数の専用モデルを必要とする断片的なソリューションを置き換え、プロセス全体を通して統一された生成を実現します。
- 自由な組み合わせ従来のモデルにおける固定入力フォーマットの制約を打破し、1~4枚の画像、ビデオクリップ、テキストをインターリーブしたマルチモーダル入力をサポートし、要素間の時空間関係を理解するための時間的結合を実行することで、単純な接合ではなく、複雑なシーンの真の融合生成を実現します。
- 推論能力の向上MLLM思考モードを有効化すると、モデルは指示を淡々と実行する「レンダラー」から、ユーザーの意図を能動的に推論する「インテリジェントディレクター」へと進化します。ショットの言語表現や物語の論理構成を自動的に補完できるため、複雑なクリエイティブ描写に必要なプロンプトワードのエンジニアリング上のハードルを大幅に低減できます。
- ディープセマンティックインジェクションDeepStackingメカニズムは、MLLMの多層隠れ状態から多粒度意味特徴を抽出し、生成ネットワークの最下層に直接注入するために使用されます。これにより、ピクセルレベルの詳細制御と高レベルの意味的整合性の二重保護が実現され、複数被写体生成における詳細損失の問題が解決されます。
OmniWeavingの類似製品の比較
| 比較対象寸法 | OmniWeaving | Seedance-2.0 | CogVideoX |
|---|---|---|---|
| 所属 | テンセント・フンユアン × 浙江大学 × 南洋理工大学 | ByteDance | 志浦AI |
| オープンソースのステータス | 完全オープンソース(コード+重み+学習データ構築プロセス) | クローズドソースの商用製品 | オープンソース(重み付け+推論コード) |
| 作業の均一性 | 単一のフレームワークで、6つの主要なタスク(T2V/I2V/補間/編集/複数画像合成/TIV2V)をサポートします。 | 生成から編集までのプロセス全体を網羅する、包括的で統一されたモデル。 | 主にT2V/I2V/ビデオ編集をサポートしていますが、バージョンや構成が異なる場合は切り替える必要があります。 |
| マルチモーダル入力 | 時系列データの結合と理解のために、1~4枚の画像、ビデオクリップ、テキストを柔軟に組み合わせることができます。 | マルチモーダル入力はサポートされているが、具体的な組み合わせ方法は公表されていない。 | 主に、固定フォーマットの単一画像とテキスト、またはプレーンテキストの入力をサポートしており、複数の画像を組み合わせる機能は限定的です。 |
| 推論能力の向上 | MLLMは独自の思考モードにより、動画を生成する前にユーザーの意図を積極的に推測します。 | 意図を理解する一定の能力を備えているが、その具体的なメカニズムは明らかにされていない。 | 命令の受動的な実行、明示的な推論拡張モジュールなし |
| 質の高いものを生み出す | オープンソースの統合モデルSoTAであり、商用システムレベルに迫っている。 | 現在の最上位ビジネスモデルは、優れた物理的一貫性と画質を提供します。 | オープンソースコミュニティは主流レベルに達し、エコシステムも成熟しているが、最終的な画質は最新の商用モデルに比べて若干劣る。 |
| 生態系統合 | 新たにオープンソース化され、エコシステムは開発中であり、HunyuanVideoのインフラストラクチャに依存している。 | クローズドソースのAPIサービスであり、エコシステムは公式プラットフォームに依存している。 | ComfyUI/WebUIのプラグインは包括的で、コミュニティは豊富なLoRA関連リソースを提供しており、統合も容易です。 |
OmniWeavingの応用事例
- 映画およびテレビ広告のクリエイティブ制作テキストから直接コンセプトプレビュー動画を生成してストーリーボードを確認したり、キャラクター、シーン、小道具の参考画像を自由に組み合わせて完全なコマーシャルを生成したりできます。
- Eコマース商品の動的表示商品背景画像と使用シーンの参考画像をアップロードすると、商品使用シーン動画が自動生成され、ユーザーの写真と商品動画を組み合わせることで、パーソナライズされたバーチャル試着効果が得られます。
- ソーシャルメディアコンテンツの作成この機能は、静止画を自然な表情や動きのあるダイナミックな動画に変換し、古い写真に命を吹き込みます。フレーム補間に基づいて、ループアニメーションや楽しい絵文字パックを素早く生成します。
- ゲームアニメーションアセット制作キャラクターデザインのスケッチとアクションの説明をアップロードすることで、キャラクターアニメーションクリップを直接生成し、カットシーンの制作を加速できます。キーフレームを提供することで、AIがシーン間の遷移のための中間アニメーションを自動的に完成させることができます。