project
InstructAV2AV - 北京大学と共同でZhiyuan Technologyが開発した、オープンソースの音声・動画共同編集モデル。
InstructAV2AVは、北京人工知能研究院と北京大学が共同開発した音声・動画共同編集モデルです。ユーザーは、エンドツーエンドの生成プロセスにおいて、たった1つの自然言語コマンドだけで、動画映像とそれに対応するコンテンツを同時に編集できます。
InstructAV2AVとは何ですか?
InstructAV2AVは、北京人工知能研究院と北京大学が共同開発した音声・映像同時編集モデルです。ユーザーは、エンドツーエンドの生成プロセスにおいて、単一の自然言語コマンドだけで映像と対応する音声を同時に編集でき、手動によるマスキングや段階的な処理は不要です。このモデルは、背景音や環境音を維持しながら、音声と映像の同期を確保しつつ、セリフの変更、文字の置換、オブジェクトの挿入と削除をサポートします。
InstructAV2AVの主な機能
-
身元保護のための音声修正キャラクターの外見はそのままに、セリフだけを置き換えてください。
-
オーディオおよびビデオインスタンスの置き換え画像内の指定されたキャラクターを、そのキャラクターの音声とセリフとともに置き換えてください。
-
インスタンス挿入画面上に新しいオブジェクトを追加すると、自動的に同期したサウンドが生成されます。
-
インスタンスの削除: オーディオトラック内の指定されたオブジェクトとその対応するサウンドを削除します。
-
属性の組み合わせ編集キャラクターの外見、セリフの内容、声はそれぞれ独立して変更でき、自由に組み合わせることができます。
InstructAV2AVの技術原理
-
ソース潜在変数スプライシングソースビデオとソースオーディオの潜在変数とノイズはチャネル次元に沿って接合されるため、ソースコンテンツがノイズ除去プロセス全体の構造条件となり、モデルが背景、無関係なオブジェクト、環境音を保持するように制約され、「1つのターゲットを変更して世界全体を再描画する」ことを回避します。
-
SIGA ゲート付きアテンションソース・インストラクション・ゲート型アテンションは、各トークンがソースとインストラクションの両方の特徴に同時にアクセスすることを可能にします。学習可能なソフトゲーティングによって、位置ごとに変更する量と保持する量を決定し、コンテンツの保持とインストラクションの実行の間の動的なバランスを実現します。
-
デュアルストリーム相互作用アーキテクチャOvi対称型2ストリーム拡散トランスフォーマーに基づき、ビデオとオーディオの各ブランチがそれぞれ独自の注意機構をモデル化した後、双方向のクロスモーダル注意機構を介して特徴を交換することで、視覚的な動きと音のイベントが相互に制約され、同期が維持される。
-
2段階トレーニング: クロスモーダルアテンションを無効にして、シングルモーダル編集機能を個別にトレーニングし、その後、完全なアーキテクチャを復元して共同で微調整を行い、音と画像間のきめ細かい対応関係を学習します。
-
自動化されたデータパイプラインInsAVE-80Kデータセットは、材料選択、編集とターゲット合成、5次元自動評価と手動レビューという3つの段階を経て構築されており、ペアになったトレーニングデータが不足しているという問題を解決しています。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
InstructAV2AVの使い方
-
クローンコードGitHubからInstructAV2AVのコードリポジトリをローカルマシンにクローンしてください。
-
環境設定リポジトリの指示に従って、Python環境を設定し、必要な依存関係をインストールしてください。
-
ダウンロード重量Hugging FaceからInstructAV2AVモデルの重みデータをダウンロードしてください。
-
材料を準備する音声を入力として含むビデオクリップを準備してください。
-
入力コマンド変更したい内容を説明する自然言語編集コマンドを入力してください。
-
推論を実行中推論スクリプトを実行し、モデルが編集済みのビデオとオーディオを生成するまで待ちます。
-
結果を保存する出力結果を確認し、編集済みの音声ファイルと動画ファイルを保存します。
InstructAV2AVのプロジェクトアドレス
- プロジェクト公式サイト:https://hjzheng.net/projects/InstructAV2AV/
- GitHubリポジトリ:https://github.com/suimuc/InstructAV2AV
- ハギングフェイスモデルライブラリ:https://huggingface.co/suimu/InstructAV2AV
- arXiv技術論文:https://arxiv.org/pdf/2605.18467
InstructAV2AVと類似競合製品との比較
| 比較対象 | InstructAV2AV | Ovi |
|---|---|---|
| 製品ポジショニング | 指示主導型の音声・動画共同編集モデル | 音声と映像の同時生成モデル |
| 中核となる能力 | 元の動画に基づいて、映像と音声を修正する。 | 動画と音声をゼロから生成する |
| 入力方法 | ソースビデオ + ソースオーディオ + 自然言語コマンド | テキストプロンプト(ゼロから生成) |
| 背景保存 | 不要な背景音や環境音を正確に保持する | ソースコンテンツの保持は一切行われません |
| 音声と映像の同期 | 双方向のクロスモーダルな注意により、編集後の同期が保証されます。 | 同期生成、シーン編集はサポートされていません。 |
| 技術アーキテクチャ | 改良型Oviデュアルストリーム拡散トランスフォーマーをベースに、ソース潜在変数スプライシングとSIGAゲーティングを追加した。 | 対称二流拡散トランスフォーマー |
| 適用可能なシナリオ | 会話の変更、キャラクターの置き換え、オブジェクトの挿入と削除 | テキストから音声や動画へのクリエイティブな変換 |
InstructAV2AVの応用シナリオ
-
映画やテレビ番組のポストプロダクション映画やテレビのポストプロダクションスタッフは、俳優のセリフを差し替えたり、口の動きを同期させたりするためにこれを使用し、撮り直しのコストを削減している。
-
短編動画制作ショートビデオ制作者は、たった一文で映像内のキャラクターや音声を変更できるため、制作効率を向上させることができます。
-
バーチャルヒューマンバーチャルヒューマン運用チームは、これを使ってデジタルヒューマンの外見、声のトーン、話し方などを調整する。
-
広告の創造性広告業界のプロは、これを利用して、異なるキャラクターやセリフを使ったプロモーションビデオをまとめて作成する。
-
インタラクティブコンテンツ制作ゲーム開発者や教育者が、音声と映像を同期させたマルチメディア素材を動的に生成するために使用する。