project
音声を描画する - 中国科学院と美団が共同で立ち上げた動画音声変換システム
Draw an Audioは、中国科学院自動化研究所と美団点評の研究者らが開発した、映像から音声を生成するシステムです。映画制作におけるフォーリーアートのように、映像コンテンツに基づいて自動的に適切な効果音を生成します。
Draw an Audioとは何ですか?
Draw an Audioは、中国科学院自動化研究所とMeituan-Dianpingの研究者らが開発した、動画から音声を生成するシステムです。映画制作におけるフォーリーアートのように、動画コンテンツに基づいて自動的に適切な効果音を生成します。このシステムは動画を分析し、テキスト、動画マスク、ラウドネス信号などの様々な入力指示を組み合わせて、動画コンテンツ、時間、ラウドネスに一致する音声を生成します。コアアーキテクチャは、潜在拡散モデル(LDM)、テキスト条件モデル、マスクアテンションモジュール(MAM)、時間ラウドネスモジュール(TLM)で構成されており、これらが連携して高品質かつ正確な音声生成を実現します。動画コンテンツ制作者にとって強力なツールとなり、サウンドデザインのプロセスをより効率的かつ柔軟にします。
オーディオの主な機能を図示する
- コンテンツの一貫性このシステムはビデオコンテンツを分析し、ビデオシーンの意味内容に合った音声を生成します。例えば、ビデオに動物が登場した場合は、それに対応する動物の鳴き声を生成します。
- 時間的一貫性生成された音声はビデオ内の動作と正確に同期しており、物体が衝突する音とビデオ内で衝突動作が同時に発生するなど、効果音が適切なタイミングで表示されるようになっています。
- 音量の一貫性このシステムは、映像内の動作の激しさに応じて音量を調整します。例えば、映像内の遠くにある物体の音は比較的小さく、近くにある物体の音は大きくなります。
- 複数のコマンド入力このシステムは、ビデオ自体、関連するテキスト説明、ビデオマスク、ラウドネス信号など、さまざまな入力コマンドをサポートしており、音声生成をより柔軟かつ制御可能にします。
- 高品質な同期音声Draw an Audioは複数のコマンドを活用することで、ビデオコンテンツと自然に同期した高品質な音声を生成し、視聴体験を向上させます。
オーディオ描画の技術的原理
- 潜在拡散モデル(LDM)基本モデルとして、音声データの基本的な生成と処理を担っています。
- テキスト条件モデルテキストの説明文を処理することで、生成される音声がテキストの説明文と一致するようにし、コンテンツの意味的な一貫性を向上させます。
- マスクド・アテンション・モジュール(MAM)ビデオマスキングを使用することで、ビデオの重要な領域に焦点を当て、ビデオコンテンツと生成された音声との一貫性を高めることができます。
- タイムラウドネスモジュール(TLM)音量信号などの処理信号命令を処理し、生成された音声が時間と音量の両面で映像と同期するようにする。
オーディオプロジェクトのアドレスを描画します
- プロジェクト公式サイト:yannqi.github.io/Draw-an-Audio
- arXiv技術論文:https://arxiv.org/pdf/2409.06135
Draw an Audio の応用シナリオ
- 映画およびビデオ制作映画やテレビのポストプロダクションにおいて、Draw an Audioは、無音の映像に足音や乗り物の音などの適切な効果音を自動的に追加することで、制作効率を向上させ、コストを削減します。
- ゲーム開発ゲーム内のアニメーションやシーンにリアルな効果音を生成し、プレイヤーの没入感とゲーム体験を向上させます。
- 仮想現実(VR)と拡張現実(AR)仮想環境内のシーンに合ったサウンドを生成することで、ユーザーのインタラクティブな体験と知覚されるリアリティを高める。
- 教育と訓練教育ビデオ用の解説音声を自動生成し、学生が知識をより深く理解し吸収するのに役立ちます。
- アニメーション制作アニメーションキャラクターのセリフや環境音効果音を自動的に生成することで、アニメーション制作の効率化を図る。
- 広告制作広告動画の魅力と記憶に残る度を高めるために、魅力的な音声効果を生成します。