project
Movie Gen - Metaがテキスト駆動型AI動画生成・編集ツールをリリース
Movie Genは、Meta社が開発したAI動画生成ツールです。テキストプロンプトに基づいて動画を生成・編集し、同期音声を追加できます。この技術には、最大16秒の高解像度動画の作成、既存動画への音声追加、編集などが含まれます。
Movie Genとは何ですか?
Movie Genは、Metaが開発したAIビデオ生成ツールで、テキストプロンプトに基づいてビデオを生成・編集し、同期オーディオを追加できます。その技術には、最大16秒の高解像度ビデオの作成、既存ビデオへのオーディオの追加、ビデオの編集、写真に基づいたカスタムビデオの作成などが含まれます。Movie Genのビデオ生成モデルは30ビットのパラメータを持ち、1秒間に16フレームのビデオを生成できます。オーディオ生成モデルは13ビットのパラメータを持ち、環境音、効果音、インストゥルメンタルBGMなど、最大45秒の高品質オーディオを生成できます。このツールは現在、社内従業員と限られたパートナーのみが利用できます。Metaは、将来的に既存のアプリケーションに統合して、ユーザーエンゲージメントを高めることを計画しています。
Movie Genの主な機能
- ビデオ生成ユーザーがテキストを入力すると、Movie Genが16秒間の高解像度ビデオを生成します。ビデオはテキストの説明に基づいて自動的に作成され、さまざまなアスペクト比や解像度に対応します。
- パーソナライズされたビデオ生成ユーザーが写真をアップロードすると、Movie Genはその人物の特徴を取り入れつつ、人物のアイデンティティや行動の一貫性を保つ動画を生成することができる。
- 精密なビデオ編集Movie Genを使用すると、テキストコマンドを使って動画を正確に編集できます。動画内の要素の追加、削除、置換はもちろん、背景やスタイルの変更も可能です。
- 音声生成Movie Genは、環境音、効果音、インストゥルメンタルBGMなど、動画に合わせた高品質で同期のとれた音声を生成します。音声は動画コンテンツに合わせて生成され、テキストプロンプトに基づいて調整されます。
Movie Genの技術的原理
- モデルアーキテクチャMovie Genには、Movie Gen Video(ビデオ生成)とMovie Gen Audio(オーディオ生成)という2つの主要な基本モデルが含まれています。
- 事前トレーニングこのモデルは、インターネット上の大量の画像、動画、音声データを用いて事前学習されており、視覚と聴覚の世界における様々な概念を学習します。
- フローマッチング: ストリームマッチングを使用してターゲットをトレーニングし、データ生成に使用されるサンプルを反復的に更新する手法を使用して生成モデルをトレーニングします。
- 変分オートエンコーダー(VAE)変分オートエンコーダーは、動画や画像を学習済みの潜在空間に圧縮するために使用され、学習と推論の効率を向上させます。
- テキスト埋め込み入力テキストは、事前学習済みのテキストエンコーダーを使用してテキスト埋め込みに変換され、それがモデルへの条件付き入力として機能します。
- マルチモーダル入力このモデルは、テキスト、画像、動画など、さまざまな入力タイプを処理し、対応する出力を生成できます。
Movie Genのプロジェクトアドレス
- プロジェクト公式サイト:ai.meta.com/blog/movie-gen
- 技術論文:https://ai.meta.com/static-resource/movie-gen-research-paper
Movie Genの応用シナリオ
- コンテンツ作成ソーシャルメディア、ブログ、動画共有プラットフォーム向けに、独自の動画コンテンツを作成します。
- 映画およびビデオ制作プリプロダクション段階でコンセプトビデオを作成したり、ポストプロダクション段階で迅速な編集や音声ミキシングを行ったりする。
- 広告とマーケティング潜在顧客の注目を集める魅力的な広告動画を素早く作成します。
- 教育と訓練シミュレーション、歴史再現劇、語学学習教材など、教育コンテンツを作成する。
- ゲーム開発ゲーム内動画コンテンツ、予告編、プロモーション素材用の動画と音声を生成します。
- ニュースとレポートニュース記事の視覚コンテンツを迅速に作成し、報道の魅力を高めましょう。