AB
AiBoss
project

Mora - Microsoftなどが開発した、12秒間の動画を生成できるマルチAIエージェントフレームワーク。

Moraは、Microsoftとリーハイ大学の研究者によって開発されたマルチエージェント(AIエージェント)フレームワークで、一般的なビデオ生成タスク向けに特別に設計されています。その目標は、OpenAIのSoraビデオ生成モデルをシミュレートし、拡張することです。このフレームワークは…

モラとは何ですか?

Moraは、Microsoftとリーハイ大学の研究者によって開発されたマルチエージェント(AIエージェント)フレームワークで、一般的な動画生成タスク向けに特化して設計されています。その目的は、OpenAIのSora動画生成モデルをシミュレートし、拡張することです。このフレームワークの中核となるアイデアは、複数のビジュアルエージェントの連携によって高品質な動画コンテンツを生成することです。Moraは動画生成プロセスを複数のサブタスクに分解し、各サブタスクに専用のエージェントを割り当てることで、多様な動画生成機能を実現します。

論文中の実験結果によると、Moraは高解像度(1024×576)で12秒間、合計75フレームの動画を生成する際に優れた性能を発揮する。しかし、多数の動体を含むシーンを扱う場合、MoraはSoraと比較して性能面で大きな差を示す。さらに、12秒を超える動画を生成しようとすると、動画の品質が著しく低下する。

Moraの主な機能

  • テキストからビデオへの変換Moraは、ユーザーが提供するテキスト説明に基づいて対応するビデオコンテンツを自動的に生成することができ、単純なシーン描写から複雑なストーリーまで、幅広いビデオ制作に利用できます。
  • 画像から動画への変換Moraはテキストから直接動画を生成するだけでなく、ユーザーが提供した初期画像とテキストプロンプトを組み合わせて、それに合った動画シーケンスを生成することもでき、コンテンツの豊かさと詳細さを向上させます。
  • 拡張ビデオ生成Moraは、動画をゼロから生成できるだけでなく、既存の動画コンテンツを拡張・編集し、新しい要素を追加したり、動画の長さを延長したりすることもできます。
  • 動画編集Moraは高度な編集機能を備えており、ユーザーはテキストコマンドに基づいてビデオを編集できます。例えば、シーンの変更、オブジェクトのプロパティの調整、新しい要素の追加などが可能です。
  • コネクトビデオMoraは2つ以上のビデオクリップをシームレスに接続してスムーズなトランジションを作成できるため、ビデオのコンピレーションや編集に適しています。
  • アナログ・デジタルワールドMoraはデジタル世界を作成・シミュレーションすることも可能で、ゲームシーンや仮想環境など、テキストによる説明に基づいてデジタル世界風のビデオシーケンスを生成することができます。

モラの公式サイトへの入り口

Moraの仕組み

Moraは、複数の専門的なAIエージェントを連携させて動画生成タスクを完了させるマルチエージェントフレームワークに基づいて動作します。各エージェントは特定のサブタスクの処理を担当し、それらが組み合わさって完全な動画生成プロセスを構成します。

Moraワークフローの詳細な手順は以下のとおりです。

  1. タスクの内訳Moraは複雑な動画生成タスクを複数のサブタスクに分解し、それぞれを専用のエージェントが処理します。
  2. インテリジェントエージェントの役割定義モラは、知的エージェントの基本的な役割を以下の5つに定義した。
    • インテリジェントエージェントの選択と生成を促す大規模な言語モデル(GPT-4やLlamaなど)を使用してテキストプロンプトを最適化および選択し、生成される画像の関連性と品質を向上させます。
    • テキストから画像を生成するインテリジェントエージェントテキストプロンプトを高品質な初期画像に変換します。
    • 画像から画像を生成するインテリジェントエージェントテキストの指示に従って、指定されたソース画像を修正してください。
    • 画像から動画を生成するインテリジェントエージェント静止画像を動的な動画シーケンスに変換する。
    • ビデオ接続型インテリジェントエージェント2つの入力動画を基に、スムーズなトランジションを持つ動画を作成します。
  3. ワークフローMoraは、タスクの要件に基づいて、エージェントがサブタスクを特定の順序で実行するように自動的に構成します。たとえば、テキストからビデオを生成するタスクには、次のような手順が含まれる場合があります。
    • 初め、インテリジェントエージェントの選択と生成を促すテキストプロンプトを処理する。
    • それから、テキストから画像を生成するインテリジェントエージェント最適化されたテキストプロンプトに基づいて、初期画像を生成します。
    • それから、画像から動画を生成するインテリジェントエージェント元の画像をビデオシーケンスに変換する。
    • 最後に、必要であれば。ビデオ接続型インテリジェントエージェント複数のビデオクリップを連結して、一貫性のあるビデオを作成することができます。
  4. マルチエージェントコラボレーションエージェントは、事前に定義されたインターフェースとプロトコルを通じて通信および連携を行い、ビデオ生成プロセス全体の整合性と一貫性を確保します。
  5. 生成と評価各エージェントは、サブタスクを完了すると、その結果を次のエージェントに渡し、ビデオ生成プロセス全体が完了するまでこの処理を繰り返します。生成されたビデオは、事前に定義された評価基準に基づいて品質評価を行うことができます。
  6. 反復と最適化Moraフレームワークは、反復と最適化を通じてビデオ生成品質の向上を可能にします。エージェントはフィードバックに基づいてパラメータを調整し、生成されるビデオの品質とテキストプロンプトとの整合性を向上させることができます。