project
MAGI-2プレビュー - Sand.aiのオープンソースマルチモーダルビデオ生成モデル
MAGI-2-previewは、Sand.aiのオープンソースMoEマルチモーダルビデオ生成モデルで、パラメータの総数は114バイト、アクティベーションはわずか6バイトです。このモデルはシングルストリームアーキテクチャを継承し、テキスト、ビデオ、オーディオを単一のTに統合します。
MAGI-2プレビューとは何ですか?
MAGI-2-previewは、Sand.aiが開発したオープンソースのMoEマルチモーダル動画生成モデルで、1140億個のパラメータとわずか60億個のアクティベーション数を誇ります。シングルストリームアーキテクチャを継承し、テキスト、動画、音声を単一のTransformerに統合して共同モデリングを行うことで、ネイティブなマルチモーダル生成を実現しています。AA動画生成ランキングでは6位にランクインしています。モデルコードと事前学習済み重みが公開されており、動画生成分野における新しい効率的なスケーリング手法の有効性が実証されています。
MAGI-2プレビューの主な機能
- マルチモーダルビデオ生成テキスト、画像、動画の生成をサポートし、音声認識機能をネイティブに統合しています。
- MoEスパース活性化合計1140億個のパラメータのうち、有効化されるのはわずか60億個のみであり、推論コストを大幅に削減できる。
- シングルストリーム統合アーキテクチャこれは従来のクロスアテンションステッチング方式を放棄し、最初のレイヤーから画像と音声の両方をモデル化する。
- 高効率スケーリング動画生成シナリオにおける通信およびトレーニングの安定性の問題に対処するため、MoE通信を再構築し、超長尺シーケンスにおけるカード間通信のボトルネックを解消した。
MAGI-2プレビューの技術原理
- MoEハイブリッドエキスパートアーキテクチャこのモデルは合計114バイトの容量を持ち、単一の順伝播でアクティブ化されるパラメータはわずか6バイトであるため、容量と計算が分離されている。
- 単流式変圧器テキスト、ビデオ、オーディオの各トークンは、入力層から同じトランスフォーマーに入力され、自己注意機構を介してクロスモーダル情報を直接交換します。これは、マルチタワースプライシングアーキテクチャと比較して、オーディオビジュアル同期の詳細を捉えるのに適しています。
- 分散通信の最適化極めて長いビデオシーケンスの特性に対応するため、エキスパート並列処理におけるトークンルーティングと通信戦略を再構築し、GPU間のデータ転送オーバーヘッドを削減しました。
- トレーニング安定性計画動的ルーティング、専門家による負荷分散、およびマルチモーダルデータ共同学習からなる、三重の安定性保証メカニズム。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MAGI-2-previewの使い方
- 環境準備GitHubリポジトリのクローン
SandAI-org/MAGI-2-previewREADMEファイルに従って依存関係を設定してください。 - ダウンロード重量GitHub Releasesから事前学習済みの重みを取得します。
- 推論を実行中: 設定ファイルとスクリプトパラメータを変更してサポートします
t2v/i2v/v2vMAGI-1を参照した3つのモードrun.shフォーマット実行。 - ハードウェア要件具体的な構成については、公式ドキュメントで更新されます。MAGI-1 24BマルチカードH100または4.5Bシングルカード24GB VRAMソリューションを参照することをお勧めします。
MAGI-2プレビューの主な利点
- オープンソースで商用利用可能このモデルはApache 2.0ライセンスの下でライセンスされており、事前学習済みの重みと推論コードは完全に公開されています。
- MoEは、数千億ドル規模の先駆的な取り組みである。世界で初めてオープンソース化に成功した、数千億本の動画を処理できる能力を持つMoE動画生成モデルは、動画分野におけるスケーリングの新たな道筋を実証するものである。
- 低コストで大容量114Bモデルはわずか6Bの活性化パラメータで駆動でき、推論コストは同じサイズの密なモデルよりもはるかに低い。
- ネイティブマルチモーダルシングルストリームアーキテクチャにより、基盤となるモデルレベルで音声と映像を深く融合させることが可能になり、後段のアライメントによって発生する遅延や品質劣化を回避できます。
MAGI-2プレビューのプロジェクトアドレス
- プロジェクト公式サイト:https://sand.ai/blog/magi-2-preview
- GitHubリポジトリ:https://github.com/SandAI-org/MAGI-2-preview
- ハギングフェイスモデルライブラリ:https://huggingface.co/sand-ai/MAGI-2-preview
MAGI-2プレビューと類似の競合製品との比較
| 比較対象寸法 | MAGI-2-preview | Wan2.7-Video |
|---|---|---|
| 開発チーム | Sand.ai | アリ・トンイ研究室 |
| 建築 | MoE + シングルストリーム自己回帰トランスフォーマー | 3D DiT + MoE + フローマッチング |
| 合計パラメータ | 114B | 270B(14Bシリーズ) |
| 活性化パラメータ | 6B | 140B |
| 生成パラダイム | 帰還以来 | 拡散(流れのマッチング) |
| マルチモーダル | ネイティブオーディオとビデオの統合モデリング(シングルストリーム統合) | テキスト/画像/動画/音声のフルモーダル入力 |
| 動画の長さ | 不明(MAGI-1のストリーミング機能を継続して使用) | 2~15秒 |
| 解決 | 不明 | 720P / 1080P |
| オープンソースライセンス | Apache 2.0(商用利用可能) | オープンソース(重量オープン) |
| 中核となる能力 | 高効率スケーリング、ネイティブマルチモーダルビデオ生成 | 動画編集、参考動画、カメラの動きの制御、表情の制御 |
| ランキングパフォーマンス | AAはビデオ世代ランキングで6位にランクインした。 | DesignArena V2V トップランキング |
| 編集能力 | 不明 | ワンライン動画編集、スタイル転送、部分置換 |
MAGI-2プレビューの適用シナリオ
-
長尺動画広告と短編ドラマMoEは複雑な物語モデリングを強力にサポートし、1分間のまとまりのあるストーリー動画を生成できます。
-
マルチモーダルな映画・テレビのプレビジュアライゼーションネイティブの音声認識機能により、吹き替え、効果音、映像の同時生成と編集が可能になります。
-
AIビデオ学術研究オープンソースのMoE重み付けは、数千億本の動画に対応しており、学術研究において再現可能なスケーリングの基準値を提供する。
-
企業民営化の展開このモデルはApache 2.0ライセンスに基づいており、金融や医療などの機密性の高い業界におけるプライベートな動画生成機能の構築をサポートします。
-
リアルタイムストリーミング生成スパースアクティベーションは推論コストを削減し、低遅延のリアルタイムビデオ生成やライブストリーミングのシナリオをサポートできる。