project
daVinci、MagiHuman、Sand.aiなどのオープンソースの音声・動画生成モデル
daVinci-MagiHumanは、上海イノベーション技術研究所のGAIR LabとSand.aiが共同開発したオープンソースの音声・映像共生成基盤モデルです。このモデルは、150億個のパラメータを持つシングルストリームTransformerアーキテクチャを採用し、テキスト、音声、映像を均一にモデル化します。
ダヴィンチ・マジヒューマンとは何ですか?
daVinci-MagiHumanは、上海イノベーション技術研究所のGAIR LabとSand.aiが共同開発したオープンソースの音声・動画共生成基盤モデルです。このモデルは、150億個のパラメータを持つシングルストリームTransformerアーキテクチャを採用し、クロスアテンション機構を必要とせずにテキスト、動画、音声の各モダリティを統一的にモデリングします。人物中心の生成に優れ、中国語、英語、日本語、韓国語、ドイツ語、フランス語など複数の言語をサポートし、単一のH100画像からわずか2秒で5秒間の256p動画を生成できます。Ovi 1.1およびLTX 2.3と比較すると、勝率はそれぞれ80%および60.9%です。コード、モデルの重み、オンラインデモはすべてオープンソースです。
daVinci-MagiHumanの主な機能
-
音声と映像の同時生成自然な音声とリップシンクを特徴とする動画の同時生成をサポートし、真のオーディオビジュアル統合を実現します。
-
多言語対応中国語(北京語と広東語)、英語、日本語、韓国語、ドイツ語、フランス語など、複数の言語の音声生成に対応しています。
-
人物画像生成キャラクターの中心となる場面に焦点を当てることで、表情豊かな顔の表情、体の動き、そして感情的なコミュニケーションを生み出す。
-
スピード推論単一のH100 GPUで5秒間の256pビデオを2秒で生成することをサポートし、リアルタイムのインタラクティブなニーズに対応します。
-
高解像度出力潜在空間超解像技術を用いることで、540pまたは1080pの高解像度ビデオへと拡張することが可能です。
daVinci-MagiHumanの技術原理
- シングルストリーム統合アーキテクチャdaVinci-MagiHumanは、テキスト、ビデオ、オーディオを単一の150億パラメータ、40層のノイズ除去ネットワークに統合するシングルストリームTransformerアーキテクチャを採用しています。共同モデリングには純粋な自己注意機構を使用し、クロスアテンションやモダリティ固有のブランチを完全に排除しています。アーキテクチャ的には「サンドイッチ」設計を採用しており、最初と最後の数層でモダリティ関連のパラメータを保持し、バックボーンネットワークでパラメータを共有することで、モダリティ特化とディープフュージョンのバランスを実現しています。同時に、明示的なタイムステップ条件付き注入やアテンションヘッドゲーティングなどのメカニズムを導入することで、トレーニングの安定性と表現力を向上させています。
- 潜在空間超解像このモデルは2段階のパイプラインを採用しています。まず、下段のモデルで低解像度の音声および映像の潜在変数を生成し、次に潜在空間超解像によって潜在空間内で直接高解像度化を行うことで、VAEエンコードおよびデコードの追加オーバーヘッドを回避します。音声の潜在変数は、リップシンク効果を維持するために、超解像モデルへの入力として引き続き使用されます。
- 推論高速化の最適化推論ステージでは、軽量なTurbo VAEデコーダを使用してレイテンシを削減し、自社開発のMagiCompilerを統合してフルグラフコンパイルの最適化を行い、クロスレイヤー演算子の融合により約1.2倍の高速化を実現しています。また、DMD-2蒸留技術と組み合わせることで、わずか8ステップのノイズ除去で高品質な生成を実現しています。
daVinci-MagiHumanに関する重要な情報と使用要件
-
モデルサイズ150億個のパラメータ、40層のトランスフォーマー
-
建築的特徴単一ストリームの統合アーキテクチャ、純粋な自己注意機構、相互注意機構なし。
-
発電能力テキストと画像に基づいて、人物のポートレート音声と動画を同時生成する機能をサポートします。
-
対応言語中国語(北京語、広東語)、英語、日本語、韓国語、ドイツ語、フランス語
-
推論速度H100画像1枚から、5秒間の256p動画を2秒で、1080p動画を38秒で生成できます。
-
パフォーマンスOvi 1.1と比較すると勝率は80.0%、LTX 2.3と比較すると勝率は60.9%です。
-
ハードウェアNVIDIA製GPU(H100推奨)、CUDAサポート必須。
-
ソフトウェア環境:Python 3.12,PyTorch 2.9.0,CUDA 12.x
-
依存関係コンポーネント: Flash Attention (Hopperアーキテクチャ)、MagiCompiler (自社開発コンパイラ)、Turbo VAE
daVinci-MagiHumanのコアとなる利点
-
シンプルで効率的な建築テキスト、ビデオ、オーディオを統一的にモデル化するためにシングルストリームTransformerを採用し、クロスアテンションやモーダルブランチを排除することで、システムの複雑さを軽減し、トレーニングと推論の最適化をより直接的に行えるようにしています。
-
正確な音声と映像の同期ネイティブなジョイントモデリングにより、音声、唇の動き、表情、動作間の高度な連携が確保され、従来のソリューションで問題となっていた音声と映像間の意味的な整合性の不足という問題を回避できます。
-
生成速度は非常に速い。この技術は、単一のH100画像から2秒で5秒間の256pビデオを生成することをサポートしており、潜在空間超解像、Turbo VAE、フルグラフコンパイル、モデル蒸留を組み合わせることでリアルタイム推論を実現します。
-
強力な多言語一般化中国語、英語、日本語、韓国語、ドイツ語、フランス語、広東語など、複数の言語に対応しており、グローバルなコンテンツ制作のニーズを満たします。
-
卓越した肖像表現キャラクターの中心となるシーンに焦点を当て、感情豊かな表情、自然な声、そしてリアルな身体の動きを生成することで、パフォーマンスレベルのクオリティを実現します。
daVinci-MagiHumanの使い方
- 方法1:Docker
-
事前に構築されたイメージをプルします。
docker pull sandai/magi-human:latest。 -
コンテナを起動し、ローカルディレクトリをマウントします。
docker run -it --gpus all --network host --ipc host -v /path/to/repos:/workspace -v /path/to/checkpoints:/models sandai/magi-human:latest bash。 -
コンテナに入ったら、MagiCompilerをインストールし、daVinci-MagiHumanコードリポジトリをクローンします。
-
HuggingFaceからモデルの重みをダウンロードし、設定ファイル内のパスを更新してください。
-
対応するスクリプトを実行して生成を開始してください。
-
- 方法2:Condaを使用した手動インストール
-
Python 3.12環境を作成してアクティブ化する:
conda create -n davinci python=3.12 && conda activate davinci。 -
PyTorch 2.9.0および関連コンポーネントをインストールしてください。
-
Flash Attention(Hopperアーキテクチャ版)をコンパイルしてインストールします。
-
MagiCompilerをdaVinci-MagiHumanプロジェクトの依存関係とともにクローンしてインストールします。
-
T5 Gemma、Stable Audio、Wan2.2 VAEなどの外部モデルとプロジェクトウェイトをダウンロードします。
-
設定ファイル内のモデルパスを更新した後、生成スクリプトを実行してください。
-
- スクリプトを実行する
-
基本的な256p生成:実行
bash example/base/run.sh。 -
蒸留クイックバージョン256p(8ステップノイズ低減、CFGなし):実行
bash example/distill/run.sh。 -
540pへの超解像度化:実行
bash example/sr_540p/run.sh。 -
1080pへの超解像度:実行
bash example/sr_1080p/run.sh。
-
daVinci-MagiHumanのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/GAIR-NLP/daVinci-MagiHuman
- ハギングフェイスモデルライブラリ:https://huggingface.co/GAIR/daVinci-MagiHuman
- arXiv技術論文:https://arxiv.org/pdf/2603.21986
- オンラインでデモを体験してください:https://huggingface.co/spaces/SII-GAIR/daVinci-MagiHuman
daVinci-MagiHumanの類似製品の比較
| 比較対象 | daVinci-MagiHuman | LTX 2.3 | Ovi 1.1 |
|---|---|---|---|
| 研究開発 | 上海イノベーションアカデミー GAIR + Sand.ai | Lightricks | Ovi Labs |
| 建築設計 | 単一ストリーム変圧器、相互注意なし | マルチストリームまたは拡散アーキテクチャ | マルチストリームアーキテクチャ |
| モデルサイズ | 150億のパラメータ | 非公開 | 非公開 |
| 音声およびビデオ生成 | ネイティブジョイントモデリング、同期生成 | サポート | サポート |
| 生成速度 | H100 2秒/5秒 256p | もっとゆっくり | もっとゆっくり |
| 視覚的な品質 | 4.80 | 4.76 | 4.73 |
| テキストの配置 | 4.18 | 4.12 | 4.10 |
| 物理的粘稠度 | 4.52 | 4.56 | 4.41 |
| 音声品質(WER) | 14.60% | 19.23% | 40.45% |
| 勝率の人間による評価 | ベンチマーク | 勝率60.9% | 勝率80.0% |
| オープンソースレベル | 完全オープンソース(コード+重み+ツールチェーン) | 部分的にオープンソース | 部分的にオープンソース |
| 多言語対応 | 中国語、英語、日本語、韓国語、ドイツ語、フランス語、広東語 | 限定 | 限定 |
daVinci-MagiHumanの応用シナリオ
-
AIデジタルヒューマンアンカー正確な口の動きと自然な表情で、製品プロモーションやニュース放送用の動画を自動生成し、さまざまな地域市場に対応するために複数の言語をサポートしています。
-
仮想カスタマーサービスおよびアシスタントリアルな音声対話機能を備えた、知的な顧客サービス担当者像を構築することで、サービスの温かさとユーザーエクスペリエンスを向上させる。
-
映画および広告制作キャラクターのクローズアップショット、吹き替えデモ、絵コンテのプレビューなどを素早く作成することで、プリプロダクションのコストと時間を削減できます。
-
教育および研修コンテンツ多言語対応の教育ビデオを作成することで、バーチャル講師が生き生きとした表情と明瞭な口の動きで知識の要点を説明できるようになります。
-
ゲームとメタバースのキャラクターこれにより、仮想キャラクターはリアルタイムの音声操作機能を持つようになり、プレイヤーはNPCと自然な会話ややり取りを行うことができる。