project
LongCat-Video-Avatar 1.5 - Meituanのオープンソースデジタルヒューマン動画生成モデル
LongCat-Video-Avatar 1.5 は、Meituan の LongCat プラットフォームから提供される、音声駆動型のオープンソースのデジタル人間ビデオ生成フレームワークです。このモデルは、136億パラメータの基本ビデオ生成モデル LongCat-Video をベースに構築されており、音声エンコーダーを組み込んでいます。
LongCat-Video-Avatar 1.5とは何ですか?
LongCat-Video-Avatar 1.5は、MeituanのLongCatプラットフォームから提供される、オープンソースの音声駆動型デジタルヒューマン動画生成フレームワークです。このモデルは、136億パラメータのLongCat-Video動画生成モデルをベースに構築されており、音声エンコーダーをWav2Vec2からWhisper-Large-v3にアップグレードすることで、より正確なリップシンクを実現しています。ステップ蒸留技術を用いて推論を8ステップに圧縮し、480P/720P解像度とINT8量子化をサポート。さらに、一人または複数人とのインタラクション、歌唱パフォーマンス、様式化されたアニメーションなどのシナリオにおいて、制作レベルの物理的な妥当性と時間的な安定性を備えています。
LongCat-Video-Avatar 1.5の主な機能
-
単一の音声駆動型ビデオ生成音声クリップ1つとテキスト、または参照画像を入力するだけで、人物が話している様子をダイナミックに再現したリップシンク動画を生成できます。
-
マルチオーディオインタラクティブ生成デュアルオーディオストリーム入力に対応しており、2人による対話や交代での発話など、自然な対話シナリオを実現できます。
-
動画の継続再生と長尺動画の生成ネイティブでビデオ連続生成機能をサポートしており、既存のクリップに基づいて、色ずれを起こすことなく1分間のビデオを連続して生成できます。
-
様式化とアニメーション化アニメキャラクター、動物のフィギュア、複雑な現実世界の状況などにも応用可能で、3Dアニメーションスタイルにも対応しています。
-
歌唱とパフォーマンスの生成音楽に連動したダイナミックな表情表現と、全身・半身の安定したパフォーマンスをサポートします。
-
マルチタスク基本モデル基盤となるLongCat-Videoプラットフォームは、テキストベースのビデオ、画像ベースのビデオ、およびビデオの連続再生を統一的にサポートしています。
LongCat-Video-Avatar 1.5の技術的原理
-
Whisper-Large-v3 オーディオコーデックWav2Vec2をWhisper-Large-v3に置き換えることで、より洗練された音声特徴が抽出され、リップシンクの精度が大幅に向上します。
-
段階蒸留:迅速な推論蒸留サンプリングによって推論ステップ数を8に削減することで、品質を維持しながら生成速度を大幅に向上させることができる。
-
粗密な時空生成戦略粗密生成を時間軸と空間軸に沿って使用し、ブロックスパースアテンションと組み合わせることで、720p/30fpsでの効率的な推論を実現します。
-
マルチ報酬GRPO強化学習グループ相対ポリシー最適化とマルチ報酬モデル学習に基づいて、テキストの配置、視覚的な品質、および動きの一貫性を最適化します。
-
INT8 量子化とコンテキスト並列処理メモリ使用量を削減するためのINT8量子化をサポートし、シングルカード/マルチカードのコンテキスト並列推論に対応しています。
LongCat-Video-Avatar 1.5 の使い方
- 環境準備リポジトリをクローンして Conda 環境を作成し、PyTorch 2.6.0、FlashAttention-2、およびプロジェクトの依存関係をインストールします。
- モデルをダウンロードHuggingFace CLI経由でダウンロード
LongCat-Video-Avatar-1.5地域への重み付け./weights目次。 - 単一音声生成音声パス、テキストプロンプト、および参照画像を含むJSONファイルを作成し、実行します。
run_demo_avatar_single_audio_to_video.py、 特定--model_type avatar-v1.5 --use_distill --use_int81.5モデル、蒸留推論、およびINT8量子化を有効にします。 - マルチオーディオ生成2つの音声クリップとそれに対応する文字情報を含むJSONファイルを作成し、実行してください。
run_demo_avatar_multi_audio_to_video.pyマージと連結という2つのデュアルオーディオモードをサポートしています。 - 動画の続き単一/複数音声スクリプトに追加
--num_segmentsこのモデルは、パラメータに基づいて自動的にセグメント化と書き込みを継続し、より長い連続動画の時系列を生成します。 - WebUIエクスペリエンス:埋め込む
streamlit run ./run_streamlit.py視覚的なインターフェースを起動して、対話型の生成とパラメータ調整を実行します。
LongCat-Video-Avatar 1.5の主な利点
-
リップシンク精度でトップクラスWhisper-Large-v3オーディオエンコーダーは、より高いリップシンク精度と、より滑らかな表情の変化を実現します。
-
長尺動画のアイデンティティの一貫性長時間の会話シーンや手と物体とのインタラクションシーンにおいて、安定した表情と一貫した全身の動きを維持する。
-
極めて速い推論速度8段階の蒸留推論は生成時間を大幅に短縮するため、より高いリアルタイム性が求められるビジネスシナリオに適しています。
-
オープンソースで商用利用可能モデルの重みと推論コードはどちらもMITライセンスの下でオープンソースとして公開されており、自由に展開および二次開発を行うことができます。
-
メモリに優しいINT8量子化とマルチGPU並列処理のサポートにより、ハードウェアの障壁が低くなります。
LongCat-Video-Avatar 1.5 のプロジェクトアドレス
- プロジェクト公式サイト:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
- GitHubリポジトリ:https://github.com/meituan-longcat/LongCat-Video
- ハギングフェイスモデルライブラリ:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
LongCat-Video-Avatar 1.5と類似の競合製品との比較
| 寸法 | LongCat-Video-Avatar 1.5 | HeyGen | Kling Avatar 2.0 | OmniHuman-1.5 |
|---|---|---|---|---|
| 開発者 | 美団龍猫チーム | HeyGen | 手際の良い人 | アリババ |
| オープンソースライセンス | MIT(完全オープンソース) | クローズドソースビジネス | クローズドソースビジネス | クローズドソースビジネス |
| オーディオエンコーダー | Whisper-Large-v3 | 非公開 | 非公開 | 非公開 |
| 推論ステップ数 | 8段階(蒸留) | 非公開 | 非公開 | 非公開 |
| 唇の精度 | 高(アップグレード後に大幅に改善) | 高い | 高い | 高い |
| 長時間の動画の安定性 | 強力な(ネイティブ継続サポート) | 中くらい | 中くらい | 中くらい |
| 複数人でのやり取り | デュアルオーディオのネイティブサポート | サポート | サポート | 限定的なサポート |
| 様式化された/アニメーション | アニメや動物などを支持する。 | 限定 | 限定 | 限定 |
| 解決 | 480P / 720P | 最大4K | 最大1080P | 最大1080P |
| ハードウェアしきい値 | INT8量子化をサポート | クラウドAPI | クラウドAPI | クラウドAPI |
LongCat-Video-Avatar 1.5の応用シナリオ
- AIを活用した音声解説とeコマースマーケティング販売業者は、製品説明の音声と参考画像を入力することで、正確な口の動きと自然な表情を備えたデジタル版の人間ベースの製品プロモーションビデオを一括生成でき、カメラに実際の人物が出演するコストを大幅に削減できます。
- オンライン教育とバーチャル講師教育機関は、講義音声を安定した一貫性のあるアイデンティティを持つ仮想講義ビデオに変換することで、長時間の講義やジェスチャーによるインタラクションをサポートし、コンテンツの再利用率を向上させることができる。
- バーチャルカスタマーサービスと企業イメージ企業は、専用のデジタルヒューマン顧客サービス担当者を導入することができ、これはマルチオーディオストリーム機能と組み合わせることで、ウェブサイトの受付やインテリジェントな発信コールフォローアップなどのシナリオにおいて、複数ラウンドの対話の視覚化を可能にします。
- ショートビデオとソーシャルメディアコンテンツの作成クリエイターは歌声やパフォーマンスの音声を入力し、DouyinやKuaishouなどのプラットフォーム向けに最適化された、非常にダイナミックでスタイリッシュな(アニメーション、リアリズムなど)バーチャルアバターのショートビデオを素早く生成します。