AB
AiBoss
project

SkyReels V4 - Kunlun Tech の AI マルチモーダル ビデオ基盤モデル

SkyReels V4は、Kunlun Techが開発したビデオ基盤モデルです。マルチモーダル入力、音声と映像の同時生成、そして生成・修復・編集の統合をサポートする世界初のAIビデオモデルです。このモデルはデュアルストリームMMDiTアーキテクチャを採用し、108種類のビデオを生成できます。

SkyReels V4とは何ですか?

SkyReels V4は、Kunlun Techが開発した動画基盤モデルです。マルチモーダル入力、音声と映像の同時生成、そして生成・修復・編集を統合した世界初のAI動画モデルです。デュアルストリームMMDiTアーキテクチャを採用し、1080p/32FPS/15秒の映画品質の同期音声と映像を生成できます。人工知能分析ランキングでは世界第2位にランクインし、Google Veo 3.1やOpenAI Sora 2といった主流モデルを凌駕しています。テキスト、画像、動画、音声のマルチモーダル制御に加え、プロ仕様の動画修復・編集にも対応しています。

SkyReels V4の主な機能

  • マルチモーダル精密制御テキスト、画像、ビデオクリップ、マスク、音声参照など、さまざまな入力の組み合わせをサポートしており、メイン画像の保持、音色の転送、動作の置換などを可能にします。
  • プロ仕様のビデオ修復地域的なインテリジェント修復と参照ガイド付き修復により、動画の本体部分を正確に置き換えたり、属性を変更したり、背景を変更したりすることで、編集前後の視覚的な一貫性を確保できます。
  • フルディメンションビデオ編集部分編集(オブジェクトの追加または削除、テクスチャの変更)、インテリジェントな要素削除(透かし/字幕/ロゴ)、およびグローバルなスタイル移行とシーン属性の調整をサポートします。
  • 高品質オーディオ生成このモデルは、多言語音声合成、効果音生成、背景音楽適応機能を組み込んでおり、感情のこもったスピーチや歌詞の同期歌唱をサポートし、特に中国語の音声において優れた性能を発揮します。

SkyReels V4の技術的原理

  • デュアルストリームMMDiTアーキテクチャ本システムは、対称的なデュアルストリーム設計を採用し、ビデオとオーディオのブランチがMLLMテキストエンコーダを共有することで、双方向のクロスアテンションメカニズムを介してネットワーク全体の深いオーディオビジュアル同期を実現します。また、RoPE周波数スケーリング技術を使用してオーディオとビデオの時間スケールの不一致の問題を解決し、それを共同ストリームマッチング損失関数と組み合わせることで、リップシンクと効果音の同期の問題を根本的に解決します。
  • 統一スプライシングフレームワーク本技術は、チャンネルステッチングと時間的ステッチングを組み合わせた二次元パラダイムを革新的に導入し、生成、修復、編集といった多様なタスクを特定のマスク構成の下での修復問題として統合することで、あらゆるシナリオにおけるビデオ操作をワンストップでカバーし、ツールを切り替えることなくエンドツーエンドの作成を可能にします。
  • 効率的な発電戦略このモデルは「低解像度のフルシーケンス+高解像度のキーフレーム」という共同生成戦略を採用し、ビデオスパースアテンションメカニズムと組み合わせることで、アテンション計算コストを約3分の1に削減し、1080pの高解像度長時間ビデオの生成を実用的なものにしています。

SkyReels V4プロジェクトの住所

  • arXiv技術論文:https://arxiv.org/pdf/2602.21818

SkyReels V4のアプリケーションシナリオ

  • 広告とマーケティングこのモデルは、製品プロモーションビデオを迅速に生成でき、複数のスタイル切り替えや一括編集に対応しており、広告制作の効率を向上させます。
  • コンテンツ作成このモデルは、短いビデオスクリプトの視覚化、Vlogのインテリジェントな編集と修復、および同時多言語吹き替えをサポートしており、制作のハードルを下げます。
  • 映画およびテレビ制作初期コンセプトの視覚化、ショットの拡張、ポストプロダクションでの修復、ローカル編集などに使用され、映画やテレビの産業化プロセスを加速させた。
  • 教育と訓練このモデルは、教育ビデオの生成、コースウェアの視覚化、多言語字幕の自動同期をサポートし、オンライン教育コンテンツの制作を容易にします。