project
CogVideoX - Zhipu AIが発表したオープンソースのAI動画生成モデル。
CogVideoXは、Zhipu AIが開発した最新のオープンソースAI動画生成モデルで、Zhipu AIの商用製品「Qingying」と同じルーツを持っています。CogVideoXは英語のプロンプトに対応しており、720×480の解像度で毎秒8フレームの6秒間の動画を生成できます。
CogVideoXとは何ですか?
CogVideoXは、Zhipu AIが発表した最新のオープンソースAI動画生成モデルであり、Zhipu AIの商用製品と類似している。 はっきりとした影 「共通の起源を持つCogVideoXは、英語のプロンプトをサポートし、720×480の解像度で毎秒8フレームの6秒間の動画を生成できます。モデル推論には7.8~26GBのVRAMが必要で、現時点では量子化推論やマルチGPU推論はサポートしていません。このプロジェクトには、動画再構成用の3D因果VAEコンポーネントに加え、CLI/WEBデモ、オンライン体験、APIインターフェースの例、ファインチューニングガイドなど、豊富なサンプルとツールが含まれています。」
CogVideoXの主な機能
- AI文生ビデオユーザーが入力したテキストプロンプトに基づいてビデオコンテンツを生成する機能をサポートしています。
- ビデオメモリの要件が低いINT8精度の場合、推論に必要なメモリはわずか7.8GBなので、1080 Tiグラフィックカードでも推論に使用できます。
- ビデオパラメータのカスタマイズ動画の長さ、フレームレート、解像度をカスタマイズできます。現在、解像度720×480、フレームレート8fpsの6秒間の動画に対応しています。
- 3D因果VAE技術3D Causal VAE技術を用いることで、ビデオコンテンツの効率的な再構築が実現されます。
- 推論と微調整このモデルは、動画を生成するための基本的な推論をサポートすると同時に、さまざまなニーズに対応するための微調整機能も提供します。
CogVideoXの技術原則
- テキストからビデオへの変換CogVideoXは、ディープラーニングモデル、特にTransformerベースのアーキテクチャを使用して、入力されたテキストプロンプトを理解し、ビデオコンテンツを生成します。
- 3D Causal VAECogVideoXは、3D因果変分オートエンコーダーという、ビデオの再構成と圧縮のための技術を使用しており、ほぼ損失なくビデオを再構成できるため、ストレージとコンピューティングの要件を削減できます。
- エキスパートトランスフォーマーCogVideoXはエキスパート・トランスフォーマー・モデルを採用しています。これは、空間情報や時間情報の処理、情報の流れの制御など、さまざまなタスクを処理するために複数のエキスパートを使用する特殊なタイプのトランスフォーマーです。
- エンコーダ・デコーダアーキテクチャ3D VAEでは、エンコーダーがビデオを簡略化されたコードに変換し、デコーダーがこのコードに基づいてビデオを再構築します。潜在空間正則化器は、エンコードとデコード間のより正確な情報伝達を保証します。
- 混合期間トレーニングCogVideoXは、長さの異なる動画を学習できる混合長さトレーニングを採用しており、これによりモデルは様々な長さの動画を学習することができ、汎化能力が向上します。
- 多段階トレーニングCogVideoXのトレーニングは、低解像度事前トレーニング、高解像度事前トレーニング、高品質ビデオの微調整など、いくつかの段階に分かれており、モデルの生成品質と詳細度を段階的に向上させていきます。
- 自動評価と手動評価CogVideoXは、自動評価と手動評価を組み合わせて使用することで、生成されるビデオの品質が期待を満たすことを保証します。
CogVideoXプロジェクトのアドレス
- スマートスペクトラムクリアイメージ体験:
- CogVideoX-2B モデルアドレス:
- HuggingFaceモデルライブラリ:https://huggingface.co/THUDM/CogVideoX-2b
- Modaコミュニティモデルライブラリ:https://modelscope.cn/models/ZhipuAI/CogVideoX-2b
- CogVideoX-5B モデルアドレス:
- HuggingFaceモデルライブラリ:https://huggingface.co/spaces/THUDM/CogVideoX-5B
- Modaコミュニティモデルライブラリ:https://modelscope.cn/models/ZhipuAI/CogVideoX-5b
- GitHubリポジトリ:https://github.com/THUDM/CogVideo
- arXiv技術論文:https://arxiv.org/pdf/2408.06072
CogVideoX-2BとCogVideoX-5Bのパラメータ比較
CogVideoXのパフォーマンス評価
テキストからビデオへの生成品質を評価するために、VPenchの人間の動き、シーン、ダイナミクスなどの複数の指標を使用しました。また、ビデオの動的な特性に焦点を当てた2つのビデオ評価ツール、DevilのDynamic QualityとChrono-MagicのGPT4o-MT Scoreも使用しました。詳細は以下の表をご覧ください。
CogVideoXの応用シナリオ
- クリエイティブなビデオ制作これは、独立系のビデオクリエイターやアーティストが、創造的なテキスト説明を視覚的なビデオコンテンツに素早く変換するためのツールを提供する。
- 教育・研修資料複雑な概念を説明したり、教育シナリオを実演したりするのに役立つ教育ビデオを自動的に生成できます。
- 広告およびブランドプロモーション企業はCogVideoXモデルを利用して広告コピーに基づいた動画広告を生成することで、マーケティング効果を向上させることができる。
- ゲームおよびエンターテインメント業界これはゲーム開発者がゲーム内アニメーションやストーリー動画を迅速に生成するのに役立ち、ゲーム体験を向上させます。
- 映画およびビデオ編集テキストによる説明に基づいて、特定のシーンや特殊効果を含む動画を生成することで、動画編集を支援します。
- 仮想現実(VR)と拡張現実(AR)VRおよびARアプリケーション向けに没入感のあるビデオコンテンツを生成し、ユーザーインタラクションを強化します。