AB
AiBoss
project

Wan2.2 - アリババのオープンソースAI動画生成モデル

Wan2.2は、アリババがオープンソース化した高度なAI動画生成モデルです。テキストベースの動画(Wan2.2-T2V-A14B)、画像ベースの動画(Wan2.2-I2V-A14B)、および統合動画生成(Wan2.2-IT2V-...)の3つのオープンソースバージョンがあります。

同義万祥のWan2.2とは何ですか?

Wan2.2は、アリババがオープンソース化した高度なAIビデオ生成モデルです。テキストベースビデオ(Wan2.2-T2V-A14B)、画像ベースビデオ(Wan2.2-I2V-A14B)、および統合ビデオ生成(Wan2.2-IT2V-5B)の3つのオープンソースモデルで構成され、合計270億のパラメータがあります。このモデルは、ハイブリッドエキスパート(MoE)アーキテクチャを初めて導入し、生成品質と計算効率を効果的に向上させています。また、照明、色、構図などの美的効果を正確に制御する映画レベルの美的制御システムを先駆的に導入しています。新たにオープンソース化されたこの50億パラメータのコンパクトなビデオ生成モデルは、テキストベースと画像ベースのビデオ生成をサポートし、コンシューマーグレードのグラフィックカードで動作可能で、高効率3D VAEアーキテクチャに基づいており、高い圧縮率と高速な高解像度ビデオ生成機能を実現しています。現在、開発者はGitHubやHuggingFaceなどのプラットフォームを通じてモデルとコードを入手でき、企業はAlibaba Cloud APIを使用してアプリケーション開発を行うことができ、ユーザーはWan2.2の公式サイトやWan2.2アプリで直接体験することができます。

Wan2.2(通义万相)の主な機能

  • テキストからビデオへ入力されたテキストの説明に基づいて、対応する動画コンテンツを生成します。例えば、「猫が草の上を走っている」という入力があった場合、このモデルは説明に合致する動画を生成できます。
  • 画像から動画へこのモデルは入力画像に基づいて動画を生成し、画像に命を吹き込むようなダイナミックなシーンを作り出します。
  • 統合型ビデオ生成(テキスト画像からビデオへ)テキストと画像を組み合わせて動画を生成するもので、テキストの説明と画像情報を用いて、より正確な動画コンテンツを作成します。
  • 映画的な美的コントロール照明、色彩、構図、そして細かな表情をコントロールすることで、プロ仕様の映画のようなクオリティの動画を生成します。ユーザーは、「暖色系の色調」や「中央配置」といった関連キーワードを入力することで、動画の美的スタイルをカスタマイズできます。
  • 複雑な動作生成複雑な動きのあるシーンやキャラクター同士のやり取りを生成できるため、動画のダイナミックな表現力とリアリティを高めることができます。

Tongyi Wanxiang Wan2.2 の技術原則

  • ハイブリッドエキスパート(MoE)アーキテクチャMoEアーキテクチャが導入され、モデルは高ノイズエキスパートと低ノイズエキスパートに分割されます。高ノイズエキスパートはビデオ全体のレイアウトを担当し、低ノイズエキスパートは詳細な調整を行います。これにより、同じ計算コストを維持しながら、モデルパラメータの数と生成されるコンテンツの品質が大幅に向上します。
  • 拡散モデル拡散モデルを基盤として、ノイズを段階的に除去することで高品質なビデオコンテンツを生成します。MoEアーキテクチャと拡散モデルを組み合わせることで、生成結果をさらに最適化できます。
  • 高圧縮率3D VAEモデルの効率性を向上させるため、Tongyi Wanxiang 2.2は高圧縮率の3D変分オートエンコーダー(VAE)をベースとしています。このアーキテクチャは時間軸と空間軸の両方で高い圧縮率を実現し、一般消費者向けグラフィックカードでも高解像度ビデオを高速に生成することを可能にします。
  • 大規模データトレーニングこのモデルは、より多くの画像データや動画データを含む大規模なデータセットで学習されており、さまざまなシナリオにおけるモデルの汎化能力と生成品質を向上させています。
  • 美的データ注釈照明、色彩、構図などの美的データに基づいて、このモデルはプロフェッショナルな映画品質のビデオコンテンツを生成し、ユーザーのビデオ美学に関する個別のニーズを満たすことができます。

同義市万郷区万22号のプロジェクト住所

  • GitHubリポジトリ:https://github.com/Wan-Video/Wan2.2
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Wan-AI/models

Wan2.2(通义万相)の使い方

  • 公式ウェブサイトをご覧ください同義万郷の公式サイトにアクセスするか、同義アプリをダウンロードして体験してみてください。
  • モデルを選択モデル選択ドロップダウンボックスで、「General Universal Phase 2.2」を選択します。
  • 体験モードを選択してください
    • テキストからビデオへ「猫が草の上を走っている」などのテキスト説明を入力し、「生成」ボタンをクリックすると、生成された動画が表示されます。
    • 画像から動画へ画像をアップロードすると、モデルが画像の内容に基づいて動的な動画を生成します。
    • 統合型ビデオ生成(テキスト画像からビデオへ)テキストによる説明とアップロードされた画像を組み合わせることで、より精度の高い動画コンテンツを生成できます。
  • パラメータを調整する(任意)ユーザーは、必要に応じて解像度やフレームレートなどのビデオパラメータを調整できます。映画のような美的コントロールシステムにより、ユーザーはキーワード(「暖色系」や「中央構図」など)を入力することで、ビデオの美的スタイルをカスタマイズできます。
  • 生成された結果を表示する生成された動画はウェブページ上に直接表示され、ユーザーは生成された動画をダウンロードしたり共有したりすることができる。

Tongyi Wanxiang Wan2.2 のアプリケーション シナリオ

  • ショートビデオ制作クリエイターは、ソーシャルメディアプラットフォーム向けに魅力的なショートビデオコンテンツを迅速に作成できるため、時間とコストを節約できます。
  • 広告とマーケティング広告代理店やブランドは、広告効果とブランド影響力を高めるために、高品質な広告動画を制作する。
  • 教育と訓練教育機関や企業は、学習成果や研修の質を向上させるために、魅力的な教育ビデオや研修教材を作成することができる。
  • 映画およびテレビ制作映画やテレビの制作チームは、シーンデザインやアニメーションクリップを迅速に作成できるため、クリエイティブな効率性が向上し、制作コストを削減できます。
  • ニュースとメディア報道機関やメディアは、ニュース報道の視覚的な魅力を高め、視聴者の関心を引くために、アニメーションや視覚効果を作成することができる。