AB
AiBoss
project

Hunyuan画像ベース動画 - Tencent Hunyuanのオープンソース画像ベース動画モデル

Hunyuan Image-Generated Videoは、Tencent Hunyuanが開発したオープンソースの画像生成動画モデルです。ユーザーは画像をアップロードし、簡単な説明文を追加することで、その画像を基にした5秒間のショートビデオを生成できます。このモデルは、リップシンク、モーション駆動編集、背景効果音などをサポートしています。

Hunyuan Tushengの動画とは何ですか?

滬源画像生成動画は、テンセント滬源が開発したオープンソースの画像生成動画モデルです。ユーザーは画像をアップロードし、簡単な説明文を追加することで、その画像を基にした5秒間のショートビデオを生成できます。このモデルは、リップシンク、モーション駆動アニメーション、自動背景効果音生成などの機能をサポートしています。モデルは、写実的な作品、アニメーション作品、CGI作品など、さまざまなキャラクターやシーンに対応しており、パラメータの総数は130億です。滬源画像生成動画モデルは、テンセントクラウドで利用可能で、ユーザーは滬源AI動画公式サイトから体験できます。また、滬源画像生成動画モデルは、重み、推論コード、LoRAトレーニングコードなどを含め、GitHubやHuggingFaceといった主要な開発者コミュニティでもオープンソースとして公開されており、開発者は独自のLoRAやその他の派生モデルをトレーニングできます。

Hunyuan Tushengビデオの主な機能

  • 画像生成ビデオユーザーは画像をアップロードして簡単な説明を入力するだけで、モデルは静止画像を5秒間の短い動画に変換し、さらに背景効果音の自動生成にも対応します。
  • オーディオドライバー機能ユーザーは人物写真をアップロードしたり、テキストや音声を入力したりすることができ、モデルは唇の動きを正確に再現することで、写真の人物に「話させたり」「歌わせたり」し、声のトーンに合った表情を表現できる。
  • アクション駆動型機能ユーザーが画像をアップロードし、アクションテンプレートを選択すると、モデルは画像内の人物にダンス、手を振る、体操などの動作を実行させることができます。ショートビデオ制作、ゲームキャラクターアニメーション、映画やテレビ番組制作に適しています。
  • 高画質ビデオ出力2Kの高解像度画像品質に対応しており、リアルな映像、アニメ、CGIなど、様々なキャラクターやシーンに適しています。

渾源画像生成ビデオの技術原理

  • 画像から動画への生成フレームワークHunyuanVideo-I2Vは、画像潜在結合技術を用いて、参照画像からの情報を動画生成プロセスに統合します。入力画像はまず、事前学習済みのマルチモーダル大規模言語モデル(MLLM)によって処理され、意味的な画像トークンが生成されます。次に、これらのトークンが動画潜在トークンと結合され、クロスモーダルなフルアテンション計算を実現します。
  • マルチモーダル大規模言語モデル(MLLM)本モデルは、テキストエンコーダーとしてデコーダーのみの構造を持つMLLMを採用することで、入力画像の意味内容を理解する能力を大幅に向上させています。従来のCLIPやT5モデルと比較して、MLLMは画像の詳細描写や複雑な推論において優れた性能を発揮し、画像とテキストによる記述情報のより効果的な深層融合を可能にします。
  • 3D変分オートエンコーダー(3D VAE)HunyuanVideo-I2Vは、動画および画像データを効率的に処理するために、CausalConv3D技術を用いて3D VAEを学習させ、ピクセル空間における動画と画像をコンパクトな潜在空間に圧縮します。この設計により、後続モデルにおけるトークン数が大幅に削減され、元の解像度とフレームレートでの学習が可能になります。
  • 2ストリームから1ストリームへの変換のためのハイブリッドモデル設計デュアルストリームフェーズでは、ビデオトークンとテキストトークンは相互干渉を避けるため、複数のTransformerブロックを通して独立して処理されます。シングルストリームフェーズでは、ビデオトークンとテキストトークンが連結され、マルチモーダルな情報融合が実現されます。この設計により、視覚情報と意味情報間の複雑な相互作用が捉えられ、生成されるビデオの一貫性と意味的な整合性が向上します。
  • 段階的なトレーニング戦略このモデルは、低解像度の短い動画から高解像度の長い動画へと段階的に移行する、漸進的な学習戦略を採用しています。これにより、モデルの収束速度が向上し、さまざまな解像度で高品質な動画が生成されることが保証されます。
  • プロンプト単語書き換えモデルユーザープロンプトの言語スタイルや長さが多様であるという問題に対処するため、HunyuanVideo-I2Vはプロンプト書き換えモジュールを導入しました。このモジュールは、ユーザーが入力したプロンプトをモデルが理解しやすい形式に変換することで、生成結果を改善します。
  • カスタマイズ可能なLoRAトレーニングこのモデルはLoRA(低ランク適応)トレーニングをサポートしており、開発者は少量のデータを使用して、「毛髪の成長」や「人間の動き」といった特定の効果を持つ動画生成モデルをトレーニングできます。

渾源土生ビデオのプロジェクトアドレス

Hunyuan Image Generation Videoの使い方

  • Hunyuan AI Videoの公式サイトで体験してみてください。ユーザーは直接アクセスできますテンセント渾源AI動画公式サイト「画像から動画へ」を選択し、画像をアップロードして簡単な説明を入力すると、5秒間の短い動画が生成されます。
  • Tencent Cloud APIを使用する企業や開発者は、Tencent Cloudを通じてAPIインターフェースを申請することで、より効率的な動画生成やカスタマイズされた開発を実現できます。
  • オープンソースモデルのローカル展開より高度なカスタマイズを必要とするユーザー向けに、テンセントのHunyuan画像生成ビデオモデルがGitHubでオープンソース化され、ローカル展開とカスタマイズ開発をサポートしています。
  • ハードウェア要件
    • GPUNVIDIA製グラフィックカード、CUDA対応、最低60GBのビデオメモリ(720pビデオ生成用)、推奨80GBのビデオメモリ。
    • オペレーティング·システムLinux(公式テスト環境)。
    • CUDAバージョンCUDA 11.8または12.0をお勧めします。

Hunyuan画像生成ビデオの応用シナリオ

  • クリエイティブなビデオ制作画像と説明文をアップロードして、短い動画を作成します。
  • 特殊効果制作LoRAトレーニングを通じて、毛髪の成長やキャラクターの動きといった、カスタマイズされた特殊効果を実現できます。
  • アニメーションとゲーム開発キャラクターアニメーションを迅速に生成し、制作コストを削減します。