AB
AiBoss
チュートリアル

Tencent Hunyuan動画生成モデルの使い方:実地テスト

Tencentがついに独自のAI動画プラットフォーム「渾源動画モデル」をリリースしました。先日、渾源動画モデルの社内テストに参加する機会をいただき、週末の2日間、朝から晩まで作業を続け、300本以上の動画を完成させました。これまでの私の結論は…

如何使用腾讯混元视频生成模型,一手实测

01 テンセントは準備完了

テンセントはついに独自のサービスを開始しました...AI動画あり —複合要素ビデオモデル」。

先日、Hunyuanの動画モデルの内部テストに参加するよう招待されました。週末の2日間、朝から晩まで休みなく作業し、合計300本以上の動画を制作しました。

まず結論を述べます。Tencent(Vincent Video、5s)が最初に提供したバージョンとしては、全体的な品質は非常に高い。コマンドの準拠性、ダイナミクスと画像の安定性、カメラ言語、リアルな質感、物理的な準拠性彼らは様々な面で優れたパフォーマンスを発揮した。ガチャを引くのは稀だ。

たとえ一部のカメラの切り替え、モーションエフェクト、SF/ファンタジー風、抽象的な理解他の分野でも、嬉しい驚きがいくつかあった。

ぜひ動画をご覧ください。

体験パス:テンセント元宝APP -AI応用-AIビデオ。

02 10種類のスタイルと30ケースの実地テスト

混合ソース動画モデルの品質を体系的にテストするために、プロのベンチマークほど体系的ではありませんが、個人的に重要で頻繁に使用されるスタイルやシーンに基づいて10のセクションに分けました。

これらの10のスタイルは次のとおりです。クローズアップ、リアリズム、人物、動物、SF、特殊効果、アニメーション、芸術/抽象、動き、複数人シーン/大規模シーン/マルチカメラショット

各スタイルにつき3~5点のデザインを作成してください。プロンプトワード渾源に評価用の動画を作成させよう。

プロンプトワードその一部については、まずアイデアを思いつき、それを一文で説明し、それから...AI文章の最適化と加筆にご協力ください。AI最適化済みプロンプトワードさらにいくつかの修正を加えた後、モデルに送信して実行できる状態になるはずです。

プロンプトワードこのフレームワークは一般的にこれらのテンプレートに依存している。

  • テンプレート1:プロンプトワード=主要被写体 + シーン + 動き
  • テンプレート2:プロンプトワード=被写体(被写体の説明)+シーン(シーンの説明)+動き(動作の説明)+(カメラ言語)+(雰囲気の説明)+(スタイル表現)
  • テンプレート3:プロンプトワード=被写体 + シーン + 動き + (スタイル表現) + (雰囲気描写) + (カメラワーク) + (照明) + (ショットサイズ)

主な焦点 主題+場面+動き 以上です。他の部分をどのように説明すればよいか分からない場合は、バックエンドで用意されているタグを使用して選択することもできます。

それでは早速、動作ケースを見ていきましょう。

追伸:すべてのケースは私自身がテストしたものであり、公式のデモは含まれていません。

リアリズムは、ビデオモデルにおいてほぼ必須のテスト項目と言えるでしょう。主な焦点は、モデルが様々なシーン、キャラクターの表情、動き、質感のディテール、照明の変化をどれだけ忠実に再現できるか、そしてそれらが現実世界とどれだけ整合性が取れているかを確認することです。

1) キツツキが木に穴を掘っている様子を、リアルなタッチで描いています。

2) 漢服(伝統的な漢民族の衣服)を着た美しい中国人女性が、風になびく髪をなびかせている。カメラは彼女の顔のクローズアップに切り替わる。背景は張家界である。

3)赤いスカーフを巻いたペンギンが、花の海を散歩している。赤いスカーフは花の色と鮮やかなコントラストを成している。背景には、風に揺れる花の海、舞い散る花びら、そして朝露がキラキラと輝いている。

4) 超望遠レンズでパンニング撮影、工業用廃工場、壊れた天窓から差し込む自然光。

クローズアップは、ビデオモデルが得意とするスタイルです。モデル間の競争の鍵は、物体の動き、人物の体の動き、表情、画質といった細部をいかに表現できるかにあります。

優れたクローズアップショットは、観客を主人公に容易に近づけ、まるでその場にいるかのような感覚を与えることができる。

5)一人の男が恐怖に震えながら遠くを見つめている。背景には燃え上がり爆発する都市が広がっている。カメラは男の顔に焦点を合わせ、彼の恐怖に満ちた表情を捉えている。

6)カメラがゆっくりとズームインする。背景には小さくて居心地の良いリビングルームがあり、若い女性がソファに座って読書に没頭している。コーヒーテーブルの上には湯気の立つティーカップが置かれている。

7) 奇妙で恐ろしい古代生物が泥の中を這っている。

人物モデルの場合、主な焦点は、肌の色、体の動き、表情、服装をビデオモデルがどれだけリアルに表現しているかという点にあります。これらは、私たち人間が最も容易に識別できる要素でもあるからです。AI現実の場所と、偽物の場所。

しかし、テキストベースの動画は人物描写にはあまり効果的ではありません。より安定した、リアルで一貫性のある人物描写を実現するには、一般的に画像ベースの動画を作成する必要があります。

8) 小さな男の子が熱心に積み木を組み立てている。

9) 小さな女の子が風船を持ってゆっくりと前に走っています。

10) ある男性がソファに座ってテレビを見ていたところ、頭に手を当ててとても驚いた様子だった。

様々な企業のビデオモデルは、人間の被写体と比較すると、動物の被写体でははるかに優れた性能を発揮します。ただし、これは動物が単に画像を拡大縮小するのではなく、「大胆に」動く場合に限ります。

私が複数の事例で試用した経験に基づくと、Hunyuanのビデオモデルは動物の描写において非常に優れており、まるでドキュメンタリーのようです。

11) アフリカのサバンナで、チーターがアンテロープを追いかけて高速で走っている。

12) 大興安嶺山脈で、雪に覆われた森を背景に、虎が高速で走っている。

13) カササギが紫禁城の赤い壁の前にある木の枝で餌を探している。

(5)SF、ファンタジー、玄幻

SF、ファンタジー、その他のファンタジージャンルが、多くの人々を惹きつけてそれらを利用する理由となっている。AI動画を作る主な理由の一つは、もちろん私自身のためです。

特にファンタジースタイルでは、ビデオモデルのデータセットと汎化能力(モデルが新しい未知のデータに対して動作する能力)をテストし、光と影の変化、色の変化、変形効果、モーション効果など、ファンタジーシーンを表示できるかどうかを検証します。

このセクションには最も多くの事例が掲載されています。動画から画像への変換時の圧縮を考慮し、一部の事例については元の動画も掲載しています。

14) 宇宙船が小惑星帯を通過している。

15) 宇宙船が色とりどりの光に囲まれながら、タイムトンネルを通過している。

16)2体の巨大ロボットが都市で激しい戦闘を繰り広げている。衝突するたびに巨大な衝撃波が発生し、近くの建物が粉々に砕け散る。

17) 薄暗い廊下で、海兵隊の兵士が廃墟となった廊下を歩いている。

18)霞んだ雲の中に暗い雲が集まり、稲妻が走り、雷鳴が轟いた。突然、巨大な竜が雲を突き破って現れ、彼らに向かって突進してきた。

この想像からすると、渾源は『ゲーム・オブ・スローンズ』を何度も「観た」に違いない。

特撮Special Effects特殊効果は映画やテレビにおいて最も重要な視覚芸術であり、一般的な特殊効果には爆発、煙、炎、高速移動などが含まれる。

特殊効果ショットは、主にビデオモデルの一般化能力をテストするものであり、モデルが指示にどれだけ従うか、そして細部を表現する能力を検証する。

19) 吹雪の中、蒸気機関車が険しい山々を走り抜け、機関車からは黒煙がまっすぐ空に向かって立ち上り、客車は白い雪の上に深い轍を残していく。

20)老朽化した倉庫内で突然爆発が起きた。

21) 霧深い夜、明るい月明かりの下、中世の帆船が不気味な雰囲気に満ちた海を航行している。

22)色鮮やかなクラゲが海底を自由に泳ぎ回ります。その体は青、紫、ピンクなど透明で、水中で魅惑的な光を放ちます。

アニメーションにおいては、2D、3D、ベクター、クレイ、水墨画、宮崎駿、ディズニーなど、様々なスタイルや美学に対応できるモデルであることが主な考慮事項となります。

まず第一にSoraプロンプトワード

23)Animated scene features a close-up of a short fluffy monster kneeling beside a melting red candle. The art style is 3D and realistic, with a focus on lighting and texture. The mood of the painting is one of wonder and curiosity, as the monster gazes at the flame with wide eyes and open mouth. Its pose and expression convey a sense of innocence and playfulness, as if it is exploring the world around it for the first time. The use of warm colors and dramatic lighting further enhances the cozy atmosphere of the image.

宮崎駿監督の作風を見ていきましょう。

24)幻想的な庭園が目の前に現れる。庭園には、形も色も個性豊かな、あらゆる種類の珍しい花や植物が咲き誇っている。色鮮やかな服を着た、元気いっぱいで愛らしい小さな妖精たちが、花や植物の間を駆け回り、戯れている。ジブリのアニメーションスタイルは、まるで宮崎駿監督が創り出した夢の世界に足を踏み入れたかのような感覚を与えてくれる。

(8)芸術/抽象

このアートスタイルは主に、ビデオモデルのグラフィック、空間、色彩、力の変化に対する抽象的な理解力をテストするものです。いくつかのケースを試してみたところ、Hunyuanが抽象的なアートビデオも制作できることに驚きました。

25) 粒子は回転し、抽象的な形に収束する。

26) さまざまな色が不規則な形を形成し、それがゆっくりと回転します。

27)5度の角度で固定されたカメラが、浅い被写界深度と焦点で、紫がかった赤色のネオンライトとシアンのホログラフィック投影を織り交ぜて映し出す。スクリーンの中央では、前衛的な衣装をまとった機械仕掛けのダンサーが両腕を広げ、観客に感謝の意を表している。

動きは、最も難易度が高いため、ビデオモデリングの最高峰と考えられています。

現実世界の物理法則に合致する動画を生成するには、空間的な関係性を理解し、力の変化や様々な物体の形状を処理し、様々な物体や動きの意味を理解するための高度な技術的専門知識がモデルに必要となる。そうして初めて、物理法則に従う動画を生成できるのである。

28)夕暮れ時、オフロードコースを改造したフォードF-150ラプターが轟音を立てて走り去った。車高を上げたサスペンションのおかげで、巨大なランフラットタイヤは泥の上を激しく転がり、ロールケージに泥を飛び散らせ、まだら模様を作り出した。ボディのデカールは黄金色の太陽の光にきらめき、スーパーチャージャーの轟音と排気音の雷鳴が混じり合った。

29)スローモーションで、稲妻を伴う雷雨の中、颯爽とした中国の剣士が雨の中で剣術の練習をしている様子が映し出される。背景は竹林である。

30) オフロード車が険しい山腹を走っていると、遠くに見える貢嘎雪山がゆっくりと姿を現し、視界の中で徐々に鮮明になっていった。

(10)複数人シーン/大規模シーン/マルチカメラ撮影

複数人が登場するシーンでは、複数のキャラクターの動きを調整する必要があり、計算能力の問題が生じます。現在、Gen3やKelingなど、多くのビデオモデルがクラッシュする傾向があります。Hunyuanのパフォーマンスを見てみましょう。

31)カメラは騎手の歩調のクローズアップからゆっくりと上昇し、やがて彼の顔に焦点を合わせる。彼は決意に満ちた表情で前を見つめている。背景には中世の戦場が広がり、二つの軍隊が激突し、兵士と馬が倒れている。

32) 人々がキャンプファイヤーを囲んで座り、おしゃべりしたり笑ったりしていた。

10種類のスタイルカテゴリーすべてをテストしたので、まとめてみましょう。

1) 命令の混合要素モデル(すなわち)プロンプトワード(比較的安定している。)その後の設計ではプロンプトワード画像を作成する際は、視覚的な論理性を強く意識し、明確な指示を与えることを推奨します。また、修飾語や主題語を過剰に詰め込むことは避けてください。

そうしないと、モデルの注意機構、つまりモデルのDiTアーキテクチャにおけるT、Transformer、自己注意機構に干渉してしまう。

2) 優れたダイナミック性能と画像安定性。私がテストした300本以上の動画のうち、確かにいくつか不具合はありましたが、PowerPointプレゼンテーションのズームインやズームアウトに関するものは一つもありませんでした。すべて通常の動作を通常の速度で行ったもので、スローモーション映像やPowerPointのアニメーションはごくわずかでした。

3)カメラ用語を十分に理解していること。ショットとフレーミングを指定すれば、モデルはそれに厳密に従います。指定がない場合は、モデルは…プロンプトワード時には、クリエイティブな撮影デザインが驚くほど効果的な場合もある。

例えば、これは本当に素晴らしいですね。

プロンプトワード巨大な波が押し寄せ、サーファーたちは飛び跳ね、宙返りを披露する。カメラは波の中から現れ、水を通して差し込む太陽の光を捉える。水しぶきは空中に完璧な弧を描き、サーフボードは水面を切り裂きながら軌跡を残す。最後のショットは、サーファーが水のカーテンをくぐり抜ける完璧な瞬間を捉える。

4) 5秒動画内のショットを切り替えることもできます。一部の地域ではプロンプトワードシナリオ(通常は長い)プロンプトワードわずか5秒の動画でも、複合要素モデルはこれを実現できる。自動映像をカットする。カットした後でも、被写体の一貫性を維持することは可能である。

5) SF、ファンタジー、リアリスティック・ドキュメンタリー、特殊効果、スポーツといったジャンルに優れており、映画製作における成功率が高い。特にファンタジー風のスタイルは、『ゲーム・オブ・スローンズ』を彷彿とさせる雰囲気があり、これはテンセント独自の動画データセットと関連している可能性が高い。

6) カードを引く回数が少ない。指示が明確であれば、一度で満足のいく動画を作成できる場合もあります。最悪の場合でも、3~5回作成すれば通常は満足のいく動画が得られます。

7)できる限りシャオバイの面倒を見てあげてください。入力ボックスのインターフェースでは、スタイル、ショットサイズ、照明、カメラの動き、複数のモード(スムーズなカメラの動き、リッチな動き、ディレクターモード)を選択できるため、初心者でも簡単に操作できます。速いさあ、始めましょう。

これらのタグを過小評価しないでください。私のテストでは、これらのタグは動画の品質、特に映像スタイルとカメラワークの面で非常に役立ちました。

もちろん、テスト中にいくつかの欠点も発見された。

1) 一般化能力を向上させる必要がある。馴染みのない、難解な、あるいは訓練を受けていない記述用語(主題、場面、行動など)は、混合モデルアプローチでは認識できないため、モデルの創造性にある程度影響を与える。

2) 画質の改善が必要現状では720P(本当に720Pです)しか対応していません。高画質モードはありますが、プロのクリエイターにとっては十分とは言えません。

3) 地元の人物に対する理解を深める必要がある。もしプロンプトワードこのモデルは「アジア人」を指定していないため、通常はヨーロッパ人を基に生成されます。もちろん、テキストベースの動画は主題の一貫性を保つのに適していません。一貫性を向上させるには、画像ベースの動画が登場するのを待つ必要があります。さらに、このモデルは感情を伝える能力がやや劣ります。

03 結論

3日間連続でテストを行った結果、私の意見では、初期モデルとしては、Hunyuanの全体的な品質は非常に高く、多くの初期バージョンのビデオモデルを凌駕している。

渾源大学の学生数名に話を聞いたところ、彼らは以下の分野におけるイノベーションがその理由だと述べていました。

  • テキストエンコーダーとして新世代の言語モデルを使用することで、より高度な意味理解能力と画像表現能力を実現しています。
  • このプロセス全体は、時空間モジュールではなく、完全な注意機構を使用しているため、ビデオの各フレーム間の遷移がよりスムーズになります。
  • 独自開発の画像・動画ハイブリッドVAE(3D変分エンコーダ)を用いることで、顔、指、高速撮影などの細部を表現するモデルの能力が向上した。

さらに重要なことに、テンセントはこのモデルの見直しを行うと発表した。オープンソース!!

今後は、個人であれ企業であれ…すべての開発者はHugging FaceGitHubでも無料このモデルは既に使用されています。

すごい、本当にすごい!130億ものパラメータを持つモデル…オープンソースすぐにオープンソースモデルの重み、推論コード、モデルアルゴリズムを含む完全なモデルが公開されます。

ビデオモデルは技術的に最も難易度が高いことを知っておくことが重要です。そして...オープンソース、できるオープンソースラマ(「玄極」の制作者)が立ち上げたビデオモデルであるMovie Genなど、ごく少数の企業が存在する。彼らは…するつもりはないようだ。オープンソース

Hunyuanの動画モデルがすぐに公開されましたオープンソースそれは素晴らしい。まさに精神であり、ビジョンだ。これまでのところ、彼らはすでに…オープンソーステキスト間変換、テキストから画像への変換、3D生成、最新の文生の動画。

この記事で紹介されているツール

テンセント・フンユアン・ウェンシェンのビデオ: