project
Vidu Q1 - Shengshu Technology社が発売した、高度な制御が可能な大型ビデオモデル
Vidu Q1は、清華大学人工知能研究所副所長であり、盛舒科技の創設者兼チーフサイエンティストである朱軍教授率いるチームによって開発された、高度な制御が可能なビデオモデルです。繊細な画質と豊かなディテールを備えた1080pの高解像度ビデオの生成をサポートします。
Vidu Q1とは何ですか?
Vidu Q1は、清華大学人工知能研究所副所長で盛舒科技の創設者兼チーフサイエンティストである朱軍教授のチームが開発した、高度に制御可能なビデオモデルです。1080pの高解像度ビデオを、優れた画質と豊富なディテールで生成でき、5秒間のビデオ生成要件を満たします。改良された最初と最後のフレーム機能により、わずか2枚の画像で映画レベルの自然なカメラワークを生成できます。Vidu Q1は、正確なサウンドエフェクト制御機能を備えており、タイムライン上でサウンドエフェクトの種類と持続時間を注釈付けでき、同期精度は±0.1秒に達します。このモデルは、複数の被写体の詳細の制御性を最適化しており、参照画像とテキストコマンドをアップロードすることで、ビデオ内の被写体の位置、サイズ、および動きの軌跡を正確に調整できます。ぼやけた領域に対して局所的な超解像再構成を実行でき、4Kビデオを8倍に拡大してもピクセル化された外観を維持します。 Vidu Q1は、権威ある海外の動画生成ベンチマークであるVBench-1.0とVBench-2.0において、それぞれ87.41%と60.98%のスコアを獲得し、RunwayやOpenAI Soraといったモデルを凌駕しました。また、国内の画像ベース動画ランキングであるSuperCLUEにおいても、アニメスタイルで63.52、リアルスタイルで67.78のスコアを獲得し、両リストでトップに立ちました。
Vidu Q1の主な機能
- 高精細な画質と解像度繊細な画質とリアルなディテールを備えた1080pの高解像度ビデオの生成をサポートしています。
- 最初と最後のフレームの機能ユーザーは2枚の画像をアップロードするだけで、映画のようなカメラワーク効果を生成でき、最初のフレームと最後のフレーム間のスムーズで自然な遷移、そしてより「映画的」なビジュアルスタイルを実現できます。
- 効果音生成新たに追加された「一文で効果音を生成」機能は、プロンプトに基づいてBGMや効果音を生成できます。各音声セグメントのタイミングを細かく制御でき、セグメントごとに制御して自由に重ね合わせることができ、音と映像を完璧に同期させることができます。
- 極めて「高品質」なスタイルアニメのスタイルはより安定していて滑らかであり、キャラクターの動きや感情表現がより効果的である。
- ビデオ品質と意味的一貫性VBench-1.0におけるビデオ品質と意味的一貫性に関して、Vidu Q1は最先端技術(SOTA)レベルに達しており、生成されたビデオは表面的なリアリズムと本質的な信憑性の両面で優れた性能を発揮します。
- 常識的な推論と物理的な理解VBench-2.0の常識的推論と物理法則理解の両面において、Vidu Q1は優れた性能を発揮し、卓越した理解力と生成能力を示した。
- 主要属性を正確に調整するユーザーは参照画像とテキストコマンドをアップロードして、動画内の任意のキャラクターやオブジェクトを選択し、その位置(座標軸の位置)、サイズ(パーセンテージによる拡大縮小)、動きの軌跡(カスタムパス曲線)、および動作の詳細(「手を15度上げる」や「瞬きの頻度を2秒/回」など)を正確に調整できます。実際のテストでは、同じコマンドで10本の動画を生成した場合、キャラクターのずれの誤差は5ピクセル未満であることが示されています。一方、従来のモデルでは通常200ピクセルを超える誤差が生じます。
- 複数被験者の一貫性複数の被写体が登場するシナリオにおいて、Vidu Q1は被写体間の整合性を維持し、ビデオ内の複数のキャラクターやオブジェクトの動作と位置が協調的かつ統一的に行われるようにします。これは、アニメーションや短編映画など、複雑な複数被写体のビデオコンテンツを制作する上で非常に重要です。
- 効果音タイムラインコントロールユーザーは、タイムライン上で効果音の種類と持続時間をマークできます。例えば、風の音(強度70%)を0:00から0:03秒に設定したり、ガラスが割れる音(左チャンネル優先)を0:04から0:05秒に設定したりできます。Vidu Q1の効果音同期精度は±0.1秒に達し、従来のAI効果音のランダムマッチングと比較して、動画の没入感と魅力を大幅に向上させます。
- 局所超解像再構成ぼやけた部分には局所的な超解像再構成処理が施されており、4K動画は8倍に拡大してもピクセルが目立ちます。ユーザーは、光と影の強度、素材の質感、被写界深度のぼかしなどを手動で調整することで、動画の画質をさらに向上させることができます。
Vidu Q1の技術的原理
- 技術アーキテクチャVidu Q1は、拡散モデルとU-ViTアーキテクチャに基づいて開発されています。U-ViTは、Transformerのスケーラビリティと長尺シーケンスのモデリング能力を組み合わせることで、最大16秒の1080p動画を処理できます。このモデルは、ビデオオートエンコーダーによって動画の空間的および時間的次元を削減し、効率的な学習と推論を実現します。
- マルチモーダル融合Vidu Q1は、テキスト、画像、動画など、複数のモダリティからの情報を統合し、柔軟で多様な入力を通じて、様々な角度、被写体、要素から一貫性のある動画生成を可能にします。これにより、Vidu Q1は高い一貫性とダイナミズムを備えた動画を生成できます。
- 自動生成と注釈大規模なビデオ学習データのラベリングという課題に対処するため、Vidu Q1は高性能なビデオタイトル生成器を用いて学習ビデオに自動的にラベル付けを行います。推論時には、ユーザー入力をモデルに適した形式に書き換えるためのタイトル変更技術が適用されます。
- 制御可能なビデオ生成の拡張Vidu Q1は、エッジ検出に基づく動画生成、動画予測、被写体主導型生成など、その他の制御された動画生成実験にも使用されました。これらの実験により、Vidu Q1が様々な応用シナリオにおいて大きな可能性を秘めていることが実証されました。
Vidu Q1プロジェクトの住所
- APIアドレス:platform.vidu.cn
Vidu第1四半期レビュー結果
- Vidu Q1は、権威ある海外の動画生成評価リストであるVBench LeaderboardのVBench-1.0とVBench-2.0のリストでトップに立ち、Runway、Sora、LumaAIなどの国内外の動画生成モデルをそれぞれ87.41%と60.98%の総合スコアで上回り、テキスト動画生成トラックで1位を獲得しました。
- VBench-1.0ではビデオ品質や意味的一貫性といった包括的な側面においてSOTA(最先端)レベルを達成し、VBench-2.0では常識的推論や物理理解において優れた性能を発揮する。
- VBench 2.0の評価において、Vidu Q1は常識的推論と物理法則理解の両方で1位を獲得し、優れた理解力と生成能力を実証しました。
- 国内有数の総合大規模モデルテストベンチマークであるSuperCLUEが発表した画像ベース動画ランキングにおいて、Vidu Q1はアニメーションスタイル(63.52)とリアルスタイル(67.78)の両方で1位を獲得し、特定の用途における強力かつ安定した画像ベース動画撮影能力を実証しました。
Vidu Q1の使い方
- 登録とログインViduの公式サイトにアクセスし、登録またはログインをクリックしてください。
- モデル選択左上隅にあるVidu Q1モデルを選択してください。
- 文生ビデオ生成したいコンテンツの説明文を入力し、パーソナライズされた設定を行ってください。1080p解像度を試すこともできます。
- 画像と動画画像と最終フレームの参照画像をアップロードし、生成したいコンテンツの説明を入力してください。その後、1080p解像度を選択するなど、設定をカスタマイズできます。
- 参考動画Vidu Q1モデルは現在サポート対象外です。代わりに2.0モデルをご利用ください。
- 動画を作成する設定が完了したら、「作成」をクリックして生成されたビデオを取得し、調整を行ってください。
Vidu Q1の応用シナリオ
- 映画およびテレビ制作Vidu Q1は、高品質なビデオコンテンツを迅速に生成できるため、制作サイクルを大幅に短縮し、コストを削減できます。マルチカメラ生成機能と時空間の一貫性制御機能により、特殊効果制作やシーン編集が容易になります。
- 広告Vidu Q1は、多様なスタイルやテーマの動画広告を迅速に生成し、様々なクライアントのニーズに対応できます。ユーザーの興味や行動データに基づいた正確なターゲティングとパーソナライズされたレコメンデーションを実現し、広告のコンバージョン率と効果を向上させます。
- アニメーション制作Vidu Q1の複数被写体の一貫性制御機能は、アニメーション制作において非常に価値が高く、異なる視点からのキャラクターのディテールの一貫性を確保し、アニメーターの作業負荷を軽減します。