project
Vidu Q3 - Shengshu Technologyが発表した、音声と映像を同期させたAIビデオモデル
Vidu Q3は、Shengshu Technology社が発表した、音声と映像が同期した世界初の16秒AI動画モデルです。短編ドラマ、漫画、CMなどの物語性のあるシナリオ向けに特化して設計されています。たった1つの指示だけで、映像、セリフ、環境を完璧に捉えた16秒の1080p動画を制作できます。
Vidu Q3とは何ですか?
Shengshu Technologyが発表したVidu Q3は、音声と映像が同期した世界初の16秒AIビデオモデルで、短編ドラマ、漫画、CMなどの物語性のあるシナリオ向けに特別に設計されています。1つのプロンプトで16秒の1080pビデオを直接出力でき、映像、セリフ、環境音、BGMと完璧に同期するため、ポストプロダクションは不要です。このモデルには「監督の頭脳」が内蔵されており、ロングショット、ミディアムショット、クローズアップを自動または手動で切り替えて複雑なトランジションを実現します。画面上に中国語、英語、日本語のテキストを直接レンダリングし、道路標識や字幕を鮮明かつ読みやすく表示します。また、複数人による会話では、口の動きと声をキャラクターと同期させ、3つの言語に対応しています。公式には、人工知能分析ランキングで中国国内1位、世界2位にランクインし、Runway Gen-4.5、Google Veo 3.1、Sora 2を上回っています。現在、ウェブサイトvidu.cnおよびAPIプラットフォームを通じて利用可能です。
Vidu Q3の主な機能
-
16秒間の音声および映像出力映像、セリフ、環境音、BGMがすべて完全に同期した16秒間の1080p動画を一度に生成し、ポストプロダクション作業は一切不要です。
-
監督レベルのショットロングショット/ミディアムショット/クローズアップ間の自動または手動切り替え、単一ショット内でのマルチカメラトランジションの完了、リズムと感情の同期。
-
多言語テキストレンダリング中国語、英語、日本語のテキストが画面に直接埋め込まれているため、道路標識、字幕、製品パッケージなどが鮮明に読み取れる。
-
複数人による対話の同期このシステムは、複数のキャラクター間で唇の動き、声の音色、感情を同期させることが可能で、3つの言語での会話に対応し、キャラクターの外見に応じて声が変わる機能も備えています。
-
デュアルモード作成テキストベースと画像ベースの両方の音声および動画は、1秒から16秒までの任意の長さに対応し、解像度と動きの振幅をカスタマイズできます。
-
産業用インターフェースウェブサイトvidu.cnとAPIプラットフォームplatform.vidu.cnは同時に公開されており、従量課金制で大量生産にも対応しています。
Vidu Q3 の技術原則
-
U-ViTバックボーンアーキテクチャ従来のU-NetをTransformerに置き換えることで、長いスキップ接続が維持され、グローバルアテンションが16秒間のシーケンス全体を一度に「認識」できるようになります。エラーが時間とともに蓄積されることはなく、シーケンスの最初と最後との一貫性が確保されます。
-
ビデオ圧縮と分散トレーニングまず、16秒間の高解像度ビデオに対して時空間圧縮を行い、シーケンス長を短縮します。次に、独自開発の分散フレームワークと組み合わせることで、通信効率が2倍になり、メモリ使用量が80%削減され、トレーニング速度が累計で40倍向上し、1枚のカード上でエンドツーエンドの長尺ビデオの推論が可能になります。
-
マルチモーダル統一拡散U-ViTの同じノイズ空間で視覚、音声、テキストの領域を共同でトレーニングし、「1つのノイズ - 同時ノイズ除去」を実現します。画面フレーム、ダイアログ波形、環境音トラックは、後から継ぎ合わせるのではなく、同期して生成されます。
-
3D音声リップシンクロ音声合成では、3D VAST方式の音声合成を採用しており、まずキャラクターの唇の形状係数を予測し、次にそれを逆算して空間的な方向性を持つ対話や効果音を生成することで、複数の人物が話している場合でも唇の形状、音色、感情が一致するようにしています。
-
ショットスケジューリングアルゴリズム映画のショット構成理論から着想を得て、「ロングショット、ミディアムショット、クローズアップ」といったカメラ位置ラベルを条件付きベクトルとして符号化し、Transformerのクロスアテンション層に注入します。モデルは各ノイズ除去ステップ中に次のフレームのカメラ位置を動的に決定し、単一ショット内での自動切り替えを実現します。
-
ピクセルレベルのテキストレンダリングエンジン追加の「グリフ-ピクセル」アライメントモジュールがトレーニングされ、テキストベクトルの輪郭を事前マスクとして拡散プロセスに埋め込むことで、中国語/英語/日本語の文字が画像内のオブジェクトの表面に直接成長し、後処理テクスチャなしで明確に読み取れるようになります。
Vidu Q3の使い方
-
登録/ログインViduの公式サイトにアクセスし、携帯電話の認証コードで登録すると、新規ユーザーは無料ポイントを獲得でき、毎日チェックインすることでさらに多くのポイントを獲得できます。
-
作成モードを選択してくださいワークベンチの左側にある「AIビデオ」をクリックしてモードを選択します。
- Wensheng オーディオ/ビデオ (プレーンテキスト)
- 画像ベースの音声/動画アップロード(画像+テキスト)
- 参考動画(キャラクターを特定するための主要画像を1~7枚アップロードしてください)。
-
プロンプトとなる単語を書く(重要な手順):公式構成:シーン+被写体+アクション+ショット+感情+サウンド。
-
パラメータの設定
-
再生時間:4秒 / 8秒 / 16秒
-
解像度:540p | 720p | 1080p
-
可動範囲:小 - 中 - 大 - 自動
-
音声:同期された会話、環境音、BGMはすべて個別にオン/オフできます。
-
-
生成とプレビュー「作成」をクリックし、出力が生成されるまでお待ちください。完了したらオンラインでプレビューできます。満足できない場合は、プロンプトを変更して再度実行してください。4秒間のクリップは約30秒で作成されます。
-
ポストプロダクションでの微調整画質が十分でない場合は、「スマートウルトラHD」機能を使用してワンクリックでアップグレードできます。比較のためにシード値を変更したり、動きの振幅を調整して再度生成したりできます。。
-
エクスポート/ダウンロードプレビューページの「ダウンロード」をクリックすると、16秒間の1080p最終版(音声付き)を入手できます。また、ソーシャルメディアに直接共有することも可能です。
-
APIバッチ(オプション)開発者はplatform.vidu.cnにアクセスし、REST APIを選択してください。パラメータはWeb版と同じです。料金は1秒あたり0.07ドルからと低価格です。
Vidu Q3のアプリケーションシナリオ
-
短編ドラマと映画ワンクリックで16秒間の動画クリップを生成でき、絵コンテのプレビューやリズムチェックも可能なので、初期のビジュアライゼーションにかかるコストを「ライティングプロンプト」レベルまで削減できます。複数人による対話や感情の展開も一度に処理でき、「デジタル映画セット」として直接使用できます。
-
広告と電子商取引提案段階では、製品プレゼンテーションは話し手のスタイルに直接合わせられ、話し手の動作、話す速度、セールスポイントが同期されます。1枚の製品画像から複数のシナリオのデモンストレーションを生成できるため、A/Bテストの効率が10倍向上します。
-
セルフメディアアカウント猫と犬のトークショー、アニメラジオ、その他「ブレインストーミング」シリーズ。参考画像とジョークさえあれば、字幕、効果音、セリフ付きの完成品を数分で制作できます。編集部は一人で担当できます。
-
ミュージックビデオ静止画のカバー画像と歌詞のプロンプトから、シンクロした照明、口の動き、音色を備えた歌手の演奏シーンを直接生成し、バンドがサンプルビデオを撮影するためにスタジオを借りる必要性をなくします。
-
教育と科学の普及このコースは、5秒間の概念紹介と10秒間の要約で構成され、音声と字幕は自動的に同期されます。教師は講義ノートの作成に集中でき、映像はモデルによって一括して出力されます。
-
都市文化観光振興航空写真にテキストバナーやネオンの夜間字幕を組み合わせることで、道路を封鎖したりヘリコプターをレンタルしたりすることなく、一度に「シドニー・オペラハウス」や「パタヤビーチ」の縦長のショートビデオを作成できます。