実地試験に基づくと、WAN2.5モデルは同期した音声と映像を生成できる。
2025年雲奇会議がついに開催されます!今年のテーマは「クラウドインテリジェンス統合・シリコンカーボン共生」。世界50カ国以上から2,000名を超える講演者が杭州に集結し、エージェントAIやフィジカルAIといった最先端のトピックについて議論を交わします。
2025年ユンキカンファレンスついにこの日がやってきました!今年のテーマは「クラウド・インテリジェンス統合・シリコン・カーボン共生」。世界50カ国以上から2,000名を超える講演者が杭州に集結し、議論を交わします。Agentic AI物理的に AI対話は最先端のテーマを巡って展開され、まるで科学技術の春節祝賀会を彷彿とさせる光景が繰り広げられた。
今朝も、アリババは依然として注目を集めていた。最新のの大型モデル—一般的な意味と無数の側面 Wan2.5プレビューシリーズモデル。
Wan2.5-Previewシリーズのモデルはネイティブスピーカーによる多感覚的な物語マルチモーダル建築テキスト、画像、動画、音声の処理機能が包括的に向上し、音声と映像が同期した動画を直接生成できるようになりました。
これらの技術革新は、アリババが基盤となるビジネスモデルに長期的に投資していること、そして産業応用と発展の推進に尽力していることを示している。大型モデルこれは生態系の拡大の現れである。
K-sisterもいち早く試す機会を得ました~ 次は実際のテスト結果を見ていきましょう。
Wan2.5は、画像生成と動画生成という2つの主要な機能を提供します。また、音声とプロンプト/画像を組み合わせた動画生成にも対応しています。。
私たちは、毎日使用するテキスト、画像、動画コンテンツだけで十分です。プロンプトワード基本的な要素に、人間の声、環境音、BGMなどの説明を加えることで、音声と映像が同期した完成度の高いビデオを作成できます。
最大動画生成時間は10秒で、解像度1080p、フレームレート24fpsの高解像度動画を生成できます。
公式サイト:https://tongyi.aliyun.com/wan/
それでは早速、実際のテストケースをいくつか見て、その感覚をつかんでみましょう。
ケース1:バラエティ番組の収録
プロンプト:バラエティ番組の収録現場では、ステージはリビングルーム風に装飾され、柔らかく温かい照明が当てられていた。2つのソファが観客の方を向いており、中央のコーヒーテーブルには飲み物や軽食が置かれていた。スタイリッシュなカジュアルウェアを着た若い男性アイドルがソファに座り、マイクを手に持って「魅力的なことは何も言いませんが、今この瞬間は魅力的です」と言った。観客は爆笑し、カメラは笑ったり拍手したりする他のゲストたちを映し出した。
この5秒間のクリップでは、Wan2.5...プロンプトワードデザインへの忠実度は非常に高く、リビングルームの雰囲気、温かみのある照明、コーヒーテーブルの上の飲み物やお菓子など、写真の細部まで非常に丁寧に描かれている。
登場人物たちの表情や口の動きは非常に自然で、特にカメラワークの際には、登場人物たちがゲストの方に身を乗り出すなど、今にもマイクを渡そうとしているかのような仕草を見せていた。
ケース2 屋外写真撮影
カタツムリの写真をアップロードしてください
プロンプト:雨の日、雨が草に激しく打ち付け、鈍い「シューッ」という音と、水滴が柔らかく跳ねる音が混じり合っていた。周囲の環境は開けていて、湿っていた。
濃い雨粒がカタツムリの殻に激しく打ち付け、大きな玉となって流れ落ちた。写真の情景から判断すると、Wan2.5は現実世界をかなりよく理解しているようだ。プロンプトワード周囲の音響効果も適切に生成され、音と映像の整合性は非常に良好だった。
ケース3 コンサート
私たちは楽曲の音声クリップをアップロードしました。
プロンプト:ステージ中央に立つ、息を呑むほど美しい女性歌手のクローズアップショット。彼女は心を込めて歌声を披露している。優雅なドレスを身にまとい、長い髪はそよ風に優しくなびき、ステージライトに照らされてさらに美しく輝いている。マイクをしっかりと握りしめ、力強く響き渡る歌声は、感情に満ち溢れている。
映像の照明と色彩は素晴らしく、特に髪の毛のハイライトは非常にダイナミックでリアルです。登場人物の口の動きも音声と非常によく合っています。
Wan2.5の音声と映像の同期は...単純登場人物の口の動きに加え、頭のわずかな揺れ、力を入れた時の首の筋肉の緊張、呼吸時の肩の収縮と上下動など、多くの細部が加えられています。これらのディテールによって、まるで実際にロケ撮影されたかのような、よりリアルな映像が生まれています。
ケース1:食品ビデオ
プロンプト:20歳くらいの女子大学生が、賑やかな屋台街に座り、箸で小さな豚の角煮をつまみ、ゆっくりと噛みながら、カメラに顔を近づけて「おいしい」と優しく言う。彼女の声は甘く、軽やかなトーンだ。背景には屋台街の喧騒が聞こえる。
Wan2.5とVeo3で生成されたビデオの品質はかなり良いのですが、Veo3にはバグがあるようで、ビデオ全体に音声がありません。
事例2:テレビの進化
指示:広角レンズを装着し、同じリビングルームを正面から撮影してください。画面中央にテレビを配置し、1950年代の白黒テレビから1970年代の木製キャビネット、1990年代のCRTモニター、2000年代の薄型テレビ、そして2020年代に至るまで、テレビの進化を一貫して捉えた画像を作成してください。知的 OLEDテレビ。家具、色、スタイルも時代とともに変化します。レトロな70年代、ミニマリストな90年代、モダンな2000年代、そして未来的な2020年代。
レンズ:35mmシネマレンズ、鮮明なディテール。
効果音:視覚的なノイズ、チャンネル切り替え音、リモコンのクリック音など、すべて時間の変化に合わせて同期されます。
多様なレベル:時代間のスムーズな移行
WAN2.5プロンプトワード忠実度ははるかに高く、テレビは常に画面の中央に配置され、中央構図が常に用いられるため、テーマがより直感的に理解できる。
インテリアデザインのスタイルに関して言えば、Wan2.5の各時代に大きな違いはないが、Veo3はこの点においてより優れている。
Wan2.5とVeo3はどちらも、複数の時代のテレビ番組のスタイルを再現しており、場面転換時に効果音を発する。
従来、動画制作では音声と映像が一致しないことが多く、異なるプラットフォーム間でナレーション、リップシンク、背景ノイズなどを追加する必要がありました。しかし今では、最小限の労力で…プロンプトワードこれにより、音声と映像が同期した完全なビデオが生成されます。
Wan2.5は、制作を「映像」と「音声」に直接結びつけます。ショートビデオ、バーチャルアンカー、さらには遠隔授業の制作に、複雑なポストプロダクションはもはや必要ありません。AI それは可能になるでしょうワンクリックこれは創作活動への参入障壁を大幅に下げる。
WAN2.5は、音のリズム、言語の意味、そして映像の動きを同時に同期させることができます。これは映像生成の進化であるだけでなく、未来への一歩でもあります。マルチモーダルAI成熟したアプリケーションに向けた重要な一歩。
広告、教育、映画、テレビ、ゲームといった分野はすべて、手作業による吹き替えやポストプロダクションに依存しており、これは費用と時間がかかる作業だった。WAN2.5は映像制作をプロダクションレベルのツールへと引き上げ、低コストで高品質なバーチャルコンテンツが爆発的に普及する可能性を秘めている。