AB
AiBoss
チュートリアル

Qianwenアプリを使って音声と動画を同期させる方法を、チュートリアルと例を交えて解説します。

最近、Qianwenアプリが再びアップデートされたことを知りました。今回は、クリエイティブ機能が大幅にアップグレードされ、RAW画像と編集済み画像の両方に対応した最新の画像モデル「Qwen-Image-Edit」に加え、Wan2.5の音声・動画機能も搭載されています。1枚の画像からナレーション付きの動画を生成することも可能です。

皆さん、最近、千文アプリが再びアップデートされたことを知りました。

これは、創造力の包括的な向上を意味し、以下を組み込んでいます。最新のイメージモデル Qwen-Image-Editは、RAW画像と編集済み画像の両方に対応しています。Wan2.5音声およびビデオ機能一枚の画像から、話したり歌ったり、正確な口の動きを再現できる高精細ビデオを生成できる。

編集の知識がない一般の人でも、すぐに完全なショートビデオコンテンツを作成できます。

ケース1:かわいいペットのポッドキャスト

Qianwenアプリを開き、チャットボックスに画像をアップロードして、入力します...プロンプトワード画像を直接編集できます。例えば、写真に写っている人物をかわいいペットに変えることができます。

プロンプトワード写真に写っている2人の司会者を、擬人化されたオレンジ色の猫と白いサモエド犬に置き換えてください。背景はそのままにしてください。

下の「AI「ライブビデオ」 - この画像を使用して、音声と映像が同期したビデオを直接生成できます。

プロンプトワードオレンジ色の猫とサモエド犬が登場するポッドキャストで、オレンジ色の猫が興奮気味に「毛が抜けすぎるって言うんだ」と不満を漏らす。サモエド犬は少し考えてから「私たちだって毛が抜けるよ。あいつだってほとんどハゲてるじゃないか!」と答える。そして二匹は顔を見合わせて大笑いする。

Wan2.5は、オレンジ色の猫とサモエド犬の画像を基に様々な音色を生成し、唇の動きと表情は完全に同期しています。主要な行は引用符で囲まれているため、生成精度が向上しています。

もう一度試してみましょう。完成品も箱から出したばかりの状態で届きます。

プロンプトワードオレンジ色の猫とサモエド犬が登場するポッドキャストで、サモエド犬が「今、飼い主が君を呼んでいるのが聞こえた?」と尋ねると、オレンジ色の猫は「聞こえないふりをしたんだ。そうすれば飼い主が僕の餌の缶を開けてくれると思ったから」と答えた。そう言うと、猫と犬は大笑いした。

以前は、このような短い動画を作るには、まず映像を作り、次にナレーションを加え、最後に口パクをする必要がありました。複数の人物が会話する動画は特に制作が困難でした。今では、たった…プロンプトワード明確に言うと、完全な動画は5分以内に制作できるため、効率が大幅に向上します。

ケース2:映画・テレビ業界の起業

プロンプトワード図1のキャラクターは、図2のポーズに変化する。

人物像の一貫性は非常によく保たれています。Qwen-Image-Editはポーズを変更しただけでなく、図2の人物像の特徴であるアクセサリーやタトゥーなども取り入れており、背景も違和感なく非常に自然に溶け込んでいます。

私たちは引き続き動画制作を行っています。

プロンプトワード写真の男性はステージ中央でフリースタイルでパフォーマンスを披露し、「ハーレムでの恨みや争いは、夕食後の私の気晴らしに過ぎない」と歌いながら、リズムに合わせて踊っている。

Wan2.5は中国語の歌詞とステージパフォーマンスをよく理解しており、彼のフリースタイルラップとリズミカルなドラムビートはどちらも素晴らしい。 AI 自動生成されたキャラクターの口の動き、動作、ラップのトーンはすべて一致しており、非常にまとまりのあるパフォーマンスとなっている。

マイクスタンドに小さな欠陥がありますが、全体の見た目には影響しません。

ケース3の解説ビデオ

プロンプトワード写真の主役は、教室の黒板に書かれた英単語を説明している英語教師のようです。彼女は「黒板に書いてある単語は『Rabbit』です。意味は『うさぎ』です。一緒に言ってみましょう、Rabbit」と言っています。

本体のナレーションと話し方のリズムは完全に同期しており、発音も非常に標準的なので、そのまま教材として使用できます。

また、子供向けの歌にアレンジして歌うこともできます。

プロンプトワード写真のメインの被写体は、英語の先生が教室でみんなに「うさぎの子」の童謡を歌わせている様子です。歌は「うさぎ、うさぎ、小さな白いうさぎ、長い耳、赤い目、白い毛、柔らかいお腹」です。

被験者が歌うとき、体と耳は自然に揺れ、表情も非常に自然である。

ケース4:歌とダンス

プロンプトワード子猫はくるくると回り、飛び跳ねながら、童謡のメロディーを歌います。「私は一番魔法の子猫」。

このモデルは漫画のキャラクターを認識する精度が非常に高い。声はやや子供っぽく、童謡のメロディーはモデルが独自に推測したもので、少々「耳障り」ではあるが、見ていて実に楽しい。

ケース5:パロディ動画

プロンプトワード画像には、猫が機械仕掛けの、フレームが崩れるようなダンスを踊っている様子が映し出されている。猫の足はぎこちなく不規則な動きで地面を素早く叩いている。非常にリズミカルなダンスに加えて、猫はメロディアスな語り口調で、軽いラップを交えながら歌う。「リラックスしてくつろいでいるべきだったのに、代わりに私は慌てふためき、よろめき、這いずり回り、嘘をついている。一体何で泣いているんだ?何で泣いているんだ、情けない奴だな」。全体的なスタイルは奇妙で、不条理で、耳に残る。

子猫の動きは非常にリズミカルで、首に巻かれたロープさえもリズムに合わせて揺れるという大きな利点があります。しかし、Wan2.5は元のメロディーを認識することはできませんが、リズムとスタイルに基づいてメロディーを推測することができ、抽象的で不条理で面白い動画を生成するのに非常に優れています。

事例6:兵馬俑の集団舞踊

プロンプトワード写真に写っている登場人物たちは全員、童謡を歌いながら、学校のラジオで流れるような体操を一斉に行っている。

歌詞は「1、2、3、4、腕を伸ばして。2、2、3、4、腰を曲げて。毎日の運動は健康に良い。一緒に朝の運動をしよう!」です。

この曲は童謡風のメロディーで、単純キャッチーで歌いやすく、声域が低いためグループでの歌唱に適しています。リズムは中速からやや遅めの4/4拍子で、ドラムの音は明瞭で安定しており、行進曲のリズムに近いものとなっています。各パートは動作指示と自然に連動しています。

動作には、手を上げる、伸ばす、腕を左右に振る、体を曲げる、胸を広げる運動などが含まれる。これらの動作は標準化され、機械的に一貫性があり、学校の体操を彷彿とさせる全体的な秩序感を醸し出している。すべてのキャラクターがゆっくりと同期して動き、学校の体操のような雰囲気を醸し出している。

グループの動きは非常にシンクロしており、童謡のリズムに合致していたため、全体的に非常に安定したパフォーマンスとなった。

明確なスタイルとリズムを取り入れました。プロンプトワードその後、リズム感が著しく向上し、生成される音楽は現在のシーン設定により合致するようになり、かなり制御しやすくなった。

今回の千文アプリのコアアップグレードは以下のとおりです。プロンプトワード相互理解が深まることで、グループの結束力がより良好に維持される。

生成された曲は単純テンプレートを使用する代わりに、 AI 音楽の理解があれば、映像の主要なリズムに合わせたメロディー、BGM、音色を生成することが可能になり、二次処理を必要とせずに、より調和のとれた完成度の高い映像を作り出すことができる。

現在、Qianwenアプリの音声・動画生成機能は、かなり成熟している。

AI 生成されたメロディーは、私たちがよく知っている曲ではないが、まさにこの違いゆえに、より愛らしく感じられ、抽象的なコンテンツやミームコンテンツで遊ぶという現在のトレンドに合致している。

による AI 反復のスピードから判断すると、今はまだ抽象化に取り組んでいる段階だが、しばらくすればQianwen Appは真の音楽マスターになるかもしれない。

さらに重要なのは、今回のQianwenアプリのアップグレードにより、ウェブ版にあったコンテンツ作成の中核機能がモバイル版にも搭載される点です。

以前は、音声と映像を同期させた動画を作成するには、多くの場合、コンピューターでの作業が必要でした。しかし今では、スマートフォンを手に取り、興味深い光景を目にしたり、アイデアが浮かんだりするだけで、Qianwenアプリを使って瞬時に完成度の高い動画を作成できます。

これはつまり、創作活動が日常生活の場面とより密接に結びつきつつあるということだ。通勤時間、ちょっとした空き時間、何気なく書き留めるインスピレーションなど、すべてが創作活動の入り口となり得る。

クリエイターの核となる価値は、制作能力から創造性そのものへとさらにシフトしている。