Doubao音声生成モデル1.0テスト - 複数キャラクターの音声演技、ワンクリックでオーディオブック生成
こんなことにもイライラするかもしれません。AIが制作した大作映画は映像は驚くほど高画質ですが、登場人物が話し始めた途端、物語から一気に引き離されてしまうのです。そのシーンは明らかに生死を分ける状況なのに、ナレーションはまるで誰かが冷静に商品の説明を読み上げているように聞こえます…。
また、次のような問題にも悩まされるかもしれません: AI 生成された映像は優れた画質を備えているが、登場人物が話し始めた途端、視聴者はたちまち物語から引き離されてしまう。
シーンは明らかに生死を分ける状況を描いているにもかかわらず、ナレーションはまるで誰かが冷静に製品マニュアルを読み上げているかのようで、感情の起伏はただ大声で叫ぶことによってのみ表現されている…。さらに悪いことに、登場人物の声は場面ごとに全く異なり、一貫性を保つのが難しい。
さらに、環境音、効果音、BGM、リップシンクなども後から追加する必要があることを考えると…本当に面倒くさい。
先日開催されたVolcano Engine FORCEカンファレンスにおいて、ByteDanceは、豊かで感情豊かなサウンド素材をエンドツーエンドで生成できる「Doubao Audio Generation Model 1.0」を正式に発表した。
セグメントを入力しますプロンプトワードDoubao Audio Generation Model 1.0は、音声、効果音、BGM、シーンサウンドを一度にパッケージ化して生成できます。煩雑なマルチトラックミキシングや編集作業を不要にするだけでなく、実際の人が話す際の微妙な呼吸や感情の変化もシミュレートします。 AI その声はより自然で人間らしく聞こえる。。
実際のクリエイティブ作業において、その性能はどれほどのものなのでしょうか?今日は早速試してみましょう。
ボルケーノアーク体験センターをオープンし、斗澳オーディオ生成モデル1.0を選択すると、一般ユーザーは30分間のオーディオ体験ができます...無料試用期間のクレジット限度額は、後ほどAPI経由で確認できます。
私たちの投入効果プロンプトワード合成されたテキストを組み合わせて「生成」をクリックすると、人間の声と環境音を含む完全なオーディオクリップが生成されます。
ソロ声優
小説の登場人物の独白を作ろうと試みた。
背景音楽は、低音の弦楽器、遠くで響くドラムビート、そして幽玄な女性ボーカルをフィーチャーした、軽やかな土台を築いている。オープニングは、吹雪の前の静寂のように、陰鬱で重苦しい雰囲気だ。登場人物の感情が変化するにつれて、音楽は徐々に激しさを増していくが、決してボーカルをかき消すことはない。全体的な雰囲気は、苦境に立たされた孤独な人物から、そこから抜け出し、新たな道を切り開いていく人物へと変化していく。厳粛で、悲劇的で、抑制されつつも、強烈な力強さを秘めている。謝長安(若い女性の声。澄み切った透明感のある、落ち着いた、やや控えめな声だが、後半になるにつれて次第に決意と力強さを増していく)は、まるで民衆の視線の下で自らの道を切り開くかのように、静かに、そして抑制的に語る。「朝廷の貴族たちは皆、自分の命を大切にしている。だから、私のような取るに足らない者だけが行動を起こせる。私の道は万物の道であり、誰もが歩める道だ。困難があれば、必ず打破する方法がある。流れに身を任せるよりも、生き残るために戦う方が良い。もしかしたら、思いがけない第三の道に、より明るい未来が待っているかもしれない。」
最初は、澄んでいて優美な若い女性の声について書いていたのですが、声が柔らかすぎました。優美さはあったものの、力強さが欠けていたのです。その後、私は…プロンプトワードそれを、甘さや柔らかさ、少女らしさのない、若い女性のコントラルトの声に変えれば、主役女優の声に非常に近い効果が得られるでしょう。
同期して生成されるBGMも非常に力強く、登場人物の声や感情に非常によく合っている。
複数キャラクターの声優
性格が全く異なる2人のキャラクターが登場する、掛け合いパフォーマンスをアップロードしました。
背景音楽は非常に穏やかで、主に小劇場の冒頭の銅鑼と太鼓、そして短く切れ味の良い三弦楽器(三弦の撥弦楽器)が用いられています。冒頭には観客のわずかなざわめきが入り、活気がありながらもリラックスした、親しみやすい雰囲気を作り出しています。笑い声は控えめに、頻繁には入れず、セリフをかき消さないようにする必要があります。ボーカルは明瞭で目立つようにしなければなりません。
女性コメディアン(明るく澄んだ声で、北京訛りが少しあり、遊び心のある早口で流暢に話す若い女性。感情表現は豊かだが鋭くはない)は、まるで新しい道具を発見したかのように興奮して得意げに、「今、教えてあげましょう…」と言う。 AI ナレーションが素晴らしいです。スクリプトを入力しただけで、それを読み上げてくれました。
男性(深みのある響きのある声で、ゆっくりと落ち着いた口調で、かすかに皮肉と懐疑心を含んだ中年男性)は、冷静に、そして疑問を投げかけるように答えた。「これの何が新しいんだ?以前にも言ったじゃないか。」
女性コメディアン(若い女性の声で、甲高く誇張された、しかし可愛らしいトーンで)は、「以前はあれは話し声と呼ばれていましたか?以前はエレベーターのアナウンスと呼ばれていました。」と言った。
男性のストレートの男性(中年の男性の声で、少し間を置いて、真剣に冗談に答えている)は、「彼らはとても規律正しいですね」と言った。
女性コメディアン(若い女性の声)速い(それを受け止めて、彼は笑顔で)「規律はあるが、愛情は全くない」と言った。
異性愛者の男性(中年男性、くすくす笑いながら)は、「メインテーマは、すべての存在の平等です」と言う。
女性コメディアン(若い女性の声で、まだ興奮気味に早口で話している)は、「今は違います。子供向けの物語を語ってもらうと優しくなりますし、サスペンスに満ちた短編ドラマを語ってもらうと声を低くすることができます。強い女性主人公の物語を語ってもらうと、行き詰まりを打破するような感覚さえも表現できます」と語った。
異性愛者の男性(中年男性、疑わしげなふり)は、「では、クロストークをさせてみたらどうでしょう?」と言った。
女性コメディアン(若い女性の声で、少し間を置いてから真剣な口調で)は、「今まさにこの話をしているんじゃないですか?」と言った。
異性愛者の男性(中年男性で、反応が少し遅れた後、突然気づく)は、「じゃあ、僕も作られたのか?」と言う。
実際に2人で会話をテストしたところ、会話の自然さは通常の音声合成よりもはるかに優れていた。
ヒロインはテンポが速く、感情の起伏も非常に自然である一方、脇役の男性はよりゆっくりとした反応を示す。それぞれの声は非常に個性的で、声の一貫性も素晴らしい。
重要な点は、Doubao Audio Generation Model 1.0は、クロストークパフォーマンスにおける観客の笑い声を直接生成することができ、非常に自然であるということだ。
たった一文で、その場面に没入できる。AI 吹き替え作業の効率向上は明らかだ。
オーディオブックの長文テキスト
複雑なオーディオブックでは、複数の登場人物と環境音の連携が求められることが多い。そこで私たちは、複雑な古代風のサスペンスフルなアンサンブル作品に挑戦してみた。
背景音楽は控えめで、低音弦楽器、遠くで響くドラムの音、そして涼やかでまろやかな古琴の音色が、厳粛さ、冷たさ、そして抑圧感といった雰囲気を醸し出し、古代の政治的陰謀を彷彿とさせる。第一章では、宮殿の門と宮廷の場面を描写し、音楽は厳粛で緊張感に満ち、まるで街に降り注ぐ吹雪のようだ。第二章では、脇の広間での秘密の会合を描写し、音楽はさらに低く暗くなり、サスペンス感を添えている。環境音には、風や雪の音、宮殿の門の開閉音、衣服の擦れる音、広間の中の灯芯のパチパチという音、そして遠くから聞こえる衛兵の足音などが含まれる。声は明瞭で目立つようにし、音楽や環境音が会話をかき消さないようにしなければならない。ナレーター(大人の女性の声、深く安定した声、力強い物語性、中程度からゆっくりとしたペース、生き生きとしたサスペンスフルな声、放送調ではない)は、雪の夜に繰り広げられる宮廷の陰謀を語るかのように、冷静で抑制されている。沈兆雪(若い女性のメゾソプラノ、冷たく安定した低い声、胸腔に支えられ、明瞭な発音とすっきりとした語尾を持ち、甘くも柔らかくも少女っぽくもない)は、抑制的で冷静かつ鋭く、最初は怒りを抑えているが、徐々に決断力と支配力を露わにして膠着状態を打破する。蕭成(若い男性の声、深く冷たく、ゆっくりと抑制して話し、皇太子のよそよそしさと探るような態度を帯びている)は、何年も身を潜めて危険なナイフを試していた人物のように、慎重で落ち着いていて、抑圧されている。裴景志(中年の男性の声、低く冷たく、ゆっくりとした落ち着いた発音で話し、権力のある大臣の威圧的で監視的な存在感を漂わせている)は、朝廷を支配することに慣れている者が初めて制御不能な変数に遭遇したかのように、落ち着いていて傲慢で危険な雰囲気を漂わせている。若い皇帝(少年のような男性の声、やや未熟だが、毅然とした態度を取ろうとしており、緊張と不安のトーンがある)は、政治情勢に圧倒され、真実を知りたいと思いながらも、それを恐れている。周大臣(中年の男性の声、やや弱々しく、最初は落ち着いた話し方だが、次第に乱れる)は、罪悪感とパニックに陥り、平静を保とうと必死になっている。近衛隊長(成人男性の声、低く短く、従順で緊張したトーン)は厳粛で警戒している。若い宦官(若い男性の声、震え、不安定な呼吸)は恐怖に怯え、崩壊寸前で、生き残るために必死である。沈昭雪が都に到着したその日、北の国境から訃報が届いた。訃報にはこう記されていた。鎮北軍の穀物輸送官、沈昭雪は軍需物資の護衛中に盗賊に遭遇し、荷車と共に黒峡谷に転落、跡形もなく消え去った。しかし、夕暮れ時、彼女は色褪せた狐毛のコートをまとい、痩せた馬を引いて朱雀門の外に立っていた。門を守っていた近衛兵たちは、彼女の腰に半壊した青銅の雀符を見て、たちまち顔色を変えた。青銅の雀符は、先帝が鎮北軍に部隊配備の証として授けたもので、半分は北の国境に、もう半分は皇帝の机の上にあった。北の国境にあった青銅符のもう半分は、沈一族が全員投獄された10年前に消え去ったことは、誰もが知っていた。沈昭雪は手を上げ、青銅の符を衛兵の手のひらに置いた。「私の到着を告げてください」と彼女は言った。「死者が都に戻り、生きている官吏に会いたがっています」。風雪が宮殿の門に吹き込み、衛兵の手は震えた。30分後、太極殿は明るく照らされた。殿内は人でいっぱいだった。左宰相の裴景志は紫の衣をまとい、象牙の牌を袖に挟んでいた。彼は50歳を超え、まぶたは薄く、人を見上げる時は、まるで燃やされる紙切れを見ているかのようだった。皇太子蕭成は階段の下に座り、指先でゆっくりと茶碗を撫でていた。彼の隣にいる若い皇帝はわずか12歳で、肩にかけた龍の衣は借り物のように見えた。沈昭雪は広間にひざまずき、着物の裾から雪水が青いレンガに滴り落ちていた。裴景志が最初に口を開いた。「沈家の罪深い娘が死んでいないのなら、なぜ司法省に行って自首しないのですか?」沈昭雪は顔を上げた。顔色は青ざめていたが、目はしっかりしていた。「私が先に司法省に行けば、尊敬すべき官僚たちは今夜、北の国境からの知らせを聞くことはないでしょう。」広間の誰かが冷笑した。「あなたのような不名誉な官僚の子孫がどんな知らせを持ってくるというのですか?」沈昭雪は袖から油布の巻物を取り出し、両手で差し出した。「17万石の軍需品が3か月前に洛倉を出発し、記録では北の国境に入ったことになっています。しかし、鎮北軍が受け取ったのは5万石だけです。」広間は静まり返った。裴景志は動かなかった。皇太子蕭成はそっと茶碗を置いた。「続けて」と沈昭雪は言った。「行方不明の12万石を銀に換算すれば、3万人の私兵を1年間養うのに十分です。」誰かがすぐに叱責した。「無礼者!自分が何を言っているのか分かっているのか?」「分かっています。」沈昭雪は男を見て言った。「周大臣、歳入部右副大臣、あなたが承認した解放文書の墨には辰砂が混ざっていました。私が黒夏から拾った半粒の令牌にもこの印が押されています。」周副大臣の顔から血の気が引いた。裴景志はついに目を上げた。「沈嬢は落下から生き延びたので、確かに口達者です」と沈昭雪は微笑んだ。「落下する前は、私も口達者ではありませんでした。」ホールの外の風が強くなった。若い皇帝は玉座の肘掛けを握りしめ、静かに尋ねた。「穀物はどうなった?」これを聞くと、広間の役人たちは皆頭を下げた。沈昭雪は若い皇帝を見た。「穀物はなくなりました。」彼女は少し間を置いて言った。「北の国境もほとんどなくなってしまいました。」皇太子蕭成の目は暗くなった。「鎮北軍はどうなった?」「七日前、羌族と容族が霜河関を突破しました。鎮北軍は陳沙城に撤退しましたが、残された食料はあと二日分しかありません。」若い皇帝は立ち上がった。「なぜ誰も報告しなかったのだ?」沈昭雪はすぐには答えなかった。彼女は胸から二つ目の品を取り出した。折れた矢だ。赤い布の半分が矢柄に巻き付けられており、布は今や血で黒く染まっている。「報告した者が都に入る三十マイル手前で死んだからです。」彼女は折れた矢を地面に置いた。「これで六番目です。」広間にはもう誰も笑わなかった。皇太子蕭成はゆっくりと立ち上がり、皇帝の階段を下りた。彼は沈昭雪から3歩手前で立ち止まり、彼女の肩に残る溶けない雪の塊に視線を落とした。「何が欲しい?」「穀倉を開けてほしい」「穀倉を開けるだけか?」「それと、羅蒼まで穀物を取りに行くのに護衛の兵士を一隊つけてほしい」裴景志はついにくすくす笑った。「兵士が欲しいのか?」沈昭雪は彼を見た。「裴宰相は勘違いしている。道が欲しいのだ」裴景志の笑みが消えた。「羅蒼は首都圏にあり、護衛は全員、徴税部の指揮下にある。失脚した官吏の娘に穀倉を開ける権利などあるだろうか?」沈昭雪は袖に手を入れた。護衛兵は皆、剣を抜いた。彼女が取り出したのは、血で書かれた手紙だった。手紙の文字のほとんどはぼやけていて、最後の行だけがかろうじて判読できた。「あなたの臣下である沈懐山は、北の国境地帯の3年間の平和と引き換えに、一族全員の命を差し出す用意がある。」沈懐山は彼女の父だった。10年前、彼は羌族と容族と結託した罪で告発され、一族全員が投獄された。その年、沈昭雪は15歳で、3日間司法省の入り口に跪き、誰も彼女に水一滴さえ与えようとしなかった。今、皇帝に届けられることのなかった血で書かれた手紙が、遅れて届いた骨のように玉座の上に置かれている。若い皇帝の顔は青ざめた。裴景志の指が袖の中でぴくぴくと動いた。沈昭雪はそれを見て、頭を下げ、低い声で言ったが、その声は外の風雪をかき消した。 「この卑しい女は、沈家が10年前に届けられなかった慰霊碑、北辺境の7万人の兵士の命、そして陳沙城でまだ息をしている市民の命に頼っています。」彼女は顔を上げた。「それでも足りないなら、この卑しい女は軍事誓約書に署名します。」蕭成は尋ねた。「何日ですか?」「3日です。」「もし穀物が陳沙城に届かなかったら?」沈昭雪は彼を見つめ、一言ずつ言った。「私は城門で死にます。」広間は静まり返り、ランプの芯がパチパチと音を立てるのが聞こえるほどだった。
Doubao Audio Generation Model 1.0は…自動宮殿の門に吹雪が吹き込む様子を描写するなど、オーディオブックの内容を識別することができる。自動適切な効果音を推測し、組み合わせる。
ヒロインの声は穏やかで抑制されている一方、大臣の声はゆっくりとした威厳のある声だ。ナレーターの声や様々な登場人物の声はどれも非常に聞き取りやすい。
人の声、環境音、BGMの音量比も比較的適度なので、編集ソフトで音量バーを繰り返し調整するという面倒な作業を省くことができます。
しかし、Doubaoの音声生成モデル1.0では、一度に生成できる音声は最大2分までです。完全なオーディオブックを作成するには、音声を分割して生成する必要があります。
長文生成の性能は概して悪く、一部の対話の順序が逆になったり、多声文字の認識が不安定だったりするため、発音に注意が必要です。
AI 短編ドラマの吹き替え
もっと身近な話題を試してみましょう。 AI 短編ドラマ。通常のTTSではセリフを読み上げるだけですが、短編ドラマでは声に空間感が必要です。
背景音楽は、主に温かみのあるピアノ、優しい弦楽器、かすかな都会の環境音を特徴とする、繊細な土台を提供します。全体的な雰囲気は、温かみと予期せぬ展開を少し加えた、現実的で生き生きとしており、サスペンスやホラーは避けています。環境音には、コーヒーショップのかすかな話し声、カップのカチャカチャ音、ドアベル、携帯電話の振動、雨上がりの道路の車の音などが含まれます。声は明瞭で目立つ必要があり、音楽が会話をかき消さないようにする必要があります。ナレーター(穏やかで安定した大人の女性の声、適度なペースで、物語のような雰囲気)は、平凡な人に起こった小さな物語を語るかのように、落ち着いて繊細です。リン・シア(清らかで明るい若い女性の声、少し疲れているが抑制されたトーン)は、物語の後半で失望と無理やり平静を保とうとする状態から徐々に安堵へと変化します。周燕(若い男性の声、低く穏やかで、ゆっくりとしたペースで、誠実だが少しぎこちない)は、慎重で、罪悪感を感じ、説明しようとし、威圧的なCEOの口調を避けている。店員(若い女性の声、明るく自然で丁寧)は、短く自然に登場します。 章抜粋:「窓際の席」 ナレーター:「林夏と周燕は、別れてから7日後にそのコーヒーショップで会った。」 ナレーター:「雨はちょうど止んだところで、窓の外の葉はまだ滴っていた。林夏は窓際に座り、テーブルには2つのコーヒーカップがあった。1つはホット、もう1つはアイスだった。」 ウェイトレス:「こんにちは、ホットをお持ちしましょうか?」 林夏:「いいえ、結構です。」 ナレーター:「彼女はそう言い終えると、携帯電話をちらりと見た。周燕は26分遅れていた。」ナレーター:「ドアで風鈴が鳴った時、林夏はすでに『もう連絡しないで』と言っていた。」 「心の中で3回リハーサルした。」 周燕:「遅れてすみません。」 林夏:「あなたはいつも遅れるわ。」 周燕:「今日は本当に渋滞していたんです。」 林夏:「前回は残業で、その前は急な会議だったわ。周燕、言い訳を聞きに来たんじゃないの。」 ナレーター:「周燕は紙袋を持ってテーブルのそばに立っていた。袋の口は雨で少し湿っていた。」 周燕:「わかってる。」 林夏:「じゃあ座って、言いたいことを言い終えなさい。」 ナレーター:「彼は彼女の向かいに座ったが、冷めてしまったコーヒーカップには手をつけなかった。」 周燕:「あの日、あなたは言った…」「君を一番に考えたことは一度もない。」 林夏:「そうじゃないの?」 周燕:「そうだ。」 「ナレーション:」林夏は目を上げて彼を見た。この答えはあまりにも率直で、彼女が用意していた非難の言葉が喉に詰まってしまった。周燕:「まずは仕事をしっかりして、住宅ローンを払うのに十分なお金を貯めて、生活を安定させれば、もっと幸せになれるといつも思っているんだ。」林夏:「でも、私が待っていたのは、あなたが何度も何度も不在になることだったの。」周燕:「だから、今日は君に許しを請いに来たわけじゃない。」林夏:「じゃあ、ここで何をしているの?」「ナレーション:」周燕は紙袋を彼女の前に押し出した。周燕:「君の持ち物を返しに来たんだ。」「ナレーション:」林夏は紙袋を開けた。彼の家に置いてきたスカーフでも鍵でもなかった。ナレーター:「バスの切符、映画のチケットの半券、そして十数枚のテイクアウトのレシートが入っていた。」林夏:「これは何?」周燕:「あなたは私が何も覚えていないと言ったわね。」実は覚えているの、ただ言わなかっただけよ。「ナレーション:林夏は下の方を見ると、色あせた付箋を見つけた。「ナレーション:これは彼女が2年前に書いたもの。将来喧嘩をしたら、窓辺に行って仲直りしてね。」林夏は何も言わなかった。周燕:「今言うには少し遅いのは分かっているわ。」林夏:「遅いわね。」周燕:「ええ。」ナレーター:「窓の外を車が通り過ぎ、水しぶきが静かに上がった。」周燕:「でも、あなたに返したいの。」あなたを引き返させるためではなく、あの頃のことを忘れていないと伝えるためです。」 林夏:「じゃあ、どうしてもっと早く言わなかったの?」 周燕:「だって、言葉よりも行動の方が雄弁だと思っていたから。」 林夏:「それで?」 周燕:「それから、何も言わずにただ行動するだけでも、人に自分が重要でないと感じさせてしまうことがあると気づいたんだ。」 ナレーター:「林夏は付箋を見下ろした。紙の角は丸まっていたが、文字はまだはっきりと見えた。」 林夏:「周燕、いつも遅れてくる人をもう待ちたくない。」 周燕:「わかってる。」 林夏:「でも、このコーヒーは一緒に飲み干せるわ。」 ナレーター:「周燕は少し間を置いてから、ゆっくりと微笑んだ。」 周燕:「冷たいね。」 林夏:「じゃあ、ホットにしよう。」 ナレーター:「店員が来て、冷たいコーヒーを受け取った。窓の外の雲が少し晴れ、太陽の光が窓際の席に差し込む。エンディング効果音:カップがそっと置かれ、ドアベルが一度鳴り、BGMが静かにフェードアウトする。
登場人物たちの会話は非常に自然で、視聴者は感情の流れを感じ取ることができる。雨の音やトランプをめくる音も、情景描写に役立っている。
音声はもはや、動画が完成した後に最後に付け加える付属品ではなく、脚本段階から制作に関与させることができる。
レプリカサウンド
Doubao音声生成モデル1.0は現在、1セッションあたり最大2分間の音声を生成します。より長い音声クリップや続編を作成する場合、音声がストーリーラインと矛盾しないようにするにはどうすればよいでしょうか?
参照音声をアップロードするか、以前に生成した音声を参照音声として使用できます。同時にサポートされる参照音声は最大3つまでです。プロンプトワードそれは、特定の文字には特定の音色を用いるべきであることを規定している。
例えば、斗宝の声を再現してみましょう。
音楽は、軽快なジャズドラム、短いベース音、そして遊び心のあるピアノのリフで幕を開け、小さな劇場の観客のひそひそ話、グラスの音、そして時折聞こえる笑い声が背景に響きます。全体的な雰囲気はリラックスしていて活気に満ちており、都会のナイトクラブで行われるスタンドアップコメディショーを彷彿とさせます。演奏が始まると、音楽はすぐに静かになり、ごく軽いベースのリズムだけが残ります。観客の笑い声、歓声、拍手は自然に聞こえますが、ボーカルをかき消さないように注意が必要です。
スタンドアップコメディアン(若い女性の声、中国語を話す、低音、ややかすれ声、中速から高速の話し方、機知に富んだ発言の強いリズム、自然な間とオチの間があり、放送調ではない、[女優の名前]が演じる)が、小さな劇場で観客と雑談しているかのように、リラックスした自虐的な口調で話す:「最近、私は…」AI 一番大きな影響は、代わりの仕事が見つかったことではなく、私が本当に役立たずだと母にようやく確信させてしまったことだった。
観客はくすくす笑った。
そのスタンダップコメディアンは(慎重に場を整えながら)こう続けた。「母は以前は何か問題があるといつも私に電話をかけてきたんです。携帯電話が壊れた時も、テレビの音が出ない時も、WeChatのグループが見つからない時も、いつも私に電話してきました。今は違います。まず私に相談してくるんです…」 AI。”
0.5秒間待ってください。
そのスタンダップコメディアンは(突然声のトーンを落として)「尋ねた後…」と言った。 AI「また電話して。」
観客は笑った。
そのスタンドアップコメディアンは(どうしようもなく)こう言った。「彼女はこう言った、AI 彼女は答えをくれたが、納得がいかず、私に確認を求めた。私は「ママ、あなたは私をリラックスした活気のある都会のナイトクラブのスタンドアップコメディの雰囲気にさせているのね」と言いました。音楽はアップビートなジャズドラム、短いベースライン、そしていくつかの遊び心のあるピアノの音で始まり、背景には小さな劇場の観客のひそひそ話、グラスの音、時折の笑い声などの雑音があります。全体的な雰囲気はリラックスしていて活気があり、都会のナイトクラブのスタンドアップコメディの雰囲気があります。コメディアンが話し始めると、音楽は急速に落ち、非常に軽いベースのリズムだけが残ります。観客の笑い声、歓声、拍手は自然に発生する可能性がありますが、声がかき消されてはいけません。スタンドアップコメディアン(若い女性の声、中国語を話す、低いピッチ、ややかすれた声、中速から速い話し方、機知に富んだ軽妙なやり取り、自然な間とパンチラインの間があり、放送調ではない、演者は@audio1)はリラックスしていて自虐的で、小さな劇場の観客と話しているかのように言います。 「最近発見したのですが…」AI 「一番大きな影響は、代わりの仕事に就けたことではなく、母が私が本当に役立たずだとついに確信したことだった」と、観客はくすくす笑った。コメディアンは(真剣な表情で)続けて、「以前は、母は何か問題があると私に電話をかけてきた。携帯電話が壊れたり、テレビの音が出なくなったり、WeChatのグループを見逃したり。今は違う。まず母が私に聞いてくるんだ…」 AI「…」半秒の沈黙の後、スタンドアップコメディアンは(突然声のトーンを落として)「尋ねた後…」と言った。 AI「また電話して。」観客は笑った。コメディアンは(どうしようもなく)言った。「彼女は言った、AI 彼女は答えをくれたが、納得せず、私に確認を求めた。私は「お母さん、あなたは私をテクニカルサポートから手動レビューに降格させたのね」と言った。観客の笑い声がさらに大きくなった。コメディアンは(早口で)「一番恐ろしいのは、彼女が今使っているのは…」 AI 彼女は以前はWeChatモーメンツに「今日は餃子を作っています」と投稿していた。今は「時間が小麦粉に染み込み、家族の愛情がしわに輝きます」となっている。少し間を置いて、コメディアンは(声を低くして)「父がそれを見て、『この餃子は食べられるのか、それとも展示用なのか?』と母に尋ねた」と言った。観客は笑った。コメディアンは(からかい続けて)「母も、こんな投稿は普通すぎるんじゃないかと真剣に聞いてきた。私は『いや、大丈夫だよ、ただ君らしくないだけだ』と言った。母は『どうして違うの?』と聞いてきたので、『君は普段モーメンツに句読点すら使わないのに、突然家族の愛情がしわに輝き始めたら、親戚は君が小麦粉に取り憑かれたと思うよ』と言った」と観客は笑った。
生成された音色は、基準音色と非常に類似しており、スタンドアップコメディに必要な自虐的なユーモアとリラックスした雰囲気を保っています。オチの間や観客の笑い声も非常に自然です。
Doubao Audio Generation Model 1.0は、音色を複製するだけでなく、より多くの感情を盛り込むことができ、音色を使ったショーをよりリアルに表現できます。
過去に AI 音声演技では、単にテキストを入力するだけです。今、私たちは...プロンプトワード彼はまるで監督のように、登場人物たちに指示を与える。年齢、声の特徴、現在の感情、動き、そして背景音まで、すべてを明確に描写するのだ。提供される情報が具体的であればあるほど、最終的な結果は望ましいものに近づく。
これまで煩雑だった吹き替え、作曲、効果音探し、ミキシングといった作業工程は、合理的なプロセスによって効率化できるようになった。 Prompt 速い最初の完成プロトタイプが完成すれば、効率性の向上は明らかです。短編ドラマ、広告、講座、仮想IPの制作速度は大幅に向上するでしょう。
現在、ボルケーノアーク体験センターでは、豆宝オーディオ生成モデル1.0の体験版を公開しており、一般ユーザーは30分間のオーディオ体験を楽しむことができます。無料そのメリットをぜひ体験してください。将来的には、CapCutやTomato Novelといった日常的に使用するツールとの連携も図り、一般の人々がオーディオコンテンツを作成する際のハードルをさらに下げていきます。
過去について話すなら AI 吹き替えは音声の有無という問題を解決するが、Doubao Voice Model 1.0は音声が魅力的かどうかという問題を解決し始めた。
もちろん、バージョン1.0であるDoubao音声生成モデル1.0は、複雑な音場変化、ポリフォニー、アクセントの細部などにおいて、まだ改良と最適化の余地があります。しかし、Doubao音声モデル1.0が示したエンドツーエンドの生成能力は、すでにオーディオ生産性における革命の萌芽を示しています。
画像、動画、テキスト、音声 AI ツールチェーンはますます充実しつつある。AI ナレーションも、コンテンツ体験を向上させる上で重要な要素となるでしょう。