project
Doubao Audio Generation Model 1.0 - Volcano Engineが発表したエンドツーエンドのオーディオ作成モデル。
Doubao Audio Generation Model 1.0は、Volcano Engineによって開発されたエンドツーエンドのオーディオ作成モデルで、テキストまたはオーディオを参照入力としてサポートし、ターゲットオーディオを生成します。単一のプロンプトは、複数文字の対話、感情的なトーン、BGMなどで編集できます。
Doubao Audio Generation Model 1.0とは何ですか?
Doubao Audio Generation Model 1.0は、Volcano Engineが開発したエンドツーエンドの音声制作モデルです。テキストまたは音声を参照入力として、ターゲットとなる音声を生成します。単一のプロンプトに複数のキャラクターのセリフ、感情的なトーン、BGM、環境音などを組み合わせることで、物語の緊張感を持つ完成された音声作品を直接生成でき、ポストプロダクションでのマルチトラックミキシングは不要です。このモデルは、長時間の生成においても高い音色の一貫性を維持し、音色とスタイルの独立した制御をサポートし、オーディオドラマ、ポッドキャスト、ブランド音声などのシナリオに対応します。
Doubao音声生成モデル1.0の主な機能
-
参照生成テキストによる説明や参照音声を入力としてサポートし、追加のトレーニングなしでエンドツーエンドで目標音声を生成します。
-
要素全体配置キャラクターのセリフ、感情表現、BGM、環境音効果を単一のプロンプトで同時に定義すると、出力として完成品が送られます。
-
マルチロールの一貫性複数文字の音声定義と長期的な一貫性の維持をサポートし、長時間の音声における「クロスオーバー」問題を回避します。
-
非言語表現笑い声、ため息、間、方言のアクセントといった細部まで正確に再現し、会話の臨場感を高めます。
-
トーンスタイルの分離同じ音色でも、さまざまな感情や状況に合わせて調整できるため、「一つの声、複数の視点」という多様な表現を可能にする。
-
オーディオ拡張機能2分間の参照音声を基に、音色の一貫性を高く保つために録音を複数回延長した。
斗濤音声生成モデル1.0の技術原理
- エンドツーエンドのマルチモーダル生成本モデルは、統一されたエンドツーエンドのアーキテクチャを採用し、テキスト記述と音声参照を共有潜在空間表現にエンコードします。ターゲットとなる音声波形はデコーダーによって直接生成されるため、従来のTTS(テキスト音声合成)+効果音+音楽トラック合成というパイプラインアーキテクチャを回避し、人間の声、BGM、環境音の統合生成を実現します。
- 長期的な音色一貫性メカニズムオリジナル音声と参照音声の潜在空間特性を深くリンクさせることで、複数の音声拡張の間、音色のアンカーポイントが固定され、キャラクターの声の特徴が1分目から10分目まで高い一貫性を保つことが保証され、オーディオブックや長編ドラマなどの長期生成ニーズに対応します。
- 音色とスタイルの制御を分離するこのモデルは、音色の識別特性と感情表現スタイルを異なるサブスペースに分離することで、同じ話者の音色を異なる感情や状況に応じて柔軟に切り替えることを可能にすると同時に、1つの声で複数の役割を担うことを実現します。つまり、同じ声のベースが異なる役割設定の下で異なる表現を示すことを可能にします。
Doubao音声生成モデル1.0の使い方
火山アークDoubao音声生成モデル1.0 APIが招待制のテスト用に公開されました。個人ユーザーはVolcano Arkエクスペリエンスセンター(https://ark.volcengine.com/region:cn-beijing/experience/voice?model=doubao-seed-audio-1-0&sessionid=)で直接体験でき、30分間の作成制限時間をご利用いただけます。
Doubao音声生成モデル1.0のコアとなる利点
-
すべての要素の統合生成ボーカル、効果音、音楽を別々に制作・編集する面倒な作業とはもうお別れです。たった1つのプロンプトで、完成版オーディオを直接生成できます。
-
長期的な音色の一貫性長尺音声制作におけるキャラクターボイスの不整合という根本的な問題を解決し、セグメントごとの音声編集を必要とせずに複数の拡張機能をサポートします。
-
ゼロサンプルマルチモーダル生成テキストと音声のデュアルモーダル入力に対応しており、追加のトレーニングなしで高品質なターゲット音声を生成できるため、創造性のハードルを大幅に下げます。
-
音色スタイルの繊細な分離同じ音色でも様々な感情や役割に適応させることができ、柔軟な「一つの声で複数の役割を演じる」表現を可能にし、吹き替えや演技の自由度を高める。
Doubao Audio Generation Model 1.0と類似競合製品との比較
| 比較対象寸法 | 斗濤オーディオ生成モデル1.0 | AudioX-Turbo |
|---|---|---|
| コアポジショニング | エンドツーエンドのフルエレメントオーディオ制作(ボーカル、音楽、効果音の統合) | マルチモーダル音声の生成と編集(テキスト/画像/動画/音声 → 音声) |
| 入力モード | テキストの説明、参考音声 | テキスト、画像、動画、音声の4つのモダリティ |
| 多役割配置 | 単一のプロンプトで、複数のキャラクターのセリフ、トーン、感情を統一的に配置できます。 | 主に単一音声の生成に特化しており、複数の登場人物が登場する長尺の対話の構成能力は限られている。 |
| 音色の一貫性 | キャラクターの声の一貫性を高く維持するために、長いオーディオクリップを複数回拡張することをサポートします。 | 強力な単一世代機能を備えているものの、長期一貫性拡張は明示的にサポートされていません。 |
| 完全な要素生成 | セリフ、BGM、環境音効果音はすべて1つの統合出力にまとめられるため、ポストプロダクションでのミキシング作業が不要になります。 | 音声コンテンツを生成することはできるが、音楽、効果音、ボーカルを1つの動画に統合する能力は比較的弱い。 |
| トーンスタイルの分離 | 同じ音色を異なる感情にマッチさせたり、「一つの音を複数の角度から表現する」ことをサポートします。 | スタイル転送はサポートされていますが、文字レベルの音色分離制御は比較的粗いです。 |
| 中国向け最適化 | 中国語ネイティブの文脈最適化、方言アクセントのサポート | 複数の言語に対応しているが、中国語で詳細を表現する能力はやや劣る。 |
| 使用しきい値 | プロンプト主導型、サンプルなしの制作、Volcano Arkでの直接体験。 | ある程度の技術的な専門知識が必要であり、デプロイは主にGitHubのオープンソースプラットフォームを介して行われます。 |
Doubao音声生成モデル1.0の応用シナリオ
-
オーディオドラマとポッドキャストPromptを使用すれば、クリエイターは複数のキャラクターのセリフ、BGM、効果音を含む完全なオーディオ作品を直接生成できるため、ポストプロダクションでのミキシング作業が不要になります。
-
ブランドオーディオ広告ナレーション、BGM、環境音などのブランドオーディオ素材を迅速に制作することで、広告制作サイクルを短縮します。
-
長時間の音声コンテンツオーディオブックや長期にわたるテレビシリーズでは、キャラクターの声を一貫して維持するために、音色一貫性拡張機能が利用されています。
-
ライブストリーミング Eコマース オーディオ商品販売向けに、特定のアクセントや感情的なリズムを取り入れた音声スクリプトを生成します。様々な商品や放送局のスタイルに合わせて調整可能です。
-
映画やテレビ番組の吹き替え前映画やテレビ番組のクリップ用に、一時的なセリフや環境音を素早く生成することができ、プリプロダクションの編集や絵コンテの確認に役立ちます。