project
SemanticAudioは、香港中文大学をはじめとする複数の企業によって開発された音声生成・編集フレームワークです。
SemanticAudioは、香港中文大学、LIGHTSPEED、上海交通大学が共同開発した音声生成・編集フレームワークです。このフレームワークは、テキストから音声への生成を「意味計画」と「音響合成」の2つの段階に分け、より高レベルでは…
SemanticAudioとは何ですか?
SemanticAudioは、香港中文大学、LIGHTSPEED、上海交通大学が共同開発した音声生成・編集フレームワークです。このフレームワークは、テキストから音声への生成を「意味計画」と「音響合成」の2段階に分けます。高レベルの意味空間で音イベントの識別情報、タイミング、構造を計画し、高品質な音声へとレンダリングします。このフレームワークは、学習不要でテキストガイドによる音声編集をサポートし、AudioCapsとTTABenchの両ベンチマークにおいて、TangoFluxなどの主流手法を大幅に上回る性能を発揮し、意味的な整合性と生成品質の両面で優れた結果を実現しています。
SemanticAudioの主な機能
-
テキスト音声生成自然言語による説明を入力すると、環境音、アクション音、複雑なサウンドシーンなど、高品質な音声を生成します。
-
意味計画生成音響イベントの全体的な配置は高レベルのセマンティック空間で計画され、その後、音響の詳細が合成される。
-
音声編集のトレーニングは不要です。FlowEdit ODEメカニズムを通じて、音属性を意味空間内で直接変更することができ、置換や調整などの操作をサポートします。
-
フレームレベルのセマンティック埋め込み複雑な音声における出来事の順序や局所的な変化を正確に記述するために、時間構造を保持する意味表現を抽出する。
SemanticAudioの技術原理
- 二相流マッチングアーキテクチャSemanticAudioは、音声生成をセマンティックプランニングと音響合成の2つの段階に分けます。まず、セマンティックプランナーがテキストからコンパクトなセマンティック表現を生成し、サウンドイベントの全体的な配置を示します。次に、音響シンセサイザーがこのセマンティックプランを条件として、高品質の音響潜在変数を生成し、それを音声にデコードします。この分離により、モデル内で明確な役割分担が確保され、音響空間においてセマンティック理解と音響レンダリングを同時に処理する単一段階モデルに見られる結合問題を回避できます。
- 意味空間の構築と圧縮知覚エンコーダーは、時間構造を保持するためにフレームレベルのセマンティック埋め込みを抽出し、軽量なMLPを使用して128次元に圧縮します。この低次元セマンティック空間は、重要な音の識別情報と時間情報を保持し、フローマッチングモデルによって効率的に学習できるため、テキストの意味と音響の詳細を結びつける重要な中間層となります。
- FlowEdit ODE意味的軌跡編集は、ソーステキストとターゲットテキスト間の速度場の差に基づいて行われます。ソース音声は意味的潜在変数として符号化され、2つのテキスト間の速度場の差が計算されて編集方向が決定されます。ODEステップ法を実行してターゲット意味表現を取得し、音響シンセサイザーによって復元します。編集は高レベルの意味空間で行われ、追加のトレーニング、反転、またはペアリングデータなしで属性レベルの変更が可能です。
- 意味論的・音響的分離の核心的価値明示的な分離により、モデルは音響の詳細を合成する前に、意味空間における複数のイベントの識別情報とタイミングを最初に計画できるため、複雑なプロンプトの下でのイベントの省略やシーケンスエラーを回避できます。意味空間は、エディターに操作のためのより明確で解釈しやすいオブジェクトを提供し、変更を「サウンドコンテンツ自体の変更」に近づけ、より安定した柔軟なテキストガイド編集を可能にします。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
SemanticAudioの使い方
-
デモページをご覧くださいオンラインデモを体験するには、https://semanticaudio1.github.io/ にアクセスしてください。
-
テキストプロンプトを入力してください: 対象となる音のシーンを描写してください。例えば、「犬が吠え、その後車のクラクションが鳴る」など。
-
意味計画セマンティックプランナーは、コンパクトな意味表現を生成し、サウンドイベントのレイアウトを計画します。
-
音響合成音響シンセサイザーは、意味プランを高品質のオーディオに変換します。
-
音声編集(オプション)入力ソース音声とターゲットテキストを入力し、FlowEdit ODEを使用して意味空間におけるサウンドプロパティを変更します。
SemanticAudioの主な利点
-
意味的整合性が大幅に改善AudioCaps LAION-CLAPは、まず意味的なレイアウトを計画し、次に音響の詳細を合成することで、0.381というスコアを達成しました。これはTangoFluxの0.361よりも優れており、複雑な手がかりとなる単語をより正確に理解できることを示しています。
-
トレーニングなしで編集可能FlowEdit ODEメカニズムは、速度場の差を利用して意味空間内の軌跡を誘導し、属性レベルの変更をサポートし、CLAPを+0.094向上させ、類似の手法よりも優れた性能を発揮し、追加のトレーニングを必要としません。
-
生産品質と管理性のバランスを取るFD 19.1とMOS 3.72は、高忠実度のリスニング品質を維持しながら、テキストと音声の意味的な整合性を大幅に向上させます。
-
複雑なプロンプトワードを的確に処理する複数のイベントの識別情報と時間的関係を明確に計画することで、イベントの欠落、順序の誤り、テキストの配置不足といった問題を効果的に回避できます。
-
人間の創造プロセスにより近いまず音響シーンの構造を計画し、それから音響の詳細を追加していくというパラダイムを採用することで、発言する前に物事をじっくり考えるという生成方法を実現している。
SemanticAudioの類似製品の比較
| 寸法 | SemanticAudio | TangoFlux |
|---|---|---|
| 建築 | 2段階(意味計画+音響合成) | 単段式音響空間生成 |
| 意味的アライメント | LAION-CLAP 0.381 | LAION-CLAP 0.361 |
| 編集能力 | トレーニング不要、属性レベルの変更 | FlowEditとの互換性が必要です。効果は比較的弱いです。 |
| 複雑なプロンプトワード | タイミングを明確に計画することで、ミスが発生しにくくなる。 | 見落とされやすいイベント、または順序が混同されやすいイベント |
| 質の高いものを生み出す | FD 19.1,MOS 3.72 | FD 22.6 |
| 根本的な違い | 意味論的・音響的分離:話す前に考えよう | 音響空間で直接モデリングを行う |
SemanticAudioの応用シナリオ
-
映画やテレビ番組のポストプロダクションSemanticAudioは、スクリプト内の自然言語による記述に基づいて、複数のサウンドイベントと正確なタイミングを備えた複雑な効果音シーンを生成することができ、ポストプロダクションの効率を向上させます。
-
ゲーム開発開発者は、さまざまなゲームシナリオに合わせて、テキストコマンドを通じて対応する環境音やアクション効果音を動的に生成できるため、オーディオコンテンツを迅速に反復開発することが可能です。
-
コンテンツ作成短編動画、ポッドキャスト、その他のコンテンツの制作者は、説明文を入力するだけで、カスタマイズされた音声素材を素早く入手でき、プロフェッショナルな音声制作へのハードルを下げることができます。
-
バーチャルリアリティこのシステムは、ユーザーの自然言語によるコマンドに基づいてリアルタイムで臨場感あふれる環境音を生成し、仮想空間における存在感とインタラクティブな体験を向上させます。
-
音声編集ツールユーザーは、自然言語を使用して既存の音声の属性を直接変更したり、サウンドイベントを置き換えたりすることができ、トレーニングを必要とせずにプロレベルの編集を実現できます。