project
Sketch2Sound - Adobeがノースウェスタン大学と共同開発したAI音声生成技術
Sketch2Soundは、Adobe Researchとノースウェスタン大学が開発したAI音声生成技術です。音の模倣とテキストプロンプトに基づいて、高品質な効果音を生成します。Sketch2Soundは、音の模倣から音量、明るさ、ピッチを抽出します。
Sketch2Soundとは何ですか?
Sketch2Soundは、Adobe Researchとノースウェスタン大学が共同開発したAI音声生成技術です。音の模倣とテキストの手がかりに基づいて、高品質な効果音を生成します。Sketch2Soundは、音の模倣から音量、明るさ、ピッチの3つの制御信号を抽出し、これらの信号をエンコードして、条件付きテキスト音声生成システムで使用します。軽量で、微調整の手順が少なく、単層の線形近似だけで済むため、Sketch2Soundは様々なテキスト音声モデルに実装できます。テキストの手がかりの意味的な柔軟性と音の模倣の精度を組み合わせたツールをサウンドデザイナーに提供し、サウンド制作の表現力と制御性を向上させます。
Sketch2Soundの主な機能
- 音声模倣とテキストプロンプトを組み合わせる: Sketch2Soundは、音声模倣(例えば、言葉の模倣)とテキストプロンプトを理解し、両方にマッチする高品質な効果音を生成できます。
- 制御信号を抽出する: 入力された音の模倣から、音量、スペクトル重心、ピッチ確率という3つの主要な制御信号を抽出する。
- 任意の音を生成する: 抽出した制御信号とテキストプロンプトを使用して、特定の音を模倣したり、新しい効果音を作成したりするなど、任意の音を合成します。
- 軽量実装: これは、わずか4万ステップの微調整と、各制御信号ごとに独立した線形層を用意するだけで、あらゆるテキスト音声変換用潜在拡散変換器(DiT)に実装できます。
Sketch2Soundの技術的原理
- 制御信号の抽出: 音声信号処理技術を用いて、入力された音の模倣から、音量、明るさ、および音高の確率を抽出する。
- 潜在拡散モデル: 事前学習済みのテキスト音声変換潜在拡散変換器(DiT)をベースとしたこのモデルは、変分オートエンコーダー(VAE)と変換器デコーダーを備えており、音声を連続したベクトルのシーケンスに圧縮し、その後、音声を合成するための新しい潜在ベクトルのシーケンスを生成します。
- 条件付き生成: 潜在拡散モデルに線形射影層を追加することで、制御信号をモデルのノイズ潜在変数に直接追加することができ、モデルを条件付けすることが可能になります。
- 微調整と適応: 事前学習済みのテキスト音声変換モデルは、時間とともに変化する制御信号を処理できるように微調整され、自己教師あり微調整を実現します。
- 推論中の制御: 推論の際、ユーザーは異なるサイズのメディアンフィルタを選択して制御信号のタイミングの詳細を調整し、それによって音の模倣精度と生成される音声の品質との間のトレードオフを行います。
- 意味の柔軟性と表現力: テキストプロンプトの意味的な柔軟性と、音の模倣による表現力を組み合わせることで、ユーザーに自然で直感的なサウンド作成方法を提供する。
Sketch2Soundプロジェクトのアドレス
- プロジェクト公式サイト:hugofloresgarcia.art/sketch2sound
- arXiv技術論文:https://arxiv.org/pdf/2412.08550
Sketch2Soundの応用事例
- 映画・ビデオ制作: 映画やビデオのポストプロダクションでは、映像と同期した効果音を生成します。例えば、特定の環境(森林、都市、戦場など)をシミュレートする効果音などです。
- ゲーム開発: ビデオゲーム向けに、没入感とインタラクティブ性を高めるためのリアルな効果音や環境音をデザインする。
- 音楽制作: 音楽プロデューサーは、新しい音楽要素を作り出したり、特定の楽器の音をシミュレートしたりする。
- サウンドデザイン教育: サウンドデザインの教育において、それは学生が音の構成や音を操作する基本的な方法を理解するのに役立つツールとして機能する。
- インタラクティブメディアとインスタレーションアート: インタラクティブなアートプロジェクトでは、観客の行動や入力に基づいて、対応する音響フィードバックが生成されます。