AB
AiBoss
project

PlayDiffusion - Play AIのオープンソース音声編集モデル

PlayDiffusionは、PlayAIが発表した新しい音声編集モデルで、拡散モデル技術に基づいており、特にきめ細かな音声編集と修復のために設計されています。このモデルは音声を離散的なトークンシーケンスにエンコードし、変更が必要な部分をマスクします。

PlayDiffusionとは何ですか?

Play AIが開発した革新的な音声編集モデル「PlayDiffusion」は、拡散モデル技術に基づいており、きめ細やかな音声編集と復元に特化して設計されています。このモデルは、音声を離散的なトークンシーケンスにエンコードし、修正が必要な部分をマスクした後、拡散モデルを用いてマスクされた領域に更新されたテキストを付加することでノイズを除去し、高品質な音声編集を実現します。また、文脈をシームレスに保持することで、音声の一貫性と自然さを確保するとともに、効率的なテキスト音声合成もサポートします。PlayDiffusionの非自己回帰的な性質は、従来の自己回帰モデルを生成速度と品質の両面で凌駕し、音声編集と音声合成の分野に新たなブレークスルーをもたらします。

PlayDiffusionの主な機能

  • 音声部分編集音声セグメント全体を再生成することなく、音声の部分的な置換、変更、または削除をサポートし、自然でシームレスな音声を実現します。
  • 高効率TTS音声全体をマスキングする場合、効率的なTTSモデルとして、推論速度は従来のTTSよりも50倍速く、音声の自然さと一貫性も向上します。
  • 会話の一貫性を保つ編集時には文脈を維持し、発話の一貫性と話者の口調との整合性を確保してください。
  • 動的な音声変調新しいテキストに基づいて音声の発音、トーン、リズムを自動的に調整するため、リアルタイムの対話型シナリオに適しています。
  • シームレスな統合と使いやすさHugging Faceとの連携およびローカル展開をサポートし、簡単かつ迅速な体験と使用を実現します。

PlayDiffusionの技術的原理

  • 音声エンコーディングこの関数は、入力された音声シーケンスを、各トークンが音声の単位を表す離散的なトークンシーケンスにエンコードします。実際の音声とテキスト音声合成モデルによって生成された音声の両方に適しています。
  • マスキング音声の一部を修正する必要がある場合は、後続の処理を容易にするために、その部分をマスクとしてマークしてください。
  • 拡散モデルを用いたノイズ除去更新されたテキストに基づく拡散モデルを用いて、マスクされた領域のノイズを除去します。この拡散モデルは、ノイズを段階的に除去することで、高品質のオーディオタグシーケンスを生成します。非自己回帰的な手法を用いて、すべてのタグを同時に生成し、固定数のノイズ除去ステップに基づいてタグを洗練します。
  • 音声波形にデコード生成されたトークンシーケンスは、BigVGANデコーダーモデルに基づいて音声波形に変換され、最終的な出力音声が自然で一貫性のあるものになるようにします。

PlayDiffusionプロジェクトの住所

PlayDiffusionの応用事例

  • 吹き替えエラーの訂正誤った発音を迅速に修正することで、自然でスムーズな吹き替え体験を維持できます。
  • 合成対話の単語編集会話内容を簡単に編集して、正確で自然な言葉遣いを確保できます。
  • ポッドキャスト編集コンテンツの質を向上させるために、セグメントを修正または削除します。
  • リアルタイム音声対話自然な対話を実現するために、音声コンテンツを動的に調整する。
  • 音声合成放送などの用途に適した、高品質な音声を効率的に生成します。