project
AudioGen-Omni - Kuaishouが発表したマルチモーダルオーディオ生成フレームワーク
AudioGen-Omniは、Kuaishouが開発したマルチモーダルオーディオ生成フレームワークです。このフレームワークは、ビデオやテキストなどの入力に基づいて、高品質のオーディオ、音声、楽曲を生成できます。このフレームワークは、統合された歌詞テキストエンコーダーと位相整合異方性…を利用しています。
AudioGen-Omniとは何ですか?
AudioGen-Omniは、Kuaishouが開発したマルチモーダル音声生成フレームワークです。このフレームワークは、動画やテキストなどの入力に基づいて、高品質な音声、スピーチ、楽曲を生成できます。統一された歌詞・テキストエンコーダと位相整合異方性位置注入(PAAPI)技術により、正確な音声・映像のアライメントとクロスモーダル同期を実現します。多言語入力に対応し、高速な推論速度(8秒の音声を1.91秒で生成)を誇り、様々な音声生成タスクで優れた性能を発揮するため、動画吹き替え、音声合成、楽曲制作などの用途に適しています。
AudioGen-Omniの主な機能
- マルチモーダル音声生成動画、テキスト、またはその両方を組み合わせて、高品質な音声、スピーチ、楽曲を生成します。
- 正確な視聴覚アライメント位相整合異方性位置注入(PAAPI)技術に基づき、音声と映像のリップシンクとリズムの同期を実現する。
- 多言語対応複数の言語入力に対応し、対応する言語の音声と歌を生成します。
- 効率的な推論推論速度が速く、8秒間の音声を1.91秒で生成できるため、類似モデルと比べて大幅に優れている。
- 柔軟な入力条件欠損しているモダリティがある場合にも対応でき、ビデオまたはテキスト入力のみの場合でも安定した音声出力を生成できます。
- 高品質オーディオ生成生成された音声は、意味的にも音響的にも入力音声と非常によく一致しており、高忠実度音声生成を可能にする。
AudioGen-Omniの技術原理
- マルチモーダル拡散トランスフォーマー(MMDiT)このシステムは、ビデオ、オーディオ、テキストという3つのモダリティを共通のセマンティック空間に統合し、様々な音声生成タスクをサポートします。共同学習パラダイムに基づき、大規模なビデオ・テキスト・オーディオデータを用いて、モダリティ間の関連性を強化します。
- 歌詞テキスト統合エンコーダーテキスト(文字)と音素をフレームレベルの密な表現にエンコードし、音声や歌唱タスクに適応させます。多言語統合単語分割とConvNeXtによる精緻化を用いて、フレームに整合した表現を生成します。
- 位相整合異方性注入(PAAPI)回転位置符号化(RoPE)を時間的モダリティ(ビデオやオーディオなど)に選択的に適用することで、モダリティ間の時間的アライメント精度を向上させる。
- 動的条件メカニズムすべてのモダリティの凍結を解除し、欠落した入力をマスキングすることに基づいて、テキスト凍結パラダイムの意味的な制約を回避し、柔軟なマルチモーダル条件付き生成をサポートします。
- 共同注意機構AdaLN(適応型層正規化)に基づく手法は、クロスモーダル特徴融合を強化し、共同注意機構を通じてクロスモーダル情報交換を促進する。
AudioGen-Omniのプロジェクトアドレス
- プロジェクト公式サイト:https://ciyou2.github.io/AudioGen-Omni/
- arXiv技術論文:https://arxiv.org/pdf/2508.00733
AudioGen-Omniの応用事例
- 動画吹き替え動画に最適な音声、楽曲、効果音を自動的に生成し、動画制作の効率とコンテンツの充実度を向上させます。
- 音声合成テキストを自然で流暢な音声に素早く変換できるため、オーディオブック、音声アシスタント、インテリジェントカスタマーサービスなどの分野に適しています。
- 作詞作曲動画コンテンツや歌詞に基づいて、それに合った楽曲を生成し、音楽制作を支援したり、動画のBGMを充実させたりします。
- 効果音生成テキストの説明やビデオコンテンツに基づいて、自然な環境音や動きのある効果音を生成し、コンテンツの没入感を高めます。