project
PrismAudio - Alitongyiが発表したビデオからオーディオへの生成フレームワーク
PrismAudioは、アリババ傘下のTongyi Labが開発した動画音声変換フレームワークで、無音の動画に環境音効果を自動的に追加します。このモデルは「分解ベースの思考連鎖」技術を先駆的に採用しており、まず音声コンテンツを考慮することで…
PrismAudioとは何ですか?
PrismAudioは、アリババ傘下のTongyi Labが開発した動画音声変換フレームワークで、無音動画に環境音効果を自動的に追加できます。このモデルは「分解思考連鎖」技術を先駆的に採用しており、音声生成前に音の内容、タイミング、質感、空間位置を最初に考慮します。多次元スコアリングと最適化のために、4つの「教師」(意味、時間、美的、空間)を組み込んでいます。わずか5億1800万個のパラメータで、9秒間の音声をわずか0.63秒で生成し、既存の手法を大幅に上回ります。ICLR 2026に採択されました。
PrismAudioの主な機能
-
動画から音声へこのモデルは、無音の動画の映像に合わせて、馬の蹄の音、風の音、雨の音などの環境音効果を自動的に生成することができます。
-
意味的アライメントこのモデルは、生成される音声コンテンツがビデオ内のオブジェクトや動作に正確に対応することを保証し、音声と映像の不一致を回避します。
-
タイミング同期音と映像のタイミングを正確に制御し、シームレスな同期を実現します。
-
美的最適化このモデルは、自然で重層的な、電子音を含まない高品質なオーディオを生成し、リスニング体験を向上させます。
-
空間位置ステレオ出力に対応しており、映像内の音源の位置に応じて左右のチャンネルを自動的に調整し、音の定位を実現します。
-
思考連鎖推論生成プロセスを説明可能かつ制御可能にするために、「まず考え、それから話す」という分解的な思考連鎖を採用している。
PrismAudioに関する重要な情報と使用要件
- 開発者アリババ同義ファンチーム
- 技術タイプビデオ・トゥ・オーディオ(V2A)フレームワーク
- コアイノベーション分解的思考連鎖+多次元強化学習
- モデルサイズ5億1800万のパラメータ
- 出力仕様44kHzステレオ
- 推論速度9秒間の音声を生成するのにかかる時間はわずか0.63秒です。
- 入力形式音声なし動画(一般的な動画フォーマットに対応)
- コンテンツ制限環境音や効果音のみを生成し、キャラクターの音声演技には対応していません。
- オプション入力テキストによる説明は、生成の補助として使用できます(必須ではありません)。
- ハードウェア要件GPUアクセラレーションに対応していますが、CPU上でも動作します。
PrismAudioの主な利点
- 4次元協調最適化このシステムは、意味論、時間性、美学、空間という4つの次元を個別にモデル化し、協調的に最適化するという、分解的な思考連鎖を先駆的に導入しました。これにより、「あることに焦点を当てるあまり、別のことを見失ってしまう」という従来のモデルの欠点を回避し、音声と映像の間に高度な一体性を実現しました。
- 話す前に考えよう従来のブラックボックス型生成方式を打破し、このモデルはまず構造化された推論テキスト(音の内容、タイミング、質感、位置)を出力し、次に音声を生成します。このプロセスは解釈可能で、制御も可能です。
- 高効率で軽量わずか5億1800万個のパラメータで、9秒間の音声をわずか0.63秒で生成できます。これは類似モデルのほぼ2倍の速さであり、リアルタイムアプリケーションシナリオにより適しています。
- 複雑なシナリオでも堅牢性を発揮独自に開発したAudioCanvasの複雑なシーンベンチマークにおいて、既存の手法を凌駕する性能を発揮し、複数のイベントや複数の音源が存在するシナリオにおいても安定した出力を維持できる。
PrismAudioの使い方
- オンラインで試してみましょう(初心者におすすめ)Hugging Faceのオンラインデモにアクセスし、無音の動画をアップロードしてください。必要に応じて、音声ファイルの生成を補助するテキスト説明を入力すると、AIが自動的に音声ファイルを生成します。
- ローカル展開GitHubまたはHugging Faceからオープンソースコードとモデルの重みをダウンロードし、依存関係をインストールし、事前学習済みモデルをロードし、ビデオパスを入力し、推論インターフェースを呼び出して音声を生成し、思考連鎖パラメータまたは報酬重みのカスタム調整をサポートします。
PrismAudioのプロジェクトアドレス
- プロジェクト公式サイト:https://prismaudio-project.github.io/
- GitHubリポジトリ:https://github.com/FunAudioLLM/ThinkSound/tree/prismaudio
- ハギングフェイスモデルライブラリ:https://huggingface.co/FunAudioLLM/PrismAudio
- arXiv技術論文:https://arxiv.org/pdf/2511.18833
- オンラインでデモを体験してください:https://huggingface.co/spaces/FunAudioLLM/PrismAudio
PrismAudioの類似製品の比較
| 比較対象寸法 | PrismAudio | MMAudio | ThinkSound |
|---|---|---|---|
| 開発者 | アリ・トンイ研究室 | シンガポールの南洋理工大学など | アリ・トンイ研究室 |
| コアメソッド | 分解的思考連鎖+多次元強化学習 | マルチモーダル変圧器 | 単一ユニット思考連鎖 |
| パラメータ | 5億1800万 | 約10億 | 数十億 |
| 推論速度 | 0.63秒/9秒の音声 | 1.30秒 / 9秒の音声 | 1.07秒 / 9秒の音声 |
| 出力音質 | 44kHzステレオ | 44kHzモノラル | 44kHzステレオ |
| 意味的一貫性(CLAP) | 0.47 | 0.40 | 0.43 |
| タイミング同期(同期ずれ) | 0.41 | 0.46 | 0.55 |
| 空間精度(CRW) | 7.72 | — | 13.47 |
| 美的品質(MOS-Q) | 4.21 | 3.95 | 4.05 |
PrismAudioの応用事例
-
映画やテレビ番組のポストプロダクション映画、ドキュメンタリー、予告編向けの環境音効果音を自動的に生成し、従来の効果音制作作業を代替することで、ポストプロダクションのコストと時間を削減します。
-
ショートビデオ制作Vlog、料理動画、旅行動画などの無音動画に環境音をすばやく追加することで、ASMRやヒーリングコンテンツの没入感とリーチを向上させることができます。
-
ゲーム開発カットシーンやCGプロモーションビデオ向けにダイナミックな効果音を生成し、森林、都市、戦場などのシーンに合わせて環境音をリアルタイムでマッチングさせることで、サウンドエンジニアの反復作業を軽減します。
-
広告とマーケティング製品デモンストレーション動画に操作効果音を自動的に追加し、複数のオーディオトラックの迅速な反復作業をサポートすることで、広告テストの効率性と創造性を向上させます。
-
教育と訓練指導ビデオやデモンストレーションに指示や背景音を追加することで、マルチメディア教材の聴覚体験を豊かにし、学習への集中力と情報吸収率を向上させる。