ニュース
Alitongyi社がPrismAudioを発表:音声と映像が同期し、効果音も連動する。
アリババ傘下のTongyi Labsは、環境音や効果音の合成に特化した動画音声生成フレームワーク「PrismAudio」を発表しました。このモデルは、強化学習と思考連鎖アプローチを革新的に組み合わせ、「分解思考連鎖」を用いることで、音声生成前に動画コンテンツ、タイミング、音質、空間位置を分析することを可能にしています。また、意味的、時間的、美的、空間的という4つの「教師」を組み込むことで、モデルのスコアリングと最適化を行っています。