ニュース
MeituanのLongCatチームが音声合成モデル「LongCat-AudioDiT」を発表
MeituanのLongCatチームは、ゼロサンプル音色クローニングにおいて最先端の性能を実現した音声合成モデル「LongCat-AudioDiT」を発表しました。このモデルは、波形潜在空間で信号を直接生成することで、従来のメルスペクトル中間表現を廃止し、情報損失を回避しています。LongCat-AudioDiTは、トレーニングと推論のミスマッチ問題に対処し、過飽和を軽減するために、デュアル制約アライメント(DCA)と適応型投影ガイダンス(APG)という2つの主要技術を提案しています。