ニュース
Meituanのオープンソースデジタルヒューマンビデオモデル、LongCat-Video-Avatar 1.5
MeituanのLongCatチームは、LongCat-Video-Avatar 1.5デジタルヒューマンビデオモデルを正式にオープンソース化し、オープンソースの最先端技術(SOTA)から商用グレードのアプリケーションへと移行しました。このモデルは、アップグレードされたWhisper-largeオーディオエンコーダー、高品質のマルチシーンデータシステムを備え、フレームごとのGRPOプリファレンスアライメントを導入することで、リップシンク、物理的な妥当性、長時間のビデオの安定性、および複数人インタラクションを大幅に改善しています。このモデルは、8ステップの生成プロセスにDMD蒸留を使用し、効率を約15倍向上させています。