ニュース
ByteDanceのビデオモデルVidi2はGemini 3 Proを凌駕!その理解能力は桁外れだ。
ByteDanceは、次世代動画理解モデル「Vidi2」を発表しました。このモデルは、時空間位置特定などのコアタスクにおいて、GPT-5やGemini 3 Proを凌駕する性能を発揮します。数時間にも及ぶ長尺動画コンテンツを正確に理解し、編集タイムポイント、字幕、BGMなどの詳細情報を含む完全なJSON編集ソリューションを直接生成できるため、未編集の映像から完成品まで、AIによる自動編集が可能になります。