ニュース
复旦、腾讯与浙大研究者提出 Prism,用动态稀疏注意力训练 2K 音视频模型
联合研究团队提出 Prism,面向原生 2K 分辨率的音视频联合生成训练,以动态稀疏注意力降低全注意力的计算负担。论文和项目页已公开,效果数据仍属研究评测。
复旦大学、腾讯混元团队及浙江大学研究者公开 Prism 论文与项目页。该方法把视频 token 分为时空区域,结合画面变化和音视频关联信号,动态分配稀疏注意力结构,用于原生 2K 音视频联合生成模型训练。
论文给出合成样例和实验比较,但这些是研究评测,不等于已有面向普通用户的商业生成服务。
参考:arXiv 原始来源