AB
AiBoss站
project

CoinVE-200K - 腾讯开源的大规模组合指令视频编辑数据集

CoinVE-200K 是腾讯视频智创团队开源的大规模组合指令视频编辑数据集,包含 20万组 1080p 视频编辑样本对,每样本含 2-5 条原子编辑指令,包括添加、移除、修...

CoinVE-200K是什么

CoinVE-200K 是腾讯视频智创团队开源的大规模组合指令视频编辑数据集,包含 20万组 1080p 视频编辑样本对,每样本含 2-5 条原子编辑指令,包括添加、移除、修改、风格化等,覆盖人物、物体、背景等多类目标,最长 201 帧。CoinVE-200K配套开源了 22B 参数模型 CoinVE-Edit 和评测集 CoinVE-Bench,填补组合指令视频编辑在数据、模型与评测标准上的三重空白。

CoinVE-200K的主要功能

  • 海量组合编辑数据:提供 20 万组 1080p 组合指令视频编辑样本对,支持模型进行多意图联合训练。
  • 多元原子操作覆盖:涵盖添加、移除、替换、风格化等 6 种原子编辑操作,可灵活组合复杂编辑任务。
  • 全场景目标支持:编辑目标横跨人物、物体、背景等多类主体,具备丰富的场景与语义多样性。
  • 开箱即用编辑模型:配套开源 22B 参数 CoinVE-Edit 模型,实现一次性精准执行多条编辑指令。
  • 系统评测基准:构建 CoinVE-Bench 评测集,用 11 项细粒度指标系统评估组合编辑性能。

CoinVE-200K的技术原理

  • 数据生成与过滤:基于预定义编辑分类体系,用 Qwen3.6-27B 分析源视频内容并识别可编辑主体,通过组合多个原子操作生成复合指令;随后借助 SAM3/SAM2 生成编辑区域掩码,用 HunyuanImage-3.0 与 Nano Banana 合成编辑关键帧,再经 Wan2.1-Animate 或 VACE 扩散为完整视频,通过 Gemini 进行二次质量过滤,从指令遵循度、视觉质量、时序一致性等维度筛选合格样本。
  • 多模态语义理解:CoinVE-Edit 以 Qwen3-VL-8B-Instruct 作为多模态理解模块,同时接收源视频帧序列与多条文本编辑指令,联合解析视频内容与复合编辑意图,提取面向组合式编辑的高层语义表示,使模型能全局理解多指令间的关联与约束。
  • 编辑感知特征转换:通过 Feature Connector 将 MLLM 输出的隐藏状态映射为两类编辑感知 Tokens:一类是与各条指令绑定的可学习 Tokens,另一类是保留原始视频信息的视觉 Tokens;其中指令相关 Tokens 作为条件信号注入 DiT 主干网络,引导生成过程精准响应不同类型的编辑需求。
  • 区域解耦注意力机制:Mask Predictor 为每条指令预测时空编辑区域掩码,GateNet 生成动态门控系数;在 DiT 的交叉注意力层中,Q-Blending 机制依据掩码与门控权重,差异化调控各指令 Tokens 和视觉 Tokens 对 Query 的贡献程度,实现不同编辑意图在对应区域的精准绑定,同时抑制无关区域的干扰并维持时序一致性。
  • 双轨互补评测体系:CoinVE-Bench 采用 MLLM-based Checklist 与专用评估器相结合的评测框架:前者利用 Gemini 3.6 Flash 从编辑准确性、物理自然度、语义保持三个维度评估指令遵循正确性;后者借助 Aesthetic Predictor、DOVER++、VisualQuality-R1 及光流场分别衡量美学质量、技术质量、综合质量与时序稳定性,共覆盖 4 个核心维度 11 项指标。

微信关注回复“开源”,加入AI开源项目交流群

如何使用CoinVE-200K

  • 下载数据集:安装 ModelScope CLI 后执行 modelscope download 命令,按需全量拉取或仅下载 metadata_coinve200k.jsonl 元数据先行试跑。
  • 解压分片文件:将下载的 tar 分片分别解压至 src_videostgt_videoscombined_masksinstruction_masks 对应目录。
  • 解析元数据:使用 Python 读取 metadata_coinve200k.jsonl,获取每条样本的源视频路径、编辑后视频路径及 2–5 条组合编辑指令。
  • 调用掩码信息:从元数据中提取 instruction_mask_video_pathscombined_mask_video_path,获取各指令对应的时空编辑区域掩码。
  • 开展模型训练:将解析后的视频对、组合指令与掩码输入 DiT 框架,用于监督组合指令视频编辑模型的训练与微调。
  • 复现基线结果:直接加载官方开源的 CoinVE-Edit 模型权重,在 CoinVE-Bench 评测集上验证组合编辑性能。

CoinVE-200K的核心优势

  • 规模质量双领先:拥有 20 万组 1080p 高清视频编辑对,最长 201 帧,是迄今最大规模的组合指令视频编辑数据集。
  • 复杂组合编辑:每条样本包含 2–5 条原子编辑指令,支持添加、移除、修改、风格化等操作的灵活复杂组合。
  • 严格质量过滤:通过 MLLM 语义理解与二次质量过滤 pipeline,确保指令遵循度、视觉质量、时序一致性和未编辑区域完整性。
  • 全链路开源生态:同步提供 22B 参数 CoinVE-Edit 模型 与 CoinVE-Bench 评测集,形成数据–模型–评测的完整闭环。
  • 精度超越闭源模型:在组合指令编辑准确性(SA/SPA/EP)上全面超越 Seedance 2.0 和 Kling O3 等主流闭源方案。
  • 区域解耦编辑机制:通过 Mask-based Conditioning 与 Q-Blending 交叉注意力,实现多指令精准绑定对应时空区域并保留无关内容。

CoinVE-200K的项目地址

  • 项目官网:https://coinve200k.github.io/
  • GitHub仓库:https://github.com/coinve200k/CoinVE-200K
  • HuggingFace模型库:https://huggingface.co/datasets/FireCRT/CoinVE-200K
  • arXiv技术论文:https://arxiv.org/pdf/2608.17566

CoinVE-200K的同类竞品对比

维度 CoinVE-200K OpenVE-3M ReCo-Data
数据规模 20 万组 300 万组 50 万组
视频分辨率 1080p 720p (1280×720) 480×832
最大帧数 201 帧 65–129 帧 81 帧
组合编辑 支持(2–5 条原子指令) 单指令为主 单指令为主
平均指令数 2.55 约 1 条 约 1 条
编辑类型 添加、移除、替换、风格化等 8 类(含风格/背景/局部/字幕等) 添加、移除、替换、风格化
配套模型 CoinVE-Edit(22B) ReCo(1.3B)
专用评测集 CoinVE-Bench OpenVE-Bench
质量过滤 Gemini 二次过滤 + MLLM checklist Gemini-2.5-Flash-Thinking 过滤

CoinVE-200K的应用场景

  • 影视后期制作:导演通过自然语言组合指令一次性完成多元素替换、背景修改与画面风格迁移,大幅提升后期效率。
  • 广告内容迭代:品牌方可快速对同一视频素材执行人物换装、产品替换与背景调整等批量组合编辑,降低重拍成本。
  • 短视频创作:创作者输入多条编辑意图,一键实现人物移除、物体添加与画面风格化等复杂效果,降低专业门槛。
  • AI 模型训练:作为高质量监督数据,用于训练组合指令视频编辑大模型,提升模型对多意图联合理解与精准执行能力。
  • 评测基准研究:为学术界提供标准化的 CoinVE-Bench,系统评估视频编辑模型在组合指令遵循、物理自然度与视觉质量上的表现。