project
CoinVE-200K - 腾讯开源的大规模组合指令视频编辑数据集
CoinVE-200K 是腾讯视频智创团队开源的大规模组合指令视频编辑数据集,包含 20万组 1080p 视频编辑样本对,每样本含 2-5 条原子编辑指令,包括添加、移除、修...
CoinVE-200K是什么
CoinVE-200K 是腾讯视频智创团队开源的大规模组合指令视频编辑数据集,包含 20万组 1080p 视频编辑样本对,每样本含 2-5 条原子编辑指令,包括添加、移除、修改、风格化等,覆盖人物、物体、背景等多类目标,最长 201 帧。CoinVE-200K配套开源了 22B 参数模型 CoinVE-Edit 和评测集 CoinVE-Bench,填补组合指令视频编辑在数据、模型与评测标准上的三重空白。
CoinVE-200K的主要功能
-
海量组合编辑数据:提供 20 万组 1080p 组合指令视频编辑样本对,支持模型进行多意图联合训练。
-
多元原子操作覆盖:涵盖添加、移除、替换、风格化等 6 种原子编辑操作,可灵活组合复杂编辑任务。
-
全场景目标支持:编辑目标横跨人物、物体、背景等多类主体,具备丰富的场景与语义多样性。
-
开箱即用编辑模型:配套开源 22B 参数 CoinVE-Edit 模型,实现一次性精准执行多条编辑指令。
-
系统评测基准:构建 CoinVE-Bench 评测集,用 11 项细粒度指标系统评估组合编辑性能。
CoinVE-200K的技术原理
- 数据生成与过滤:基于预定义编辑分类体系,用 Qwen3.6-27B 分析源视频内容并识别可编辑主体,通过组合多个原子操作生成复合指令;随后借助 SAM3/SAM2 生成编辑区域掩码,用 HunyuanImage-3.0 与 Nano Banana 合成编辑关键帧,再经 Wan2.1-Animate 或 VACE 扩散为完整视频,通过 Gemini 进行二次质量过滤,从指令遵循度、视觉质量、时序一致性等维度筛选合格样本。
- 多模态语义理解:CoinVE-Edit 以 Qwen3-VL-8B-Instruct 作为多模态理解模块,同时接收源视频帧序列与多条文本编辑指令,联合解析视频内容与复合编辑意图,提取面向组合式编辑的高层语义表示,使模型能全局理解多指令间的关联与约束。
- 编辑感知特征转换:通过 Feature Connector 将 MLLM 输出的隐藏状态映射为两类编辑感知 Tokens:一类是与各条指令绑定的可学习 Tokens,另一类是保留原始视频信息的视觉 Tokens;其中指令相关 Tokens 作为条件信号注入 DiT 主干网络,引导生成过程精准响应不同类型的编辑需求。
- 区域解耦注意力机制:Mask Predictor 为每条指令预测时空编辑区域掩码,GateNet 生成动态门控系数;在 DiT 的交叉注意力层中,Q-Blending 机制依据掩码与门控权重,差异化调控各指令 Tokens 和视觉 Tokens 对 Query 的贡献程度,实现不同编辑意图在对应区域的精准绑定,同时抑制无关区域的干扰并维持时序一致性。
- 双轨互补评测体系:CoinVE-Bench 采用 MLLM-based Checklist 与专用评估器相结合的评测框架:前者利用 Gemini 3.6 Flash 从编辑准确性、物理自然度、语义保持三个维度评估指令遵循正确性;后者借助 Aesthetic Predictor、DOVER++、VisualQuality-R1 及光流场分别衡量美学质量、技术质量、综合质量与时序稳定性,共覆盖 4 个核心维度 11 项指标。
微信关注回复“开源”,加入AI开源项目交流群
如何使用CoinVE-200K
-
下载数据集:安装 ModelScope CLI 后执行
modelscope download命令,按需全量拉取或仅下载metadata_coinve200k.jsonl元数据先行试跑。 -
解压分片文件:将下载的 tar 分片分别解压至
src_videos、tgt_videos、combined_masks和instruction_masks对应目录。 -
解析元数据:使用 Python 读取
metadata_coinve200k.jsonl,获取每条样本的源视频路径、编辑后视频路径及 2–5 条组合编辑指令。 -
调用掩码信息:从元数据中提取
instruction_mask_video_paths和combined_mask_video_path,获取各指令对应的时空编辑区域掩码。 -
开展模型训练:将解析后的视频对、组合指令与掩码输入 DiT 框架,用于监督组合指令视频编辑模型的训练与微调。
-
复现基线结果:直接加载官方开源的 CoinVE-Edit 模型权重,在 CoinVE-Bench 评测集上验证组合编辑性能。
CoinVE-200K的核心优势
-
规模质量双领先:拥有 20 万组 1080p 高清视频编辑对,最长 201 帧,是迄今最大规模的组合指令视频编辑数据集。
-
复杂组合编辑:每条样本包含 2–5 条原子编辑指令,支持添加、移除、修改、风格化等操作的灵活复杂组合。
-
严格质量过滤:通过 MLLM 语义理解与二次质量过滤 pipeline,确保指令遵循度、视觉质量、时序一致性和未编辑区域完整性。
-
全链路开源生态:同步提供 22B 参数 CoinVE-Edit 模型 与 CoinVE-Bench 评测集,形成数据–模型–评测的完整闭环。
-
精度超越闭源模型:在组合指令编辑准确性(SA/SPA/EP)上全面超越 Seedance 2.0 和 Kling O3 等主流闭源方案。
-
区域解耦编辑机制:通过 Mask-based Conditioning 与 Q-Blending 交叉注意力,实现多指令精准绑定对应时空区域并保留无关内容。
CoinVE-200K的项目地址
- 项目官网:https://coinve200k.github.io/
- GitHub仓库:https://github.com/coinve200k/CoinVE-200K
- HuggingFace模型库:https://huggingface.co/datasets/FireCRT/CoinVE-200K
- arXiv技术论文:https://arxiv.org/pdf/2608.17566
CoinVE-200K的同类竞品对比
| 维度 | CoinVE-200K | OpenVE-3M | ReCo-Data |
|---|---|---|---|
| 数据规模 | 20 万组 | 300 万组 | 50 万组 |
| 视频分辨率 | 1080p | 720p (1280×720) | 480×832 |
| 最大帧数 | 201 帧 | 65–129 帧 | 81 帧 |
| 组合编辑 | 支持(2–5 条原子指令) | 单指令为主 | 单指令为主 |
| 平均指令数 | 2.55 | 约 1 条 | 约 1 条 |
| 编辑类型 | 添加、移除、替换、风格化等 | 8 类(含风格/背景/局部/字幕等) | 添加、移除、替换、风格化 |
| 配套模型 | CoinVE-Edit(22B) | 无 | ReCo(1.3B) |
| 专用评测集 | CoinVE-Bench | OpenVE-Bench | 无 |
| 质量过滤 | Gemini 二次过滤 + MLLM checklist | 有 | Gemini-2.5-Flash-Thinking 过滤 |
CoinVE-200K的应用场景
-
影视后期制作:导演通过自然语言组合指令一次性完成多元素替换、背景修改与画面风格迁移,大幅提升后期效率。
-
广告内容迭代:品牌方可快速对同一视频素材执行人物换装、产品替换与背景调整等批量组合编辑,降低重拍成本。
-
短视频创作:创作者输入多条编辑意图,一键实现人物移除、物体添加与画面风格化等复杂效果,降低专业门槛。
-
AI 模型训练:作为高质量监督数据,用于训练组合指令视频编辑大模型,提升模型对多意图联合理解与精准执行能力。
-
评测基准研究:为学术界提供标准化的 CoinVE-Bench,系统评估视频编辑模型在组合指令遵循、物理自然度与视觉质量上的表现。