ReCo-Data
收藏资源简介:
ReCo-Data是由HiDream.ai与中国科学技术大学联合构建的大规模高质量视频编辑数据集,包含50万条指令-视频对,覆盖多样化的编辑任务场景。该数据集通过系统化采集和标注流程构建,支持局部对象编辑与全局风格迁移等复杂操作,旨在推动基于文本指令的视频编辑技术发展,解决现有方法在编辑精度和内容一致性方面的挑战。
ReCo-Data is a large-scale high-quality video editing dataset jointly developed by HiDream.ai and the University of Science and Technology of China. It contains 500,000 instruction-video pairs covering diverse editing task scenarios. Built through a systematic collection and annotation pipeline, the dataset supports complex operations such as local object editing and global style transfer. It aims to promote the development of text-instruction-based video editing technologies and address the challenges faced by existing methods in terms of editing accuracy and content consistency.
ReCo数据集概述
数据集基本信息
- 数据集名称:ReCo-Data
- 核心关联方法:ReCo (Region-Constraint In-Context Generation for Instructional Video Editing)
- 数据规模:包含超过50万(500K+)个指令-视频对
- 数据质量:经人工评估,每个任务的高质量数据比例超过90%
数据集构成与任务
- 任务类型与规模:
- 替换(Replace):156.6K
- 风格化(Style):130.6K
- 移除(Remove):121.6K
- 添加(Add):115.6K
- 任务描述:支持基于指令的视频编辑,涵盖替换、添加、移除和风格化四大任务。
数据收集与生成流程
数据收集管道包含六个主要阶段:
- 原始数据预处理:根据特定质量标准过滤原始视频数据。
- 对象分割:从视频中提取对象掩码。
- 指令生成:使用VLLM(即Gemini-2.5-Flash-Thinking)构建编辑提示。
- 条件对构建:涉及首帧编辑和深度图生成,为VACE准备输入条件。
- 视频合成:使用VACE基于条件生成视频。
- 视频过滤与重新标注:再次利用VLLM(即Gemini-2.5-Flash-Thinking)过滤低质量样本并为剩余视频重新标注。
资源消耗
- 计算资源:数据合成过程大约需要76,800个NVIDIA RTX 4090 GPU小时。
- 成本:VLLM操作总计花费约13,600美元。
关联方法简介
- 方法名称:ReCo (Region-Constraint In-Context Generation for Instructional Video Editing)
- 核心创新:一种新的教学视频编辑范式,专注于在上下文生成过程中对编辑区域和非编辑区域之间的约束进行建模。
- 技术要点:
- 将源视频和目标视频进行宽度拼接以进行联合去噪。
- 采用两种正则化项校准视频扩散学习:潜在正则化和注意力正则化。
- 潜在正则化:增加编辑区域在源视频和目标视频之间的潜在差异,同时减少非编辑区域的差异,以强调对编辑区域的修改并减轻外部意外内容的生成。
- 注意力正则化:抑制编辑区域中的标记对源视频对应部分标记的注意力,从而减轻目标视频中新对象生成过程中的干扰。
方法评估
- 比较方法:与先前的基于指令的视频编辑方法(InsViE, Lucy Edit, Ditto)以及基于描述的编辑流程(VACE)进行了比较。
- 比较任务:涵盖添加、替换、风格化和移除任务。

- 1Region-Constraint In-Context Generation for Instructional Video Editing中国科学技术大学, HiDream.ai公司 · 2025年



