OpenVE-3M
收藏资源简介:
OpenVE-3M是一个开源、大规模、高质量的指令引导视频编辑数据集,包含空间对齐编辑(全局风格、背景更改、局部更改、局部移除、局部添加和字幕编辑)和非空间对齐编辑(相机多镜头编辑和创意编辑)两大类。所有编辑类型均通过精心设计的数据流程生成,并经过严格的质量过滤。OpenVE-3M在规模、编辑类型多样性、指令长度和整体质量上均超过现有的开源数据集。
OpenVE-3M is an open-source, large-scale, high-quality instruction-guided video editing dataset that covers two major categories: spatially aligned editing (including global style modification, background replacement, local modification, local removal, local addition and subtitle editing) and non-spatially aligned editing (including camera multi-shot editing and creative editing). All editing types are generated via a meticulously designed data pipeline and subjected to strict quality filtering. OpenVE-3M outperforms existing open-source datasets in terms of scale, diversity of editing types, instruction length and overall quality.
OpenVE-3M 数据集概述
数据集基本信息
- 数据集名称:OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
- 核心定位:一个开源的、大规模的、高质量的指令引导视频编辑数据集。
- 发布状态:数据集、代码、模型和基准测试目前正在审核中。
数据集背景与目标
- 研究背景:基于指令的图像编辑数据集在质量和多样性上持续提升,但大规模、高质量的指令引导视频编辑数据集仍然稀缺。
- 核心目标:为解决上述空白而构建。
数据集内容与结构
- 数据规模:大规模。
- 数据质量:高质量。
- 编辑类别:包含两大主要类别:
- 空间对齐编辑:包括全局风格、背景更换、局部更改、局部移除、局部添加和字幕编辑。
- 非空间对齐编辑:包括摄像机多镜头编辑和创意编辑。
- 数据生成:所有编辑类型均通过精心设计的数据流程生成,并经过严格的质量过滤。
数据集优势
- 在规模、编辑类型多样性、指令长度和整体质量方面超越了现有的开源数据集。
关联资源
- 数据集地址:https://huggingface.co/datasets/Bytedance/OpenVE-3M
- 基准测试:OpenVE-Bench(包含431个视频-编辑对,涵盖多样化的编辑任务,并包含三个与人类判断高度一致的关键指标)。地址:https://huggingface.co/datasets/Bytedance/OpenVE-Bench
- 预训练模型:OpenVE-Edit(一个5B模型,在该数据集上训练,并在OpenVE-Bench上达到了新的最先进水平,超越了包括14B基线在内的所有先前开源模型)。地址:https://huggingface.co/Bytedance/OpenVE-Edit
- 技术报告:https://arxiv.org/abs/2512.07826
- 项目主页:https://lewandofskee.github.io/projects/OpenVE/
作者与机构
- 主要作者:Haoyang He, Jie Wang(并列贡献), Jiangning Zhang, Zhucun Xue, Xingyuan Bu, Qiangpeng Yang, Shilei Wen, Lei Xie(通讯作者)。
- 所属机构:浙江大学、字节跳动。




