OpenVE-3M
收藏资源简介:
OpenVE-3M是由浙江大学与字节跳动联合发布的大规模高质量视频编辑指令数据集,包含300万条样本,涵盖空间对齐(如全局风格迁移、局部修改)与非空间对齐(如创意编辑)共8个子类别。数据源自Open-Sora-Plan等开源高清视频库,通过多模态大模型(如GPT-4o)生成编辑指令,并采用深度估计、目标分割等技术确保时空一致性。经三阶段严格筛选(预处理、分类生成、质量过滤),其平均指令长度(40.6词)和视觉质量评分(3.86)均显著优于现有数据集,适用于训练视频编辑模型以解决复杂时空编辑任务。
OpenVE-3M is a large-scale high-quality video editing instruction dataset jointly released by Zhejiang University and ByteDance. It contains 3 million samples, covering 8 sub-categories including spatial alignment (such as global style transfer and local modification) and non-spatial alignment (such as creative editing). The dataset is derived from open-source high-definition video libraries such as Open-Sora-Plan. Editing instructions are generated using multimodal large language models (e.g., GPT-4o), and techniques including depth estimation and object segmentation are employed to guarantee spatio-temporal consistency. It has undergone three-stage rigorous screening: preprocessing, classification generation, and quality filtering. Both its average instruction length (40.6 words) and visual quality score (3.86) significantly outperform those of existing datasets, and it is applicable for training video editing models to address complex spatio-temporal editing tasks.
数据集概述:OpenVE-3M
基本信息
- 数据集名称:OpenVE-3M
- 核心描述:一个开源、大规模、高质量、多类别且平衡的指令引导视频编辑数据集。
- 主要用途:专为指令引导视频编辑(IVE)设计。
- 数据规模:构建过程消耗超过10,000 GPU天。
类别构成
数据集包含八个主要编辑类别,分为两大类:
空间对齐编辑
- 全局风格:改变视频的整体风格,同时保留原始运动和细节。
- 包含18种常见风格(如吉卜力、油画)。
- 包含4种一天中的时间(如早晨、蓝色时刻)。
- 包含3种天气条件(如晴朗、雨天、雪天)。
- 背景更换:针对具有清晰前景-背景区分的视频,将背景更换为各种场景。
- 局部更改:包括对象转换、风格修改、颜色更改和年龄进展等一系列编辑。
- 局部移除:移除视频中的任意对象。
- 局部添加:向视频中添加任意对象。
- 字幕编辑:包含添加、移除和修改字幕的任务,具有九种变体(三种位置:顶部、中部、底部)。
非空间对齐编辑
- 摄像机多镜头编辑:编辑视频以在同一主体的特写、中景和广角镜头之间切换,总共包含六种过渡类型。
- 创意编辑:根据创意指令编辑对象,主体的动作可能发生显著变化。
关联资源
- 论文:📄 Paper (Under Review)
- 代码:💻 Code (Under Review)
- 模型:🤗 Models (Under Review)
- 数据集:🎬 Dataset (Under Review)
- 基准测试:📊 Benchmark (Under Review)
基准测试:OpenVE-Bench
- 构成:包含431个视频-编辑对。
- 覆盖范围:涵盖多样化的编辑任务。
- 评估指标:包含三个与人类判断高度一致的关键指标。
训练模型:OpenVE-Edit
- 模型规模:50亿参数。
- 性能:在OpenVE-Bench上设立了新的最先进水平,超越了所有先前的开源模型,包括一个140亿参数的基线模型。

- 1OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing浙江大学, ByteDance · 2025年



