RVE-Bench
收藏资源简介:
RVE-Bench是由通义实验室联合多所高校构建的首个推理感知视频编辑基准数据集,包含1000条高质量视频-指令三元组,涵盖因果推理、时空推理等复杂维度。数据源自现有编辑数据集(如Ditto-1M)的指令重构和电影场景的语义聚类,通过GPT-4o生成隐含物理逻辑的编辑指令。该数据集支持语义一致性和感知质量的自动化评估,旨在解决统一视频模型在逻辑连贯编辑中的能力缺陷,推动视频生成与现实动态理解的深度融合。
RVE-Bench is the first reasoning-aware video editing benchmark dataset developed by Tongyi Lab in collaboration with multiple universities. It contains 1,000 high-quality video-instruction triplets covering complex dimensions such as causal reasoning and spatio-temporal reasoning. The dataset is derived from instruction reconstruction of existing editing datasets (e.g., Ditto-1M) and semantic clustering of movie scenes, with editing instructions encoding implicit physical logic generated via GPT-4o. This dataset supports automated evaluation of semantic consistency and perceptual quality, aiming to address the capability deficiencies of unified video models in logically coherent editing, and promote the deep integration of video generation and real-world dynamic understanding.
ReViSE 数据集概述
数据集基本信息
- 数据集名称: ReViSE (Reason-Informed Video Editing)
- 核心任务: 推理感知视频编辑 (Reason-Informed Video Editing, RVE)
- 关联基准: RVE-Bench
数据集目的与背景
- 旨在解决视频统一模型在推理感知视觉编辑方面的不足。
- 现有数据集不足以训练和评估推理感知的视频编辑。
- 模型内部的理解能力与编辑能力之间存在脱节,丰富的理解无法有效指导编辑过程。
基准构成 (RVE-Bench)
RVE-Bench 是一个综合性基准,包含两个互补的子集:
- 推理感知视频编辑 (Reasoning-Informed Video Editing)
- 上下文视频生成 (In-Context Video Generation)
- 这些子集涵盖了多样化的推理维度和真实世界的编辑场景。
数据集状态
- [√] 已在 RVE-Bench 上发布预训练模型检查点。
- [√] 已发布模型推理代码。
- [ ] RVE-Bench 数据暂未发布。
- [ ] 训练代码暂未发布。
模型与框架
- 核心框架: ReViSE (Self-Reflective Reasoning, SRF 框架)
- 框架特点: 在单一架构内统一了生成与评估。
- 工作机制: 模型内部的视觉语言模型通过评估编辑后的视频在逻辑上是否满足给定指令来提供内在反馈。差分反馈在训练期间用于优化生成器的推理行为。
- 性能: 在 RVE-Bench 的推理感知视频编辑子集上,相比最先进方法,总体得分提升了 32%。
获取与使用
- 预训练模型: 可从 https://huggingface.co/sophiaa/revise/tree/main/revise_ckpt 下载。
- 环境配置: 需创建 Python 3.10 的 Conda 环境并安装依赖。
- 快速开始: 提供了环境变量设置脚本和推理脚本 (
bash tools/inference/inference.sh)。
引用
如果使用本项目,请引用:
@misc{liu2025revisereasoninformedvideoediting, title={ReViSE: Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning}, author={Xinyu Liu and Hangjie Yuan and Yujie Wei and Jiazheng Xing and Yujin Han and Jiahao Pan and Yanbiao Ma and Chi-Min Chan and Kang Zhao and Shiwei Zhang and Wenhan Luo and Yike Guo}, year={2025}, eprint={2512.09924}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2512.09924}, }




