SPLICE
收藏资源简介:
SPLICE是一个由人类精心策划的基准数据集,从COIN教学视频数据集中衍生而来,旨在测试视觉语言模型在多个维度上的基于事件的推理能力,包括时间、因果、空间、上下文和通用知识。该数据集包含3,381个经过人工筛选的视频,跨越12个类别和180个子类别,例如运动、工程和家庭工作。这些视频被分割成总共11,423个事件片段。SPLICE通过要求模型将剪辑重新排列成连贯的事件序列来评估其视觉推理能力,填补了现有视觉推理评估的空白。
SPLICE is a human-curated benchmark dataset derived from the COIN instructional video dataset, designed to evaluate event-based reasoning abilities of vision-language models across multiple dimensions including temporal, causal, spatial, contextual and general knowledge. This dataset includes 3,381 manually screened videos covering 12 main categories and 180 subcategories, such as sports, engineering tasks and household work. These videos are segmented into a total of 11,423 event clips. SPLICE assesses models' visual reasoning capabilities by requiring them to rearrange these video clips into coherent event sequences, thus filling the gaps in existing visual reasoning evaluation benchmarks.
SPLICE 数据集概述
数据集基本信息
- 数据集名称: SPLICE (Sequential Processing for Learning and Inference in Chronological Events)
- 许可证: CC-BY-NC-4.0
- 类型: 多模态、视频、视频理解、时序推理、因果推理、事件重排序、上下文推理、常识推理
- 正式名称: SPLICE: A Human Curated Benchmark for Probing Visual Reasoning in VLMs
数据集简介
SPLICE是一个人工策划的基准测试,旨在评估多模态大语言模型(MLLMs)的时序和因果推理能力。核心任务是将单个程序性事件中的一组乱序视频片段重新排序为正确的时序序列。
主要任务与能力评估
主要任务
- 视频片段重排序: 从一组乱序视频片段中重建连贯的事件序列
推理维度评估
- 时序推理
- 因果推理
- 空间推理
- 上下文推理
- 通用知识推理
数据集结构
数据规模
- 总任务数: 3,381个验证任务
- 总片段数: 11,423个视频片段
- 数据分割: 单一main分割
数据字段
video: 可播放的视频片段file_name: 视频片段文件相对路径video_id: 原始父视频唯一IDpart: 片段在父视频中的真实时序位置(1开始索引)label: 视频片段事件的人工标注文本描述domain: 任务高级类别class: 任务具体名称subset: COIN数据集原始分割start/end: 片段在原始视频中的时间戳segment_id: 片段唯一IDtask_duration: 原始父视频总时长(秒)video_url: 原始完整视频的YouTube URL
数据集创建过程
- 来源: 从COIN数据集选择教学视频
- 选择: 随机采样3,600个多样化视频
- 分割: 使用COIN的真实标注进行时间分割
- 匿名化: 移除音频轨道、元数据和原始文件名
- 人工验证: 每个任务由两名独立标注者验证
- 最终基准: 包含3,381个验证任务
引用信息
bibtex @inproceedings{ ballout2025can, title={Can you {SPLICE} it together? A Human Curated Benchmark for Probing Visual Reasoning in {VLM}s}, author={Mohamad Ballout* and Okajevo Wilfred* and Seyedalireza Yaghoubi and Nohayr Muhammad Abdelmoneim and Julius Mayer and Elia Bruni}, booktitle={The 2025 Conference on Empirical Methods in Natural Language Processing}, year={2025}, url={https://openreview.net/forum?id=deFgBHsHxl} }




