V-ReasonBench
收藏资源简介:
V-ReasonBench是一个用于评估视频生成模型的综合基准,涵盖四个推理维度:结构化问题解决、空间认知、基于模式的推理和物理动力学。数据集包含13个推理任务,分布在4个核心维度上,采用标准化的输入-输出对格式。
V-ReasonBench is a comprehensive benchmark for evaluating video generation models, covering four reasoning dimensions: structured problem-solving, spatial cognition, pattern-based reasoning, and physical dynamics. The dataset contains 13 reasoning tasks distributed across these four core dimensions, adopting a standardized input-output pair format.
V-ReasonBench 数据集概述
数据集基本信息
- 数据集名称:V-ReasonBench
- 核心目标:用于全面评估视频生成模型在四个推理维度上的性能。
- 官方论文:https://arxiv.org/abs/2511.16668
- 官方网站:https://oahzxl.github.io/VReasonBench/
核心特征
- 13个推理任务:涵盖4个核心推理维度。
- Pass@5评估:采用可复现、答案可验证的指标。
- 统一评估框架:提供自动化评分。
- 标准化数据集:包含清晰的输入-输出对。
数据集内容与结构
数据集文件夹为 dataset/,以扁平结构包含所有基准任务的输入图像。
命名格式:
- 无子类型:
<task_name>_<index>.png(例如:shape_fit_00.png)。 - 有子类型:
<task_name>_<subtype>_<index>.png(例如:tic_tac_toe_3_05.png)。
支持的推理任务
结构化问题解决
- 算术运算:数学表达式求解。
- 代码执行:代码执行与输出。
- 数独:数独谜题求解(4×4, 9×9)。
- 井字棋:游戏状态推演。
空间认知
- 形状拟合:形状拟合谜题求解。
- 视觉对称:对称性补全。
- 颜色连接:颜色匹配与连接。
基于模式的推理
- 序列补全:序列模式补全。
- 类比求解:视觉变换理解。
- 规则遵循:遵循规则的模式补全。
物理动态
- 温度:不同条件下的冰融化。
- 杠杆平衡:杠杆平衡物理。
- 连通器:流体动力学。
- 方块滑动:方块滑动谜题。
评估详情
目录结构
evaluations/ <TaskName>/ GT/ # 真实标注(图像/CSV文件) inputs/ # 初始状态输入 predictions/ # 自动生成:提取的帧 eval_results/ # 自动生成:JSON结果
输出格式
结果保存至 evaluations/<TaskName>/eval_results/<task_name>_eval.json,包含模型摘要、聚合信息和详细结果。
关键指标
- Pass@k:在k次尝试中至少有一次成功的概率(在所有真实标注实例上平均计算)。
- 计算方式:对于每个(模型,真实标注)对,检查k个预测中是否有任何一个通过(分数≥阈值),然后为每个模型计算所有真实标注的平均成功率。
使用流程
- 视频生成:使用
dataset/中的输入图像和prompts.txt中的提示词生成视频。 - 命名规范:输出视频需命名为
<input_name>_<model>_seed<N>.mp4(例如:shape_fit_00_model1_seed0.mp4)。每个(模型,输入)对应有5个种子(seed0-seed4)用于Pass@5评估。 - 运行评估:将生成的视频置于目录中,使用
evaluate.py脚本进行评估。
引用
如需在研究中引用此数据集,请使用提供的BibTeX条目。




