DSR-Train, DSR-Bench
收藏资源简介:
DSR-Train是一个包含50K问答对的训练数据集,用于动态空间推理任务。DSR-Bench是一个包含1484个问答对的基准测试集,经过人工注释进一步细化。这些数据集用于评估对象和场景级别的3D理解、多对象交互、视角变换和一般动态场景中的细粒度时间推理。
DSR-Train is a training dataset containing 50K question-answer pairs for dynamic spatial reasoning tasks. DSR-Bench is a benchmark dataset with 1484 question-answer pairs, which was further refined via manual annotation. These datasets are used to evaluate 3D understanding at the object and scene levels, multi-object interaction, viewpoint transformation, and fine-grained temporal reasoning in general dynamic scenes.
DSR Suite 数据集概述
数据集基本信息
- 数据集名称:DSR Suite
- 核心内容:包含一个用于动态空间推理任务的自动化数据生成流程,以及一个将3D基础模型的几何先验无缝集成到视觉语言模型中的模块。
- 主要构成:
- DSR-Train:一个包含5万个问答对的训练数据集。
- DSR-Bench:一个包含1484个问答对的基准测试集,该数据集经过人工标注者进一步细化。
数据生成与特点
- 生成方式:通过自动化数据生成流程构建多项选择题问答对。
- 数据源:基于野外视频构建。
- 评估维度:生成的问答可用于评估通用动态场景中的以下能力:
- 对象级和场景级的3D理解。
- 多对象交互。
- 视角变换。
- 细粒度时序推理。
- 生成要素:利用随机选择的视点、目标对象、预定义模板和答案推导规则。
模型增强模块
- 模块名称:几何选择模块
- 模块缩写:GSM
- 结构:由两个Q-Former堆叠而成。
- 第一个Q-Former用于压缩问题语义。
- 第二个Q-Former用于从3D基础模型中提取与问题相关的知识,并将其压缩为一组紧凑的几何令牌。
- 作用:将这些几何令牌与视觉令牌连接后,能在保持视觉语言模型通用理解性能的同时,提升其空间推理能力。
相关资源
- 论文地址:https://arxiv.org/abs/2512.20557
- 数据与模型集:https://huggingface.co/collections/TencentARC/dsr-suite
- 演示视频:https://www.youtube.com/watch?v=ps8wzm8kDC0
引用信息
如果使用本工作,请考虑引用: bibtex @misc{zhou2025learning, title={Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models}, author={Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi}, year={2025}, eprint={2512.20557}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2512.20557}, }




