RotBench
收藏资源简介:
RotBench是一个用于评估多模态大型语言模型(MLLMs)是否能识别图像方向的基准数据集。它包含350张经过人工筛选的图像,分为两个子集:大型子集包含300张图像,小型子集包含50张图像。所有图像都是从Spatial-MM数据集中选取的,并经过两阶段的人工验证,确保旋转是可区分的。
RotBench 数据集概述
数据集简介
RotBench 是一个用于评估多模态大语言模型(MLLMs)识别图像方向能力的基准数据集。该数据集包含 350 张经过人工筛选的图像,主要用于测试模型对图像旋转的识别性能。
数据集结构
数据划分
- Large 子集:包含 300 个样本,数据量为 4,651,568 字节
- Small 子集:包含 50 个样本,数据量为 694,935 字节
特征字段
- image:图像数据(图像格式)
- image_name:图像名称(字符串格式)
数据来源
所有图像均选自 Spatial-MM 数据集(https://github.com/FatemehShiri/Spatial-MM),并经过两阶段人工验证流程,确保旋转效果可区分。
技术细节
- 下载大小:10,233,742 字节
- 数据集总大小:5,346,503 字节
- 许可协议:Apache-2.0
- 任务类别:图像-文本到文本
使用方式
可通过 Hugging Face datasets 库加载数据集: python from datasets import load_dataset dataset = load_dataset("tianyin/RotBench")
引用信息
如需在研究中使用本数据集,请引用: bibtex @misc{niu2025rotbenchevaluatingmultimodallarge, title={RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation}, author={Tianyi Niu and Jaemin Cho and Elias Stengel-Eskin and Mohit Bansal}, year={2025}, eprint={2508.13968}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2508.13968}, }




