ChongyanChen/VQAonline
收藏资源简介:
VQAonline是第一个所有内容均源自真实使用案例的视觉问答(VQA)数据集。该数据集包含来自在线问答社区(如StackExchange)的64K个视觉问题。与之前的数据集不同,VQAonline包含:(1)澄清问题的真实上下文,(2)提问者从社区提供的所有答案中验证为可接受的答案,(3)答案长度显著更长(例如,平均173字,而之前的工作通常为11字或更少),(4)每个视觉问题的用户选择主题来自105个不同的主题,揭示了数据集的固有多样性。数据集总共有64,696个视觉问题,分为训练集(665个问题)、验证集(285个问题)和测试集(63,746个问题)。问题和答案以json文件形式提供,图像文件分为7个文件夹存放。
VQAonline是第一个所有内容均源自真实使用案例的视觉问答(VQA)数据集。该数据集包含来自在线问答社区(如StackExchange)的64K个视觉问题。与之前的数据集不同,VQAonline包含:(1)澄清问题的真实上下文,(2)提问者从社区提供的所有答案中验证为可接受的答案,(3)答案长度显著更长(例如,平均173字,而之前的工作通常为11字或更少),(4)每个视觉问题的用户选择主题来自105个不同的主题,揭示了数据集的固有多样性。数据集总共有64,696个视觉问题,分为训练集(665个问题)、验证集(285个问题)和测试集(63,746个问题)。问题和答案以json文件形式提供,图像文件分为7个文件夹存放。
VQAonline
数据集描述
VQAonline 是首个所有内容源自真实使用场景的 VQA 数据集。该数据集包含 64,000 个视觉问题,来源于在线问答社区(即 StackExchange)。
VQAonline 与先前的数据集不同,具有以下特点:
- 包含澄清问题的真实上下文。
- 包含提问者验证为可接受的社区提供的答案。
- 答案较长,平均 173 个单词,而先前工作通常为 11 个单词或更少。
- 每个视觉问题都有用户选择的 105 个不同主题,揭示了数据集的内在多样性。
数据集结构
VQAonline 数据集总共包含 64,696 个视觉问题。数据集设计支持少样本设置,具体划分如下:
- 训练集:665 个视觉问题
- 验证集:285 个视觉问题
- 测试集:63,746 个视觉问题
问题、上下文和答案以 json 文件形式提供。图像文件被分为 7 个文件夹(从 images1 到 images7),每个文件夹包含 10,000 个图像文件,除了 "images7" 文件夹。
引用
bibtex @article{chen2023vqaonline, title={Fully Authentic Visual Question Answering Dataset from Online Communities}, author={Chen, Chongyan and Liu, Mengchen and Codella, Noel and Li, Yunsheng and Yuan, Lu and Gurari, Danna}, journal={arXiv preprint arXiv:2311.15562}, year={2023} }




