facebook/textvqa
收藏资源简介:
TextVQA数据集是一个专为视觉问答任务设计的资源,特别强调需要模型理解和推理图像中的文本以回答问题。该数据集包含45,336个问题,涉及28,408张来自OpenImages数据集的图像。所有问题均为英文,数据集分为训练集、验证集和测试集。每个数据实例包含图像ID、问题、图像和答案等详细特征。数据集的创建涉及众包注释,并使用OpenImages数据集作为图像来源。该数据集遵循CC-BY-4.0许可。
TextVQA数据集是一个专为视觉问答任务设计的资源,特别强调需要模型理解和推理图像中的文本以回答问题。该数据集包含45,336个问题,涉及28,408张来自OpenImages数据集的图像。所有问题均为英文,数据集分为训练集、验证集和测试集。每个数据实例包含图像ID、问题、图像和答案等详细特征。数据集的创建涉及众包注释,并使用OpenImages数据集作为图像来源。该数据集遵循CC-BY-4.0许可。
数据集概述
数据集名称: TextVQA
语言: 英语
许可证: CC-BY-4.0
多语言性: 单语
数据集大小: 10K<n<100K
源数据: 原始数据
任务类别: 视觉问答
数据集结构
数据实例:
- 问题 (question): 字符串,关于图像的问题
- 图像ID (image_id): 字符串,图像的ID
- 图像 (image): 图像对象
- 图像宽度 (image_width): 整数,图像的宽度
- 图像高度 (image_height): 整数,图像的高度
- 答案 (answers): 字符串序列,每个问题有10个答案
- 问题ID (question_id): 整数,问题的唯一ID
- 集合名称 (set_name): 字符串,问题所属的集合
数据分割:
- 训练集 (train): 34602个样本,21381310字节
- 验证集 (validation): 5000个样本,3077854字节
- 测试集 (test): 5734个样本,3025046字节
数据集创建
注释者: 众包
语言创建者: 众包
初始数据收集和规范化: 图像来自OpenImages v4数据集,通过OCR系统筛选包含文本的图像。
注释过程: 图像经过自动筛选后,由人工注释者验证图像中是否包含文本,并提出相关问题。每个问题由10个不同的注释者提供答案。
个人和敏感信息: 数据集可能包含人脸、车牌和文档等敏感信息。
使用数据集的考虑
社会影响: 数据集推动了场景文本识别和推理在机器学习应用中的重要性,并促进了相关研究的发展。
偏见讨论: 数据集通过收集多个答案来减少异常值偏差,并通过评估指标考虑所有答案。
其他已知限制: 数据集仅包含英语问题,但图像可能包含非英语拉丁字符。数据集的性能也依赖于所使用的OCR质量。




