DocVQA是一个文档视觉问答数据集,由Minesh Mathew、Dimosthenis Karatzas和C.V. Jawahar等研究人员在2021年WACV会议上发布。该数据集包含12,000多张文档图像和50,000个问答对,文档图像来源于UCSF Industry Documents Library,涵盖信件、备忘录、报告等多种类型。DocVQA旨在评估模型对文档图像的理解能力,为文档分析和多模态理解研究提供重要基准资源。