遇见数据集

lmms-lab/ai2d

收藏
Hugging Face2024-03-26 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: options sequence: string - name: answer dtype: string - name: image dtype: image splits: - name: test num_bytes: 537663370.328 num_examples: 3088 download_size: 139466424 dataset_size: 537663370.328 configs: - config_name: default data_files: - split: test path: data/test-* --- @misc{kembhavi2016diagram, title={A Diagram Is Worth A Dozen Images}, author={Aniruddha Kembhavi and Mike Salvato and Eric Kolve and Minjoon Seo and Hannaneh Hajishirzi and Ali Farhadi}, year={2016}, eprint={1603.07396}, archivePrefix={arXiv}, primaryClass={cs.CV} }

数据集信息: 特征: - 问题(question):数据类型(dtype)为字符串(string) - 选项(options):数据类型(dtype)为字符串序列(string sequence) - 答案(answer):数据类型(dtype)为字符串(string) - 图像(image):数据类型(dtype)为图像类型(image) 数据集划分: - 测试集(test):数据字节数为537663370.328,样本总数为3088 下载大小:139466424 数据集总大小:537663370.328 配置项: - 配置名称(config_name):default 数据文件: - 划分(split):test 路径:data/test-* @misc{kembhavi2016diagram, 标题:《一张图表胜过十二张图片》(A Diagram Is Worth A Dozen Images), 作者:Aniruddha Kembhavi、Mike Salvato、Eric Kolve、Minjoon Seo、Hannaneh Hajishirzi、Ali Farhadi, 年份:2016, 预印本编号:1603.07396, 归档前缀(archivePrefix):arXiv, 主分类(primaryClass):cs.CV }

提供机构:
lmms-lab
原始信息汇总

数据集概述

数据集特征

  • question: 数据类型为字符串。
  • options: 数据类型为字符串序列。
  • answer: 数据类型为字符串。
  • image: 数据类型为图像。

数据集分割

  • test:
    • 示例数量: 3088
    • 数据大小: 537663370.328字节

数据集大小

  • 下载大小: 139466424字节
  • 数据集总大小: 537663370.328字节

配置

  • config_name: default
  • data_files:
    • split: test
    • path: data/test-*
搜集汇总
数据集介绍
lmms-lab/ai2d 数据集图片
构建方式
AI2D数据集(A Diagram Is Worth A Dozen Images)由艾伦人工智能研究所(AI2)的研究者构建,旨在推动图表理解领域的视觉问答研究。该数据集通过收集科学教材中的图表图像,并配以人工标注的多选题和正确答案,形成了一套包含约3000个测试样本的评估基准。每个样本包含一个问题、多个选项、一张图表图像以及对应的标准答案。数据集以HuggingFace格式存储,支持高效的图像与文本联合加载。
特点
AI2D数据集的核心特点在于其专注于科学图表理解,而非自然图像。图表通常包含符号、箭头、标签等抽象元素,对视觉推理能力提出更高要求。数据集中的问题设计注重逻辑关系与空间理解,如识别流程、比较结构或推导结论。此外,所有样本均经过严格人工审核,确保标注质量,使其成为评估多模态大模型图表理解能力的权威基准之一。
使用方法
使用AI2D数据集时,开发者可通过HuggingFace的datasets库直接加载,调用load_dataset('lmms-lab/ai2d', split='test')即可获取测试集。每个样本包含question(问题文本)、options(选项列表)、answer(正确答案索引)和image(图表图像)四个字段。典型应用场景包括评估视觉语言模型在科学图表问答任务上的表现,通过计算准确率等指标进行模型对比。由于数据集仅提供测试集,适合作为零样本评估或微调后的验证基准。
背景与挑战
背景概述
在视觉推理与自然语言理解交叉领域,图表理解任务因其对结构化视觉信息与语义分析的深度融合需求而备受关注。2016年,由艾伦人工智能研究所(AI2)的Aniruddha Kembhavi、Mike Salvato、Eric Kolve、Minjoon Seo、Hannaneh Hajishirzi及Ali Farhadi联合创建的AI2D数据集,旨在弥补传统图像描述数据集在图表推理方面的不足。该数据集包含超过5000张科学图表,并配有详细的多选题答案,核心研究问题在于推动模型从简单图像识别迈向对图表中空间关系、逻辑流程及符号意义的理解。AI2D的发布为视觉问答、多模态推理等领域提供了基准测试平台,其影响力延伸至教育智能体、科学文献解析等应用场景,成为评估模型图表理解能力的标杆之一。
当前挑战
AI2D数据集当前面临的核心挑战在于解决图表理解的领域特异性问题。首先,图表中普遍存在的抽象符号(如箭头、流程图连接线)和结构化布局(如坐标系、树状图)要求模型超越常规图像分类,具备符号推理与空间关系建模能力,而现有视觉语言模型常在此类任务中表现不佳。其次,数据集构建过程中,人工标注的选项设计需兼顾科学严谨性与语言多样性,确保问题覆盖不同学科(如物理、生物)的图表类型,但样本数量有限(测试集仅3088例),导致模型在泛化至新图表时面临过拟合风险。此外,图表中文字与图形元素的交叉引用(如标注与图例的关联)增加了多模态对齐的难度,对模型从像素级特征到语义级理解的端到端学习提出严峻考验。
常用场景
经典使用场景
AI2D(AI2 Diagram)数据集是面向图表理解与视觉推理的经典多模态基准,其核心场景聚焦于科学教育领域中的图表问答任务。该数据集包含超过3000道涵盖生物、物理、化学等学科的多选题,每道题均配有一张带有文字标注的示意图或流程图,要求模型在理解图像语义的同时,结合光学字符识别与逻辑推理来选出正确答案。这一设计使其成为评估视觉语言模型在复杂结构化图像理解能力上的试金石,尤其考验模型对图例、箭头、标签等非自然图像元素的解析与知识迁移能力。
解决学术问题
AI2D的提出有效填补了视觉问答领域在非自然图像理解上的研究空白。传统VQA数据集多聚焦于自然场景照片,而AI2D专门针对具有抽象符号和层级结构的科学图表,直接挑战模型在视觉与文本信息深度融合时的短板。该数据集解决了如何让模型从图表中提取逻辑关系、识别隐含前提并完成跨模态推理这一关键学术问题,推动了多模态学习、视觉推理与教育智能系统等方向的交叉研究,其影响力体现在被广泛用作评估大语言模型与视觉语言模型在科学推理任务上的标准基准之一。
衍生相关工作
AI2D数据集衍生了一系列具有里程碑意义的学术工作。Kembhavi等人最初提出的Diagram Question Answering任务激发了后续如FigureQA、PlotQA等图表问答数据集的构建,形成了结构化图像理解的研究脉络。在模型层面,基于AI2D的挑战催生了专门针对图表推理的架构设计,例如将视觉Transformer与图神经网络结合的方法,以及融合光学字符识别与知识图谱的端到端推理框架。这些工作不仅提升了图表问答的性能,还反哺了视觉文档理解、科学图表生成等更广泛的领域,成为连接计算机视觉与自然语言处理在科学教育应用中的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务