遇见数据集

GeoSQA

收藏
arXiv2019-08-20 更新2024-07-25 收录
官方服务:

资源简介:

GeoSQA是一个针对高中地理领域的情景式问答数据集,包含1,981个情景和4,110个多选题。数据集中的每个图表都经过人工标注,提供了高质量的自然语言描述,以支持NLP研究。该数据集的创建旨在解决地理领域情景理解、跨模态知识整合和推理的挑战,适用于自然语言基础的情景问答、视觉情景问答以及图表到文本的任务。

GeoSQA is a scenario-based question answering dataset focused on the high school geography domain, consisting of 1,981 scenarios and 4,110 multiple-choice questions. Each chart within the dataset has undergone manual annotation to provide high-quality natural language descriptions, thereby supporting natural language processing (NLP) research. This dataset was developed to tackle the challenges of scenario understanding, cross-modal knowledge integration and reasoning in the geography domain, and is applicable to natural language-based scenario QA, visual scenario QA, as well as chart-to-text tasks.

创建时间:
2019-08-20
搜集汇总
数据集介绍
GeoSQA 数据集图片
构建方式
GeoSQA数据集源自中国高考及模拟考试中地理科目的试题,通过爬虫技术收集了超过6000个场景与13000道题目。为确保数据质量,研究团队采用基于MatchPyramid的文本匹配方法进行去重处理,在人工标注的1000对场景上达到95.3%的准确率。随后,招募了30名具有优秀高中地理成绩的本科生对每个图表进行自然语言描述标注,标注过程遵循分层分类体系,包含22个图表类别与81个文本模板,并由3名资深审核员从充分性、公平性和客观性三个维度进行质量评估,最终保留1981个场景与4110道选择题。
特点
该数据集的核心特点在于其场景化问答(SQA)的挑战性:每个问题均附有包含文本与图表的复杂场景,答案无法直接从场景中提取,而需整合多源知识并应用于特定案例。图表均配有高质量的自然语言描述,使得数据集同时支持纯文本与视觉模态的问答研究。此外,数据集涵盖城市规划、气候、农业规划等丰富地理主题,且现有主流方法(如IR、PMI、ESIM、BERT等)在其上的表现接近随机猜测(约25%),凸显了其在知识检索、常识推理与知识应用方面的独特难度。
使用方法
研究者可利用GeoSQA开展多种任务:对于自然语言场景问答,可将场景文本与图表描述作为输入,结合外部知识库(如教科书或维基百科)进行检索与推理;对于视觉问答,可直接使用原始图表图像;对于图表到文本生成任务,可将图表作为输入,以人工标注的描述为参考。数据集中的每个问题均为四选一形式,评估指标为准确率。基准测试表明,现有方法表现不佳,因此该数据集特别适合用于探索跨模态知识整合、复杂推理与领域知识应用等前沿挑战。
背景与挑战
背景概述
GeoSQA是由南京大学计算机软件新技术国家重点实验室的黄子贤、沈雨林、李骁、魏宇昂、程龚、周琳、戴新宇和瞿裕忠等人于2019年创建的大规模地理学科场景化问答基准数据集。该数据集聚焦于高中地理层面的场景化问答任务,包含1981个场景与4110道多选题,每个场景涵盖文本与图表(如地图、图表),且图表均经过人工标注自然语言描述,以支持自然语言处理研究。其核心研究问题在于推动模型对多源知识的检索与整合能力,以及将通用知识应用于特定场景的推理能力,填补了地理领域场景化问答数据集的空白,对提升NLP在复杂多模态推理任务中的表现具有重要影响力。
当前挑战
GeoSQA所解决的领域问题在于场景化问答任务中,模型需从文本与图表中融合知识并推理,但现有方法在测试中表现近乎随机(准确率约25%),凸显三大挑战:其一,依赖未显式提供的领域知识,检索时易遗漏相关语料;其二,部分问题需常识性知识,但教科书或维基百科等语料库难以覆盖;其三,检索到的通用知识需适配至具体场景,而现有问答与阅读理解模型缺乏此类情境化应用能力。此外,数据集构建中面临图表去重与人工标注的挑战,需通过扩展的文本匹配方法精确识别近重复场景,并招募30名优秀本科生对图表进行细致分类与模板化描述,经严格审计确保标注的充分性、公正性与客观性,最终排除低质量样本,保障数据集的可靠性。
常用场景
经典使用场景
GeoSQA数据集在自然语言处理领域中最经典的使用场景是基于场景的问答(SQA)研究,尤其是在高中地理学科中。该数据集包含1,981个场景和4,110道选择题,每个场景由文本和图表组成,图表均经过人工标注为自然语言描述,从而支持纯文本驱动的问答推理。研究者可利用该数据集训练和评估模型在复杂地理场景下的知识检索、跨模态信息整合与常识推理能力,例如判断城市规划、气候分析或农业布局等现实问题。其独特之处在于,模型需将多源知识灵活应用于具体情境,而非简单从给定文档中抽取答案,这为SQA任务提供了高难度的基准测试环境。
衍生相关工作
GeoSQA数据集衍生了一系列经典研究工作,主要集中在提升场景理解与知识推理能力。例如,研究者基于该数据集构建了地理知识图谱(如Ding等人提出的概念图),通过结构化知识增强问答准确率。另有工作探索了多模态融合模型,将图表视觉特征与文本注释结合,利用注意力机制实现跨模态对齐。在文本推理方面,部分研究改进了检索增强生成(RAG)框架,优先从教科书和维基百科中提取相关证据,再通过逻辑约束筛选答案。此外,GeoSQA还催生了图到文本(diagram-to-text)基准任务,推动生成式模型对复杂地理图表进行忠实且详尽的描述,为后续跨领域SQA研究奠定了方法论基础。
数据集最近研究
最新研究方向
GeoSQA数据集的最新研究方向聚焦于基于场景的问答(SQA)在地理领域的知识整合与跨模态推理挑战。随着人工智能在复杂教育场景中的深入应用,该数据集通过提供1981个场景和4110道高中地理选择题,并手动为图表添加自然语言描述,推动了从纯文本理解到多模态知识融合的范式跃迁。当前前沿研究围绕如何突破传统问答模型在SQA任务上的瓶颈——现有方法如BERT和ESIM在此数据集上的表现近乎随机猜测,揭示了模型在检索领域知识、应用常识推理以及将通用知识适配至特定场景时的根本性局限。这一方向与教育领域智能化评估和地理知识图谱构建的热点事件紧密相连,其意义在于为开发更鲁棒的跨模态推理系统提供了关键基准,激励学界探索结合知识图谱、视觉语言模型与因果推理的新路径,从而推动AI在真实世界复杂问答场景中的落地。
相关研究论文
  • 1
    GeoSQA: A Benchmark for Scenario-based Question Answering in the Geography Domain at High School Level国家重点实验室新软件技术, 南京大学, 中国 · 2019年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务