遇见数据集

GeoGLUE

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个评估地理语言理解能力的基准,它包含了六个自然语言理解任务。这些任务涵盖了地理自然语言处理的多个方面,以大规模收集自公开发布的地理资源的数据为支撑。具体任务包括地理文本相似性评估、地理元素标注、地理组成分析、地理情境分割以及地理实体对齐等。

This dataset is a benchmark for evaluating geographical language understanding capabilities. It comprises six natural language understanding tasks. These tasks cover multiple aspects of geographical natural language processing, and are supported by large-scale data collected from publicly released geographical resources. The specific tasks include geographical text similarity evaluation, geographical element annotation, geographical composition analysis, geographical context segmentation, and geographical entity alignment, among others.

搜集汇总
数据集介绍
GeoGLUE 数据集图片
构建方式
地理语言理解评测基准GeoGLUE的数据集构建依托于多种公开地理资源,涵盖GIS基础数据、二手房交易信息、本地生活服务数据及地图应用查询日志。针对地理文本检索任务,从OpenStreetMap采集POI及其经纬度、几何关系等结构化信息,并由领域专家人工构造查询语句与正负样本对。地理要素标注任务的数据来源于主流房产交易网站,仅保留包含完整行政划分、POI名称与门牌号的详细地址文本。地理成分分析与位置切分任务则通过标注人员模拟真实场景生成查询语句。实体对齐任务从本地信息服务中提取地理表达,构建句子对并过滤长度差异过大的样本。所有数据均经隐私过滤处理,确保符合匿名保护规范。
特点
GeoGLUE作为首个综合性地理语言理解评测基准,具有鲜明的领域特性与任务多样性。其数据充分反映了地理表达的层级性、歧义性与口语化特点,如同一地点的多种表述、非标准地址缩写及混合中英文的POI名称。基准涵盖六大任务,横跨地理POI检索、序列标注与文本分类三大范畴,既包括召回与重排序的检索任务,也涉及细粒度地理要素识别、成分分析与实体对齐。数据集规模从数千至数万不等,测试集不公开以保障评测公平性。此外,GeoGLUE具备可复用性与扩展性,已应用于相关研究工作并积累了大量下载量。
使用方法
GeoGLUE的使用遵循标准评测流程,用户可通过ModelScope平台获取训练集与开发集,测试集仅用于在线排行榜评估。对于地理文本相似度任务,MRR@x作为核心指标衡量检索与重排序效果;序列标注任务采用精确率、召回率与Micro-F1评价模型对地理要素、成分及位置信息的识别能力;实体对齐任务则以Macro-F1评估多分类性能。基准提供了BERT、RoBERTa、ERNIE等预训练模型的基线结果,用户可在此基础上进行模型调优。所有任务均支持自定义超参数与优化器,便于开展对比实验与领域迁移研究。
背景与挑战
背景概述
在地理信息系统与基于位置的服务飞速发展的时代背景下,海量地理文本数据的涌现对自然语言处理技术提出了前所未有的挑战。现有通用领域评测基准如GLUE与SuperGLUE虽推动了语言理解研究的进步,却难以适配地理文本中特有的层级化地名结构、非规范口语表达及多源异构数据融合等复杂特性。为填补这一领域空白,华东师范大学与阿里巴巴集团的研究团队于2023年联合发布了GeoGLUE基准,这是首个全面聚焦地理语言理解的评测体系。该基准涵盖地理文本相似度检索与重排序、地理要素标注、地理成分分析、地理时空切分及地理实体对齐六大核心任务,为地理信息检索、智能物流及位置导航等应用场景提供了标准化评估框架,其发布后模型下载量已逾二十九万次,显著推动了地理NLP领域的发展。
当前挑战
GeoGLUE所面临的挑战主要体现在领域问题与构建过程两个维度。在领域问题层面,地理文本存在显著的非规范性,如用户查询中混杂口语化简写(如“LA”与“Los Angeles”混用)及非常规POI名称,导致语义歧义性极高;同时,地理实体间的空间层级关系与坐标信息的精准对齐需要模型同时理解文本语义与GIS空间数据,这对现有模型的跨模态推理能力构成严峻考验。在构建过程中,研究团队需从OpenStreetMap等公开资源中爬取海量数据,并应对隐私保护规则下的数据脱敏难题;此外,六项任务的数据标注需由经过严格培训的标注员依据BIOES方案完成,且需确保至少70%的标注一致性,这一过程涉及高昂的人力成本与质量控制挑战,特别是对于地理成分分析等短文本且标签类别达28种的任务,标注歧义性尤为突出。
常用场景
经典使用场景
GeoGLUE作为首个地理自然语言理解评估基准,其经典使用场景聚焦于地理文本的语义检索与排序。在物流配送、位置导航与周边发现等日常应用中,用户查询常包含非标准口语化表达,而GeoGLUE通过地理文本相似性召回与重排序任务,精准匹配查询与兴趣点。该基准尤其适用于大规模POI数据库的召回阶段,利用MRR@5等指标评估模型在复杂地理语境下的检索精度,为地图应用提供高效、鲁棒的文本-位置关联能力。
实际应用
在实际应用中,GeoGLUE直接赋能地图服务与本地生活平台。例如,GeoTES任务支撑外卖配送地址的精准定位与路径规划,GeoETA任务通过地址要素解析实现快递分拣自动化,GeoEAG任务则用于跨系统地址数据融合(如二手房交易平台与地图数据库的实体对齐)。此外,该基准已集成至ModelScope平台,其数据集与预训练模型(如MGEO)累计下载超29万次,显著降低了地理AI应用的开发门槛,加速了智慧城市与位置服务产业的落地。
衍生相关工作
GeoGLUE的提出催生了多项衍生研究。一方面,基于其任务框架,研究者开发了地理预训练语言模型MGEO,通过多模态数据(文本与GIS坐标)联合训练提升地理实体表征能力。另一方面,该基准被用于评估StructBERT、Nezha等模型在地理场景的鲁棒性,并启发后续工作如GeoBERT对层级位置编码的改进。此外,GeoGLUE的数据集与评估协议为中文地理NLP社区提供了开放基线,推动了地址解析、POI检索等子任务的标准化评测生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务