遇见数据集

dmariaa70/GO-MO

收藏
Hugging Face2026-05-29 更新2025-12-20 收录
官方服务:

资源简介:

GO-MO是一个大规模图增强交通数据集,用于数据驱动的时空交通分析。该数据集提取自西班牙马德里市议会的开放数据门户,包含超过15亿条记录,涵盖2015-2024十年间的交通数据。数据集包含三种交通指标(交通强度、平均速度、传感器占用率)和时空数据及元数据,并提供了两种图表示(基于路线和基于道路网络)。数据集统计信息详细,包括时间戳数量、记录总数、测量点数量等。

GO-MO is a large-scale graph-augmented traffic dataset for data-driven spatio-temporal traffic analysis. The dataset is extracted from the publicly available Open Data Portal of the City Council of Madrid (Spain), comprising more than 1.5 billion records of three traffic-related metrics together with spatio-temporal data and metadata, spanning a ten-year period (2015-2024). Additionally, the GO-MO dataset introduces two graph representations extracted from traffic data and metadata: one for routes between nodes and another for the road network. The dataset provides detailed statistics including the number of timestamps, total records, and measurement points.

提供机构:
dmariaa70
搜集汇总
数据集介绍
dmariaa70/GO-MO 数据集图片
构建方式
GO-MO数据集源自马德里市政厅公开数据门户,系统整合了2015年至2024年间超过15亿条交通记录,涵盖交通强度、传感器占用率与平均速度三项核心指标。数据以15分钟为采样间隔,跨越350,688个时间戳,经过去除异常值与插补缺失值等严格清洗流程,构建成按年份划分的CSV文件。此外,该数据集创新性地引入了两种图结构:基于路线的有向图与基于路网的多向图,分别通过传感器间最短路径距离与OpenStreetMap路网拓扑来定义节点与边,从而赋予时序数据以空间关联性。
特点
GO-MO的核心特色在于其海量规模与图增强的时空表征能力。数据总量超过15亿条,覆盖5,157个传感器节点,时间跨度长达十年,为长期交通模式分析提供了坚实基础。尤其突出的是,该数据集不仅提供原始交通度量,还发布了路线图与路网图两种图结构,前者以传感器为节点、以路由距离为边权重,后者则细致刻画道路交叉口与路段连接,并嵌入传感器标识符,实现了时序数据与空间结构的无缝融合,为图神经网络等深度学习模型提供了天然的数据载体。
使用方法
用户可通过Pandas直接读取年度CSV文件与传感器元数据表,利用共享的`sensor_id`字段将交通记录与传感器属性进行关联,从而获得包含位置、车道数、限速等丰富信息的完整数据视图。图结构以NetworkX pickle格式提供,加载后即可用于图分析或图神经网络输入。GO-MO还开源了完整的处理与实验代码,使用者可复现数据清洗与图构建流程,或基于此开展交通预测、异常检测、时空建模等研究任务,既适合传统的统计分析方法,也适配先进的机器学习范式。
背景与挑战
背景概述
在智慧城市与交通大数据研究蓬勃发展的当下,时空交通预测已成为城市交通管理与规划的核心技术,但其发展受限于高质量、长时序、附带空间拓扑信息的大规模公开数据集的匮乏。GO-MO数据集由David María-Arribas、Alfredo Cuesta-Infante和Juan J. Pantrigo等研究人员于2025年创建,源自西班牙马德里市议会的开放数据门户。该数据集以超过15亿条记录、跨越十年(2015-2024年)的交通强度、传感器占有率和平均速度三项指标,以及每15分钟的高采样频率,构建了迄今最具规模的城市交通时序数据库。更为关键的是,GO-MO创新性地引入了两种图结构——基于传感器间最短路径的路线图与基于OpenStreetMap的路网图,将交通观测数据与空间拓扑关系深度融合,为数据驱动的时空交通分析提供了标准化的多模态基准,有力推动了图神经网络与时序模型在该领域的交叉研究。
当前挑战
GO-MO数据集所面对的领域挑战主要集中在三个方面。其一,城市交通流具有显著的非线性、周期性与突发性特征,传统统计模型难以捕捉其复杂的时空依赖性,而现有数据集往往规模有限或缺失空间结构信息,制约了深度时空模型的训练与泛化。其二,原始数据存在传感器读数错误、缺失值及异常车速等质量问题,GO-MO通过插值标记与原始值保留策略进行了精细的清洗与透明化处理,但研究者仍需审慎处理人工干预对模型评估的潜在影响。其三,在构建过程中,将超过五千个传感器映射至包含三万五千余个节点的路网图,并精确计算邻接关系与边权重,面临计算复杂度高与多源数据对齐的工程挑战,同时以pickle格式发布的图文件也带来了安全加载与跨平台使用的便利性障碍。
常用场景
经典使用场景
在城市交通研究领域,GO-MO数据集凭借其跨越十年、包含超过15亿条记录的海量规模,成为时空交通预测与分析的经典基准。该数据集融合了交通强度、平均速度与传感器占用率三项核心指标,并以15分钟为采样间隔,为短时交通流预测、长期趋势建模及异常检测提供了丰富的时间序列基础。尤为重要的是,其内置的路线图和道路网络图两种图结构,使得基于图神经网络的交通流预测成为标志性应用场景。研究者常利用传感器间的空间关联与路网拓扑,构建时空图卷积模型来捕捉交通模式的动态演化,从而验证新算法在多节点、长时间跨度的复杂交通环境下的有效性。
解决学术问题
GO-MO数据集回应了学术界对大规模、带图结构、长期覆盖的真实交通数据的迫切需求,填补了现有数据集的规模与时空维度缺口。它解决了图神经网络在交通预测中因数据稀疏、图结构单一而导致的泛化能力不足问题,尤其是提供了两种不同粒度的图表示(路线图与道路网络图),使得研究能够系统探究图拓扑对预测精度的影响。此外,该数据集通过标记插值标志和读取错误字段,为处理缺失值、异常检测和数据质量控制提供了透明机制,推动了鲁棒性评估与数据修复方法的研究,对构建可解释的时空交通模型具有深远意义。
衍生相关工作
基于GO-MO数据集,学术界已经衍生出众多经典研究,包括提出面向大规模图数据的轻量级时空注意力网络,以及结合交通流与天气数据构建的多模态融合预测模型。在数据质量领域,研究者利用其提供的原始强度与插值字段,开发了自适应缺失值填补算法,显著提升了模型在噪声环境下的鲁棒性。此外,由于该数据集内嵌了道路网络图,推动了可导图采样技术和图结构学习在交通领域的突破,例如设计用于捕捉跨传感器长程依赖的动态图卷积结构。这些工作共同拓展了时空数据挖掘的边界,为下一代智能交通系统奠定了理论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务