遇见数据集

SummerHotBreeze/Seoul_bike

收藏
Hugging Face2024-06-03 更新2024-06-12 收录
官方服务:

资源简介:

该数据集包含与自行车租赁相关的信息,涵盖了日期、租赁自行车数量、小时、温度、湿度、风速、能见度、露点温度、太阳辐射、降雨量、降雪量、季节、假日和运营日等字段。这些数据可能用于分析自行车租赁行为与天气、时间等因素的关系。

该数据集包含与自行车租赁相关的信息,涵盖了日期、租赁自行车数量、小时、温度、湿度、风速、能见度、露点温度、太阳辐射、降雨量、降雪量、季节、假日和运营日等字段。这些数据可能用于分析自行车租赁行为与天气、时间等因素的关系。

提供机构:
SummerHotBreeze
原始信息汇总

数据集概述

数据集特征

  • Date:日期,数据类型为字符串。
  • Rented Bike Count:租借自行车数量,数据类型为整数。
  • Hour:小时,数据类型为整数。
  • Temperature(°C):温度(摄氏度),数据类型为浮点数。
  • Humidity(%):湿度(百分比),数据类型为整数。
  • Wind speed (m/s):风速(米/秒),数据类型为浮点数。
  • Visibility (10m):能见度(10米单位),数据类型为整数。
  • Dew point temperature(°C):露点温度(摄氏度),数据类型为浮点数。
  • Solar Radiation (MJ/m2):太阳辐射(兆焦耳/平方米),数据类型为浮点数。
  • Rainfall(mm):降雨量(毫米),数据类型为浮点数。
  • Snowfall (cm):降雪量(厘米),数据类型为浮点数。
  • Seasons:季节,数据类型为字符串。
  • Holiday:节假日,数据类型为字符串。
  • Functioning Day:工作日,数据类型为字符串。

数据集大小

  • 训练集
    • 数据大小:1093409字节
    • 示例数量:8760
    • 下载大小:179452字节
搜集汇总
数据集介绍
构建方式
在共享出行与城市交通规划的研究背景下,Seoul_bike数据集应运而生,旨在捕捉首尔市自行车租赁系统的动态规律。该数据集基于韩国首尔自行车共享系统的历史运营记录构建,整合了从2017年12月至2018年11月期间每小时的租赁数据。构建过程中,系统性地采集了8760个样本,每个样本包含时间戳(日期与小时)、租赁数量以及一系列气象与环境变量,如温度、湿度、风速、能见度、露点温度、太阳辐射、降雨量和降雪量。此外,数据还标注了季节、是否为节假日以及是否为正常运营日,从而形成了一个多维度的结构化时间序列数据集。数据以CSV格式存储,并通过HuggingFace Datasets库进行标准化封装,支持高效的加载与预处理。
特点
Seoul_bike数据集的核心特色在于其丰富且精细的字段设计,融合了时间、气象与运营状态三大维度。时间维度上,数据以小时为粒度覆盖全年,能够揭示昼夜、季节及节假日对租赁需求的周期性影响。气象维度包含7个连续变量,从温度到太阳辐射,为分析天气条件对出行行为的驱动效应提供了扎实基础。运营维度通过“Holiday”与“Functioning Day”标签,区分了特殊日期与正常运营场景,增强了数据在政策评估中的实用性。此外,数据集规模适中(约1.09 MB),无需分布式计算即可进行快速探索,而其完整性(无缺失值)与跨年跨度则确保了建模的稳定性与泛化能力。
使用方法
使用者可通过HuggingFace Datasets库便捷地加载该数据集,只需执行`load_dataset("SummerHotBreeze/Seoul_bike")`命令即可获取默认配置下的训练集。数据以DataFrame格式呈现,可直接用于时间序列预测、回归分析或特征工程任务。在预处理阶段,建议将“Date”与“Hour”字段合并为时间戳特征,并对“Seasons”、“Holiday”及“Functioning Day”等分类变量进行独热编码。气象变量需进行归一化处理,以消除量纲影响。典型应用场景包括基于LSTM或XGBoost的租赁量预测模型构建,用户可划分80%数据用于训练,剩余20%用于验证。数据集还支持按季节或天气条件进行分组分析,便于探索不同情境下的租赁模式差异。
背景与挑战
背景概述
共享单车作为城市微交通的重要组成部分,在缓解交通拥堵、降低碳排放方面发挥着日益关键的作用。首尔市作为全球领先的智慧城市之一,其共享单车系统自2015年启动以来积累了海量运营数据。该数据集由首尔市政府及相关研究机构创建,核心研究问题在于揭示气象条件、时间特征与季节性因素对单车租赁需求的复杂影响。通过整合温度、湿度、风速、降雨量等气象变量以及节假日、功能日等时间属性,该数据集为城市交通规划与资源调度提供了宝贵的数据支撑。自发布以来,该数据集已成为城市计算与可持续交通领域的重要基准,推动了基于数据驱动的共享单车需求预测研究的发展。
当前挑战
该数据集所面临的挑战主要体现在两个方面。在领域问题层面,共享单车需求预测高度依赖于非线性、多因素交互的复杂环境,例如降雨与低温的叠加效应可能导致需求骤降,而晴好天气下的节假日则可能引发局部区域需求激增,传统统计模型难以精准捕捉此类动态变化。在构建过程中,数据集面临数据采集与清洗的困难,例如气象传感器可能因设备故障产生异常值,时间序列中的缺失记录需要合理插补,同时不同季节与功能日的分类标准需统一,以确保数据质量与模型泛化能力的可靠性。
常用场景
经典使用场景
在智慧城市与共享出行研究领域,Seoul_bike数据集凭借其精细化的时空粒度与多维气象特征,成为短时租赁自行车需求预测的经典基准。该数据集记录了每小时自行车租赁数量及同期温度、湿度、风速、能见度、日照辐射、降雨量、降雪量等气象变量,同时标注了季节、节假日与运营状态等时间属性,为构建高精度时序预测模型提供了理想的数据基础。研究者常以此为基础,运用长短期记忆网络、门控循环单元或Transformer等深度学习架构,捕捉气象与时间因素对出行需求的非线性耦合效应,从而验证模型在复杂动态环境下的泛化能力。
解决学术问题
该数据集有效解决了共享出行系统在非平稳需求预测中的关键学术难题,即如何量化气象突变与时间节律对用户行为的联合影响。通过整合连续数值型气象特征与分类别的时间标签,它使得研究者能够分离季节趋势、节假日效应与极端天气的干扰成分,从而提升预测模型在突发事件下的鲁棒性。这一贡献不仅推动了时序预测领域对多源异构特征融合方法的探索,也为对比不同正则化策略与注意力机制的效果提供了标准化评估平台,深刻影响了可解释人工智能在交通流量建模中的理论发展。
衍生相关工作
围绕Seoul_bike数据集,学术界涌现出一系列衍生性经典工作,例如引入图神经网络建模站点间空间依赖性的区域需求预测模型,以及融合因果推断技术剔除天气混杂效应的反事实需求估计方法。部分研究进一步将其与外部人口流动数据联合,构建多模态需求生成框架,探索城市功能区划对出行模式的影响。这些工作不仅深化了对共享出行系统自适应性调控机制的理解,也为后续基于强化学习的实时定价与奖励调度策略的设计提供了实证基础,形成了一条从特征工程到决策优化的完整研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务