mstz/electricity
收藏官方服务:
资源简介:
--- language: - en tags: - electricity - tabular_classification - binary_classification - UCI pretty_name: Electricity size_categories: - 10k<n<100K task_categories: - tabular-classification configs: - electricity license: cc --- # Electricity The [Electricity dataset](https://www.openml.org/search?type=data&sort=runs&id=151&status=active) from the [OpenML repository](https://www.openml.org/). # Configurations and tasks | **Configuration** | **Task** | **Description** | |-------------------|---------------------------|-------------------------| | electricity | Binary classification | Has the electricity cost gone up?| # Usage ```python from datasets import load_dataset dataset = load_dataset("mstz/electricity", "electricity")["train"] ```
提供机构:
mstz原始信息汇总
数据集概述
基本信息
- 名称: Electricity
- 语言: 英语
- 标签:
- 电力
- 表格分类
- 二元分类
- UCI
- 美观名称: Electricity
- 大小分类: 10k<n<100K
- 任务分类: 表格分类
- 配置: 电力
- 许可证: cc
任务描述
- 配置: 电力
- 任务: 二元分类
- 描述: 电力成本是否上升?
搜集汇总
数据集介绍

构建方式
该数据集源自OpenML存储库中的Electricity数据集,旨在服务于表格分类任务。其构建方式基于对电力成本相关历史数据的系统整理与标注,将原始数据划分为训练集(train.csv),并明确配置为二分类问题——预测电力成本是否上升。数据规模介于100万至1000万条记录之间,采用CC许可证开放共享,确保了学术研究与工业应用的广泛可及性。
特点
数据集以电力成本趋势预测为核心,具有鲜明的时序经济特征。其标签设计简洁明晰,聚焦于二元状态判别,降低了模型训练的复杂性。同时,标签中隐含的多类别分类潜力(如成本变化幅度)为进阶分析提供了扩展空间。庞大的样本量(1M-10M)赋予数据统计稳健性,适合训练高泛化能力的分类模型。
使用方法
用户可通过HuggingFace Datasets库便捷调用,仅需一行Python代码`load_dataset("mstz/electricity", "electricity")["train"]`即可加载训练数据。该数据集默认仅提供单一切割(train),用户可基于时间顺序或随机抽样自行划分验证与测试集。数据以CSV格式存储,兼容Pandas、Scikit-learn等主流工具,便于快速集成至分类模型开发管线。
背景与挑战
背景概述
电力数据作为能源领域的重要研究对象,在智能电网与可再生能源系统优化中扮演着关键角色。Electricity数据集由OpenML平台收录,其核心研究问题聚焦于电力成本的动态变化预测,旨在通过历史电力消费与价格数据,构建能够判断电力成本是否上涨的二分类模型。该数据集创建于机器学习与能源经济交叉研究蓬勃发展的时期,由OpenML社区的研究人员整理发布,为能源领域的时间序列分析与成本预测提供了标准化基准。凭借其超过百万条样本的规模,Electricity数据集在电力市场分析、需求响应策略评估以及能源价格波动建模等研究方向产生了广泛影响,成为检验分类算法在真实经济场景中泛化能力的经典测试床。
当前挑战
该数据集所解决的领域问题在于电力成本趋势预测这一复杂经济现象,其挑战包括电力价格受季节因素、突发事件与政策调控等多重非线性因素影响,导致特征与标签间关系高度非平稳,传统分类模型难以捕捉长期依赖。在构建过程中,数据采集面临来自不同地域电表记录的异构性问题,需对缺失值与异常值进行鲁棒处理;时间戳对齐与特征工程要求精准匹配消费模式与价格变动,而标签定义(成本是否上涨)需设定合理阈值以平衡经济敏感性与分类难度。此外,多变量时间序列中的共线性与滞后效应进一步增加了模型设计的复杂性。
常用场景
经典使用场景
在能源经济与智能电网研究的交汇领域,mstz/electricity数据集被广泛用于二元分类任务,核心目标在于预测电力成本是否上涨。该数据集源自OpenML仓库,包含超过百万条记录,为时序特征驱动的分类模型提供了丰富的训练样本。研究者常将其作为基准数据集,评估逻辑回归、梯度提升树或深度神经网络在电力市场波动预测中的表现,尤其关注特征工程对分类精度的影响。通过该数据集,可以系统性地探究电价波动的关键驱动因素,如季节效应、负荷变化与市场供需关系。
解决学术问题
该数据集解决了能源经济学中一个核心的学术难题:如何从高维时序数据中有效识别电价上涨的早期信号。传统计量模型往往受限于线性假设和样本量不足,而mstz/electricity提供了大规模、带标签的真实世界数据,使得研究者能够验证机器学习方法在非平稳电价序列上的泛化能力。其意义在于推动了可解释性分类算法在能源领域的应用,例如通过SHAP值分析揭示不同特征对电价预测的贡献权重,为后续构建稳健的能源价格预警系统奠定了方法论基础。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作,包括基于长短期记忆网络的电价趋势预测模型、结合注意力机制的时序分类框架,以及将电价上涨预测与异常检测相结合的集成学习系统。部分学者还将其与天气、经济指标等外部数据融合,构建多模态预测模型。此外,该数据集被纳入多项基准测试,用于对比不同特征选择算法在能源领域分类任务中的效率,推动了自动化机器学习在电力市场分析中的落地探索。
以上内容由遇见数据集搜集并总结生成



