遇见数据集

electricsheepeurope/europe-ilo-how-temp-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲劳动力市场数据,专注于按经济活动和职业划分的就业人员实际平均每周工作时数这一指标。数据集涵盖38个欧洲国家从1991年到2025年的441,005个观测值,每年更新。数据通过ILOSTAT REST API获取,并经过 harmonization 处理,确保符合国际劳工统计学家会议(ICLS)的定义。数据集包含国家代码、国家名称、数据来源、指标代码、指标名称、经济活动和职业分类变量、观测年份、观测值、观测状态标志以及相关注释等字段。数据质量方面,该数据集为年度频率,当同一国家×年份有多个数据源时,采用ILO选择的最佳来源,且分类列仅在指标发布细分数据时才非空。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Europe重新打包为Parquet格式,便于使用Hugging Face的`load_dataset()`函数直接加载。

This dataset contains European labour market data from the International Labour Organization (ILO) ILOSTAT database, focusing on the indicator Mean weekly hours actually worked per employed person by economic activity and occupation. It includes 441,005 observations across 38 European countries from 1991 to 2025, updated annually. Data is pulled directly from the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset features columns such as country code, country name, data source, indicator code, indicator name, economic activity and occupation classification variables, observation year, observed value, observation status flags, and relevant notes. Regarding data quality, the dataset is annual frequency; when multiple sources exist for the same country×year, the ILO-selected best source is used, and disaggregation columns are non-null only when the indicator publishes that breakdown. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, repackaged by Electric Sheep Europe into Parquet format for easy loading via Hugging Faces `load_dataset()` function.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集来源于国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲地区受雇人员按经济活动与职业划分的平均每周实际工作时长。数据通过ILOSTAT的REST API直接获取,并依据欧洲ISO3国家代码进行筛选过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行协调统一,所有数据来源均在source.label字段中标记,以保障其可追溯性。最终数据集包含441,005条观测记录,覆盖38个欧洲国家,时间跨度从1991年至2025年。
特点
数据集呈献出多维分类的精细结构,包含ref_area(国家代码)、classif1(经济活动分类)和classif2(职业分类)等核心字段,允许用户按地域、行业与职业层级深入剖析工作时长模式。每个观测值的obs_status标志提供了数据质量的明确指示,如临时性或不可靠性。数据采用年度频率发布,由ILO选取每个国家-年份组合下的'最佳来源',确保了数据的一致性与权威性。
使用方法
研究者可通过HuggingFace的datasets库便捷加载该数据集,并转换为pandas DataFrame进行后续分析。典型用法包括按国家代码ref_area筛选特定国家的数据子集,或按indicator代码对特定指标进行时间序列分析。用户还可利用pivot_table构建国家×年份的矩阵视图,以支持跨国的横向比较与趋势研究。数据集的机器可读格式与标准化字段设计,使其能够无缝融入从数据清洗到模型训练的完整工作流。
背景与挑战
背景概述
该数据集名为“europe-ilo-how-temp-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per”,由国际劳工组织(ILO)通过ILOSTAT数据库发布,并由Electric Sheep Europe于2025年重新整理后托管于HuggingFace平台。ILOSTAT作为全球劳动统计的权威来源,整合了来自各国劳动力调查、家庭收入调查及行政记录的数据,旨在提供标准化的劳动指标。该数据集聚焦于欧洲38个国家1991年至2025年间按经济活动与职业划分的就业者平均每周实际工作小时数,包含441,005条观测记录。其核心研究问题在于揭示欧洲劳动力市场的工时分布模式与长期演变趋势,为劳动经济学、社会政策分析及跨国比较研究提供了高粒度的实证基础,对理解欧洲就业质量与生产效率具有重要影响力。
当前挑战
该数据集所解决的领域问题核心挑战在于劳动工时数据的异质性与可比性。不同欧洲国家在调查方法、统计定义(如ICLS标准执行差异)及数据收集频率上存在显著不一致,导致原始数据难以直接用于跨区域或跨时间序列分析。此外,构建过程中面临多重挑战:其一,需从ILOSTAT的REST API中过滤出特定于欧洲的ISO3国家代码,并处理多源数据中“最佳来源”的选择逻辑以确保数据质量;其二,数据中以浮动值记录的观测值需应对分类变量(如经济活动部门、职业技能水平)的不一致性,以及缺失值(如性别或细分分类仅在部分指标中出现)带来的稀疏性问题;其三,年度频率数据限制了更细粒度(如月度或季度波动)的分析能力,且部分观测值标记为“不可靠”或“临时性”,需通过状态标志位进行谨慎处理以维护建模的稳健性。
常用场景
经典使用场景
在劳动经济学与比较社会政策研究中,该数据集被广泛用于分析欧洲各国按经济活动与职业类别划分的雇员实际周工作小时数的长期演变趋势。研究者通常会利用其跨越1991至2025年的面板结构,考察不同国家间工作时间的收敛或分化现象,或结合分类变量如经济部门与技能水平,探究产业结构变迁对劳动投入模式的影响。时间序列分析与面板数据回归是该场景下最常采用的方法。
衍生相关工作
基于该数据,衍生出了若干重要的学术与工具类工作。一方面,研究者开发了专门用于欧洲劳动力市场时序数据的可视化仪表盘与快速分析报告框架,降低了非专业用户的使用门槛。另一方面,在计量经济学领域,该数据集被用作检验结构断点识别算法与多层级面板数据插补技术效果的基准案例。此外,部分研究在此基础上构建了各国‘有效劳动供给指数’,进而探讨经济增长与闲暇福利之间的替代关系。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲38个国家1991至2025年间按经济活动与职业分类的就业者平均每周实际工作时间,为劳动经济学的时序预测与分类回归提供了高质量面板数据。当前前沿研究方向主要围绕后疫情时代劳动力市场重构、灵活就业模式对工时分布的影响,以及AI与自动化对职业结构性替代的量化评估。通过与ILOSTAT的协同,研究者可追踪欧洲各国在工时法规调整、四天工作制试点、以及远程办公常态化下的工时演变轨迹,为国际劳工组织体面劳动目标(SDG 8)提供实证支撑。该数据因覆盖跨越三十余年、多维度细分特征,正成为解析欧洲经济韧性、职业流动性及就业质量异质性的关键工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务