遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、经济活动和城乡划分的就业人员实际平均每周工作小时数 | 欧洲(ILOSTAT),包含100,003个观测值,覆盖38个欧洲国家,时间跨度为1992年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为工作时间,具体指标是按性别、经济活动和城乡划分的就业人员实际平均每周工作小时数(指标代码:HOW_TEMP_SEX_ECO_GEO_NB)。数据集是表格形式,适用于表格分类、表格回归和时间序列预测任务。数据通过ILOSTAT REST API获取,并过滤为欧洲国家,采用ILO的统计定义进行标准化。数据模式包括国家代码、来源、指标、性别分类(总计、男性、女性)、经济活动分类、城乡分类、观测年份、观测值等列。数据质量说明包括:数据为年度频率;当同一国家×年份有多个来源时,使用ILO选择的最佳来源;分类列仅在指标发布细分数据时非空。数据集由Electric Sheep Europe重新打包,便于机器学习使用,采用cc-by-4.0许可证。

This dataset, titled Mean weekly hours actually worked per employed person by sex, economic activity and rural | Europe (ILOSTAT), contains 100,003 observations across 38 European countries, spanning from 1992 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, focusing on the topic of Hours of work, with the specific indicator Mean weekly hours actually worked per employed person by sex, economic activity and rural / urban areas (indicator code: HOW_TEMP_SEX_ECO_GEO_NB). The dataset is in tabular format and suitable for tabular classification, tabular regression, and time-series forecasting tasks. Data is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes, harmonized using ILO statistical definitions. The schema includes columns such as country code, source, indicator, sex disaggregation (total, male, female), economic activity classification, rural/urban classification, observation year, observed value, and more. Data quality notes include: annual frequency; when multiple sources exist for the same country×year, the ILO-selected best source is used; disaggregation columns are non-null only when the indicator publishes that breakdown. The dataset is repackaged by Electric Sheep Europe for machine learning readiness, released under the cc-by-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API从官方指标端点“HOW_TEMP_SEX_ECO_GEO_NB”直接抓取原始数据,并依据欧洲ISO3国家代码进行地理过滤。ILOSTAT本身基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行协调统一,确保跨国可比性。随后,Electric Sheep Europe对数据进行了重新封装与规范化处理,将原始API响应转化为结构化的Parquet格式表格,并补充了清晰的中英文标签列,最终以标准HuggingFace数据集形式发布,便于机器学习流水线直接加载。数据集覆盖38个欧洲国家,时间跨度从1992年至2025年,共包含100,003条观测记录,每条记录对应一个特定年份、国家、性别、经济活动分类及地理区域组合的周均实际工作小时数。
特点
该数据集的核心特点在于其多维度的精细分组结构,允许研究者按性别(总、男、女)、经济部门及城乡地域对周均实际工作小时数进行交叉分析。数据来源于ILO筛选的“最佳来源”,并附有来源标签便于溯源,同时提供观测状态标记(如不可靠、临时值)以辅助质量评估。数据集以年度频率呈现,涵盖完整的欧洲国家面板,且部分国家的时间序列长达三十余年,为劳动经济学中的长周期趋势分析提供了坚实的数据基础。此外,精心设计的模式(Schema)包含统一的标准化字段(如ref_area、time、obs_value)与分类维度字段,兼具简洁性与分析灵活性,特别适合用于面板回归、时间序列预测及表格分类任务。
使用方法
使用方法极为便捷,研究者可通过HuggingFace的`load_dataset`函数一行加载数据,并直接转换为pandas DataFrame进行操作。典型分析流程包括:按国家代码(如`ref_area == 'DEU'`)筛选特定国家子集,按指标值排序后绘制时间序列图以观察长期波动,或利用透视表功能构建以年份为行、国家为列的国别对比矩阵。数据集的表格回归与时间序列预测标签暗示其适用于机器学习建模,例如以历史工作小时数为特征预测未来趋势,或结合性别与行业分类变量构建多因素回归模型。建议在引用时同时标注原始ILO数据来源及Electric Sheep Europe的重封装版本,以符合学术规范。
背景与挑战
背景概述
在全球劳动市场日益复杂的背景下,工作时间的精准测度对理解劳动力供给、生产率及性别平等议题至关重要。该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT构建,由Electric Sheep Europe于2025年重新打包并发布至HuggingFace平台,聚焦于1992年至2025年间38个欧洲国家按性别、经济活动及城乡划分的受雇人员平均每周实际工作小时数。数据集整合了国家劳动力调查、住户收入调查及行政记录等多源微观数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,提供了超过10万条观测记录。作为ILO在劳动统计领域的重要成果,该数据集为欧洲劳动经济学研究、跨国比较分析及政策评估提供了坚实的数据基础,尤其在工作时间变动、性别差异及区域不平等研究方面具有显著影响力。
当前挑战
该数据集面临的核心领域挑战在于工作时间的跨国家、跨时期可比性问题。一方面,不同国家在调查设计、问卷措辞、样本代表性及数据收集频率上存在固有差异,导致同一指标在不同国家间可能蕴含不同的度量偏差,影响跨国回归分析及趋势推断的可靠性。另一方面,数据构建过程中同样遭遇多重困难:ILOSTAT需从各国多样化的原始调查中调和出统一的指标定义,但部分国家或年份存在数据稀疏性、来源更替或连续性断裂,尤其对于早期年份(如1992-1993年)及数据缺失较多的国家,ILO需借助“最佳来源”选择机制,这可能引入非随机性缺失;此外,性别、经济活动及城乡等细分维度的交叉分类会进一步导致某些子组的观测值数量有限或标注为“不可靠”,从而限制了精细化的分层分析能力。
常用场景
经典使用场景
在劳动经济学与政策研究的交汇处,该数据集因其精细的维度划分——涵盖性别、经济活动类型及城乡地域——成为分析欧洲劳动力市场工时结构的基石。研究者和数据分析师常将其用于构建多水平回归模型,以揭示不同国家间工作时间的异质性来源。例如,通过固定效应面板数据方法,可以剥离出性别间工时差距的长期趋势,或探究经济部门波动对周实际工作小时数的动态影响。其时间跨度覆盖1992年至2025年,足以支撑对经济周期及政策干预效果的纵向因果推断。
实际应用
在政策制定与社会治理的前沿,该数据集的价值体现在多个实体应用层面。国际组织与各国劳工部门可依据其发布的标准化指标,动态监测不同性别和产业群体的劳动负荷状况,为工时立法、最低工资设定及工作与家庭平衡政策提供数据驱动的决策支持。例如,结合城乡分解变量,政策制定者能够精准识别农村地区非正规就业者的过度劳动风险,从而定向配置社会保障资源。在商业领域,企业及人力资源咨询公司亦可借助这些长时序数据,进行跨国劳动力成本建模和用工趋势预测,优化区域业务布局策略。
衍生相关工作
围绕这一丰富的时空汇编,学界与开源社区已衍生出一系列体系化的研究方法与二次资源。数据集的标准化架构促使许多研究者开发了专用的可视化仪表盘,用于呈现欧洲各国劳动时间的地理空间演变格局。此外,基于其分类维度的完整性,出现了侧重于性别差距分解和产业间工作强度收敛性测试的再分析工作,这些研究常以该数据集作为核心验证源。值得一提的是,该项目提供的直接代码接口与Parquet格式,极大降低了重复性数据预处理成本,推动了一系列关于ILOSTAT数据质量控制与多源融合的开放性方法论探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务