遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-edu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲32个国家按性别和教育程度划分的雇员实际平均每周工作小时数统计数据。数据集涵盖1996年至2025年期间,共包含13,322个观测值,主要指标为HOW_XEES_SEX_EDU_NB(按性别和教育程度划分的雇员实际平均每周工作小时数)。数据通过ILOSTAT REST API获取,并过滤至亚洲国家,采用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多个维度列,如国家代码、年份、性别分类、教育分类等,并标注了数据来源和质量状态。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为亚洲劳动力市场研究提供标准化、可直接用于机器学习的数据。

This dataset contains statistics on mean weekly hours actually worked per employee by sex and education for 32 Asian countries, sourced from the International Labour Organization (ILO) ILOSTAT database. It spans the years 1996 to 2025, with 13,322 observations, focusing on the indicator HOW_XEES_SEX_EDU_NB (mean weekly hours actually worked per employee by sex and education). Data is retrieved directly from the ILOSTAT REST API, filtered to Asian ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes multiple dimension columns such as country code, year, sex disaggregation, education classification, and annotations for data source and quality status. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, providing a standardized, ML-ready data layer for Asian labor market analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-edu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集由国际劳工组织(ILO)下设的ILOSTAT统计数据库直接抽取而来,数据源经由ILOSTAT的REST API接口获取,并按照亚洲地区ISO3国家代码进行筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)统一标准,对各国的劳动力调查、家庭收入调查、企业调查及行政记录等原始微观数据进行整合与规范化处理。所有观测值均保留来源标识,以确保数据的可追溯性与透明度。
特点
数据集涵盖1996年至2025年间32个亚洲国家的13,322条观测记录,聚焦于按性别与教育程度划分的员工平均每周实际工作小时数这一核心指标。数据在性别维度上细分为总计、男性、女性及其他四个类别,同时通过分类变量对教育层次进行了详细标注。此外,数据集中包含观测状态标识与多层级注释字段,为数据质量评估与系列中断判断提供了重要参考。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续分析。利用筛选功能,可针对特定国家或特定指标进行子集提取;结合时间字段排序,即可绘制完整的时间序列曲线图。此外,借助透视表操作,可将数据重塑为国家×年份的矩阵形态,便于开展跨国比较与面板数据分析。
背景与挑战
背景概述
国际劳工组织(ILO)下属的ILOSTAT数据库作为全球劳动统计的权威来源,长期以来为各国政府、研究机构及国际组织提供标准化的劳动力市场数据。在此背景下,由Electric Sheep Asia于2025年重新打包发布的“亚洲地区按性别和教育程度划分的雇员平均每周实际工作小时数”数据集,聚焦于1996年至2025年间32个亚洲国家的13,322条观测记录。该数据集的核心研究问题在于揭示不同性别与教育水平背景下雇员工作时间模式的差异性及其演变趋势,为劳动经济学、性别平等研究及教育政策评估提供了高时间粒度的面板数据支撑。凭借ILO跨200多个经济体的统计协调方法,该数据集在跨区域比较、工作条件监测及可持续发展目标(SDG)体面劳动指标追踪等领域展现了显著的学术与政策应用价值。
当前挑战
该数据集所应对的领域挑战主要源于亚洲地区劳动市场的异质性与数据碎片化问题。首先,各国在调查方法(如劳动力调查与企业登记调查)、分类标准(如教育水平分级与国际劳动统计学家会议定义的一致性)以及时间跨度上的不一致,导致跨国家、跨年度的可比性分析面临严峻障碍,亟需协调统一的数据框架。其次,数据构建过程中遭遇了多重技术挑战:原始ILOSTAT API返回的数据需经清洗与筛选以聚焦亚洲区域,但部分指标存在多源冲突(如同一国家年份的多个数据源需依赖ILO的“最佳来源”选择策略),且观察值状态标记如“不可靠”或“序列断裂”增加了数据质量控制的复杂性。此外,教育与性别维度的细粒度分解在部分样本中因缺失值或非标准分类而受到限制,从而对时序预测与回归模型的稳健性构成潜在影响。
常用场景
经典使用场景
在劳动经济学与时间利用研究领域,该数据集为分析亚洲地区劳动者实际工作时长的长期演变趋势提供了坚实的数据基础。研究者可基于分性别和受教育程度的周均工作时间指标,构建面板数据模型,考察经济发展阶段、劳动力市场制度与工作时长之间的动态关联。通过对32个国家近三十年的年度观测值进行时序分析,能够揭示不同教育层次劳动者在工作投入上的结构性差异,以及性别间工作时间的收敛或发散模式。该数据集的跨国家、跨时段属性使其成为比较劳动研究中的理想素材,尤其在探索亚洲劳动力市场特有规律时展现出独特的应用价值。
解决学术问题
该数据集系统性地回应了劳动经济学中长期存在的几个关键学术难题。首先,它弥补了亚洲地区在标准化、可比性工作时间数据上的显著空白,使得跨国比较研究不再受限于数据口径不一的困境。其次,通过引入教育层级这一分类变量,数据集为探究人力资本积累与劳动供给行为之间的交互效应提供了实证支持,有助于验证明瑟方程在亚洲背景下的适用性。此外,性别维度的加入使得研究者能够量化分析劳动市场中的性别差异动态,为讨论女性劳动参与率变化背后的机制提供了经验证据,进而推动性别平等相关理论在亚洲情境下的发展。
衍生相关工作
围绕该数据集的质量特征与结构优势,已衍生出一系列具有影响力的研究路径与方法创新。研究者基于其面板数据结构,发展出适用于稀疏观测值的时间序列插补技术与分类变量交互效应估计方法,提高了在不完整面板数据环境下推断的稳健性。部分工作聚焦于教育分类标准的跨国可比性问题,提出了新的层级归一化算法,为后续更多包含教育维度的劳动数据接入提供了方法论框架。另一些研究则利用该数据集作为基准数据,对比评估不同来源(如行政记录与调查数据)的工作时长指标一致性,推动了数据融合技术在劳动统计领域的应用。这些衍生工作不仅丰富了数据集自身的使用场景,也为亚洲劳动市场研究社区提供了持续积累的分析工具与知识资产。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务