遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含29,274个观察值,涵盖27个亚洲国家从1997年到2025年的工作时长数据,具体指标为按性别、经济活动和农村/城市地区划分的就业人口平均每周实际工作时长。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集包括国家代码、来源、指标、性别分类、经济活动和地区类型分类、时间、观测值等列,用于表格分类、回归和时间序列预测等任务。数据为年度频率,使用ILO选择的最佳来源,并且分类列仅在指标发布细分数据时非空。数据集由Electric Sheep Asia重新打包,以提供统一的、机器学习就绪的亚洲数据层。

This dataset comprises 29,274 observations, encompassing working hour data across 27 Asian countries spanning the period from 1997 to 2025. The specific metric refers to the average weekly actual working hours of the employed population, disaggregated by gender, economic activity, and rural/urban regions. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), acquired via API and filtered to retain only entries for Asian countries. The dataset includes columns such as country code, data source, indicator, gender category, economic activity classification, region type classification, time period, and observed value, and is suitable for tasks including tabular classification, regression, and time series forecasting. The data is of annual frequency, utilizing the optimal sources selected by the ILO, and the categorical columns are only non-null when the indicator publishes disaggregated data. This dataset was repackaged by Electric Sheep Asia to deliver a unified, machine learning-ready Asian data layer.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取指标代码为HOW_TEMP_SEX_ECO_GEO_NB的原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出亚洲地区的观测记录。ILOSTAT本身基于各国劳动力调查、家庭收入调查等微观数据,并依据国际劳工统计学家会议(ICLS)定义进行统一整合与标准化。数据集中每个观测值均附带来源标签(source.label),确保数据的可追溯性与透明性。最终,数据被封装为HuggingFace Datasets格式,便于用户直接加载与使用。
特点
该数据集聚焦于亚洲27个国家自1997年至2025年间,按性别、经济活动及城乡地域划分的就业人员实际周平均工作小时数,共包含29,274条观测值。其独特之处在于提供了多维度的细分变量,包括性别(总、男、女、其他)、经济活动分类(如总经济部门)及地域覆盖类型(如全国、城乡),使得研究者能够从不同视角剖析劳动时间模式。此外,每条记录还包含了观测状态标志(如不可靠数据)与来源注释,有助于数据质量评估与筛选。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载该数据集,仅需调用`load_dataset("electricsheepasia/asia-ilo-how-temp-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employed-per")`即可获取训练集并转换为Pandas DataFrame进行后续分析。基于该数据结构,用户可便捷地按国家代码(如`ref_area`)筛选特定国家的时间序列数据,或利用`pivot_table`将数据重塑为国家×年份的矩阵形式,以进行跨国家、跨时间维度的比较分析。观测值列`obs_value`可直接用于回归或时间序列预测任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Asia于2025年重新整合并发布于HuggingFace平台。其核心研究问题是探究亚洲27个国家在1997至2025年间,按性别、经济活动类型及城乡地域划分的就业人员平均每周实际工作工时。作为ILOSTAT数据库的亚集,该数据集聚焦于劳动工时这一关键社会经济指标,为分析亚洲地区劳动力市场结构、性别差异及城乡分化的演变趋势提供了标准化、跨国的时序观测数据。数据集收录29,274条观测值,覆盖广泛的地理范围与较长的时间跨度,对劳动经济学、发展经济学以及国际比较研究具有重要的实证支撑价值,有助于揭示全球化与区域经济发展中工作模式的动态变迁。
当前挑战
该数据集所应对的领域挑战在于,亚洲各国劳动工时数据长期存在来源异构、定义不统一、收集频率各异等问题,导致跨国与跨时比较困难。ILO虽通过国际劳工统计学家会议(ICLS)标准进行协调,但原始调查数据(如劳动力调查、住户收入调查)的方法论差异与质量波动仍对数据的一致性与可比性构成根本性挑战。在构建过程中,面临的挑战包括:从ILOSTAT REST API拉取数据时需处理不同国家来源标记的复杂性,以及针对多源同一国家年份数据选择ILO‘最佳来源’的决策逻辑;此外,数据在性别、经济活动与城乡等维度的分类缺失(如某些国家细粒度分类不可得)亦需审慎处理,以避免分析偏误。同时,确保数据集纳入的观测状态标记(如不可靠数据)被准确保留,以维护使用的透明度。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于亚洲27个国家1997至2025年间就业人员每周实际工作小时数的统计资料,并按照性别、经济活动领域及城乡地域进行细致分层。其最典型的应用场景在于劳动经济学领域的面板数据分析与时间序列建模,研究者和政策分析师可借此深入探究亚洲各国劳动时间的变化趋势、性别差异及其与产业结构转型之间的互动关系。清洗规范、年份跨度长的结构化数据特性,使其非常适合用于构建固定效应模型、随机前沿分析乃至机器学习回归任务,以揭示影响工作时长变动的关键社会经济因子。
解决学术问题
数据集有效回应了劳动经济学中关于亚洲地区工作时长演变规律及其驱动因素缺乏统一、可靠实证数据的长期困境。通过提供跨越近三十年、覆盖不同发展水平经济体的可比观测值,它使得研究者能够量化性别工资差距中工时差异的贡献、评估经济结构从农业向服务业转型过程中对劳动强度的冲击,并检验东亚与南亚各国劳动法规与劳动市场政策的效果。这一数据基础也为探讨非正规就业比例与平均工作时间的关联性提供了坚实支撑,促进了亚太区域比较劳动研究的体系化与现代化。
衍生相关工作
围绕该数据集涌现的衍生工作主要体现在两个方向:一是基于面板数据结构的计量经济学再分析,例如利用双重差分法评估特定国家劳动法规修订对周平均工时的影响,或者运用机器学习方法(如随机森林与XGBoost)对缺失年份的工时数据进行插补与预测。另一方面,数据科学家将该数据集整合进亚太地区劳动力市场大时空气象板,结合GDP增长率、产业增加值占比等宏观变量构建多维可视化分析系统。此外,该数据集也催生了若干专注于性别劳动时间不平等的元分析项目,通过跨数据集融合拓展了对东南亚以及中亚地区隐性就业问题的理解边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务