遇见数据集

electricsheepasia/asia-ilo-how-temp-age-oc2-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计信息,专门针对亚洲地区,主题为按年龄和职业(ISCO 2级分类)统计的就业人员实际平均每周工作小时数。数据集涵盖31个亚洲国家,时间跨度为1994年至2025年,共30,010个观测值,核心指标为HOW_TEMP_AGE_OC2_NB,即就业人员实际平均每周工作小时数,按年龄组和职业类别(基于国际标准职业分类ISCO-08的2级代码)细分。数据通过ILOSTAT REST API获取,并经过过滤以仅包含亚洲国家。数据集采用表格格式,包含列如国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source和source.label)、指标代码和标签(indicator和indicator.label)、分类变量(如年龄classif1和职业classif2及其标签)、观测年份(time)、观测值(obs_value)、观测状态(obs_status)等。数据为年度频率,ILO对原始调查微观数据进行了协调处理,以确保定义一致性(基于国际劳工统计学家会议标准)。数据质量方面,当同一国家×年份有多个来源时,使用ILO选择的最佳来源;分类列仅在指标发布细分数据时非空。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,可用于分析亚洲各国劳动力市场的工作时间趋势、差异及影响因素。

This dataset contains statistical information from the International Labour Organization (ILO) ILOSTAT database, focusing on Asia, with the theme Mean weekly hours actually worked per employed person by age and occupation - ISCO level 2. It covers 31 Asian countries, spanning the years 1994 to 2025, with 30,010 observations. The core indicator is HOW_TEMP_AGE_OC2_NB, which represents the mean weekly hours actually worked per employed person, disaggregated by age groups and occupational categories (based on ISCO-08 2-digit level codes). Data is sourced from the ILOSTAT REST API and filtered to include only Asian countries. The dataset is in tabular format, with columns such as country code (ref_area), country name (ref_area.label), data source (source and source.label), indicator code and label (indicator and indicator.label), classification variables (e.g., age classif1 and occupation classif2 with their labels), observation year (time), observed value (obs_value), observation status (obs_status), etc. The data is annual frequency, and ILO harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions for consistency. Regarding data quality, when multiple sources exist for the same country×year, the ILO-selected best source is used; disaggregation columns are non-null only when the indicator publishes that breakdown. This dataset is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, enabling analysis of working time trends, disparities, and influencing factors in Asian labor markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-age-oc2-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集基于国际劳工组织ILOSTAT数据库的HOW_TEMP_AGE_OC2_NB指标构建,通过REST API直接获取原始数据,并筛选出亚洲31个国家的ISO3国家代码。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行了标准化处理,同时保留了数据源的溯源标签。最终由Electric Sheep Asia团队重新打包为Parquet格式,形成包含30,010条观测值、涵盖1994至2025年时间跨度的机器学习就绪数据集。
特点
数据集聚焦于亚洲地区按年龄和职业(ISCO二级分类)划分的受雇人员实际每周平均工作小时数,包含丰富的分类维度如年龄组、职业类型、数据来源及观测状态标记。其覆盖范围横跨31个亚洲国家,每个国家拥有数千条时间序列观测值,并经过ILO官方的最佳来源选择与数据清洗,确保了跨国比较的准确性。数据结构以列式组织,包含国家代码、指标标签、年份及观测值等关键字段,便于直接开展时间序列分析与面板数据建模。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续操作。典型应用包括按国家代码过滤特定国家的数据以分析其劳动市场时间趋势,或按指标类别筛选后进行时间序列可视化。此外,可以借助pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行面板数据回归或跨国的聚类分析。数据集以年度频率呈现,适合应用于表格分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Asia于2025年重新整理并发布在HuggingFace平台。其核心研究问题聚焦于亚洲地区就业人口按年龄与职业细分(ISCO-08第二层级)的实际平均每周工作时长,旨在填补亚洲劳动市场中精细工时结构数据的长期空白。数据集涵盖1994年至2025年间31个亚洲国家的30,010条观测值,基于ILOSTAT全球劳动统计数据库中的标准化指标体系。作为国际劳工组织推动体面劳动议程与可持续发展目标(SDGs)的重要工具,该数据集为跨国家、跨时期的劳动经济学分析、政策评估及机器学习建模提供了可靠数据基础,尤其对亚洲新兴经济体的非正规就业与工时弹性研究具有显著影响力。
当前挑战
该领域面临的核心挑战在于劳动数据的高度异质性:不同国家采用差异化的调查方法(如劳动力调查、行政记录)与时序质量,导致跨国产出比较存在偏差。构建过程中,数据整合需克服ILOSTAT多源异构数据的标准化难题,包括对缺失值、异常标记(如不可靠标志)及分类口径不一致(如年龄分组与职业编码)的处理。此外,观测频率以年度为主,缺失月度或季度高分辨率数据,限制了短期波动与政策冲击分析。最终,不同来源的重复记录需通过ILO‘最佳来源’规则筛选,但该规则在部分情况下缺乏透明度,可能引入选择偏差,影响数据在回归与时间序列建模中的可靠性。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域,该数据集最经典的使用场景在于对亚洲地区不同年龄与职业群体的劳动时间模式进行系统性的剖析。研究者可借助其中涵盖31个国家、跨越三十余年的高颗粒度观测数据,细致地刻画不同职业分类(ISCO-08二级编码)下就业人口每周实际工作时间的分布特征与长期演变趋势,从而揭示经济发展、产业结构变迁与劳动供给行为之间的深层关联。
衍生相关工作
该数据集衍生出的经典工作主要体现在对ILOSTAT官方统计体系的底层重构与易用化封装之上。Electric Sheep Asia团队所构建的标准化数据处理管线,将原本需要通过REST API逐一下载的庞杂指标整合为可直接调用的Parquet格式,极大降低了劳动经济学领域入门的编程门槛。由此催生的一系列关于亚洲劳动力市场时间序列预测、异常值侦测以及多国面板数据分析的教学案例与方法论研究,均以此清洗后的高质量数据为基石展开。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区就业人员按年龄与职业分类的周平均实际工时,为劳动经济学与时间序列预测领域提供了关键支撑。当前前沿研究正借助此类精细粒度数据,结合ILOSTAT标准化框架,深入剖析亚洲劳动力市场的结构性变迁——尤其是数字化与零工经济冲击下不同年龄层与职业群体的工时分化趋势。该数据集横跨1994至2025年,覆盖31个亚洲国家,其全景式观测能力使学界得以量化分析新冠疫情后工作模式的持久性转型、性别与代际间的劳动强度差异,以及各国工时政策调整对社会福祉的连锁效应。通过这一机器就绪的标准化数据层,研究者在预测模型构建、面板数据实证与区域比较研究中可快速获得可靠的基础,从而助力实现联合国可持续发展目标中关于体面工作与经济增长的量化监测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务