遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲31个国家从1997年至2025年期间,按性别、职业和婚姻状况分类的员工实际平均每周工作小时数的统计观测数据,共计103,837条记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了就业、工作时间等劳动统计指标,并经过标准化处理以适用于机器学习任务。

Mean weekly hours actually worked per employee by sex, occupation and marital status | Asia (ILOSTAT). This dataset contains 103,837 observations of hours of work data across 31 Asia countries, spanning 1997–2025, covering 1 distinct indicator. The data is sourced from ILOSTAT, the ILOs central statistics database, and includes harmonized labor statistics on employment and working time.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口获取原始数据,并依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行协调统一。在数据整合过程中,仅筛选出亚洲地区ISO3国家代码对应的观测值,同时保留source.label字段以标记数据来源,确保每一条记录均可追溯至原始调查。最终形成涵盖31个亚洲国家、时间跨度从1997年至2025年的103,837条观测,聚焦于雇员实际周均工作小时数这一核心指标。
特点
该数据集的核心特色在于多维度的细粒度分解设计,同时包含性别(SEX_T/SEX_M/SEX_F/SEX_O)、职业技能等级(classif1)以及婚姻状况(classif2)三个维度的分类变量,使得研究者能够深入分析不同人口特征群体间的劳动时间差异。所有指标均采用ILO官方最佳来源策略,当同一国家同年份存在多个数据源时选用最可靠者,并标注观测状态(如'U'代表不可靠)供用户自行判断数据质量。此外,数据以年度频率呈现,且提供丰富的标注信息如序列中断说明,增强了时间序列分析的可信度。
使用方法
用户可通过HuggingFace的datasets库直接加载使用,示例代码为`load_dataset('electricsheepasia/asia-ilo-how-xees-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employee-by')`,随后转换为Pandas DataFrame进行灵活操作。典型应用场景包括按国家过滤分析(如筛选印度尼西亚数据)、针对单一指标进行时间序列可视化,或利用pivot_table功能构建国家×年份的观测值矩阵,便于进行跨国比较与面板数据分析。数据集中以ISO 3166-1 alpha-3编码标识国家,配合多语言标签字段,兼容各类统计分析工作流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库发布,并由Electric Sheep Asia在HuggingFace平台上重新打包整理。ILOSTAT作为全球劳动统计的核心数据源,长期致力于整合各国劳动力调查、家庭收入调查及行政记录等多源数据,以提供标准化、可比较的劳动指标。本研究聚焦于亚洲31个国家自1997年至2025年间,按性别、职业和婚姻状况分层的雇员平均每周实际工作小时数,共包含103,837条观测记录。该数据集不仅填补了亚洲区域精细劳动时间数据的空白,还为研究劳动经济学、性别平等、职业健康及社会保障等议题提供了关键实证基础。其通过统一的数据架构和开源许可(CC-BY-4.0),显著降低了跨国比较分析的门槛,对政策制定者、经济学家及社会科学研究者具有重要参考价值。
当前挑战
该数据集所解决的核心领域挑战在于,亚洲地区长期缺乏统一、可比较且细粒度的劳动时间统计数据,尤其是按多重人口与社会特征(如性别、职业、婚姻状态)交叉分类的指标,这阻碍了区域劳动力市场动态的深入分析。在构建过程中,ILO面临的首要挑战是数据源的高度异质性——来自31个国家不同年份的劳动力调查、行政记录和普查数据,在采集方法、定义口径、质量标记(如“不可靠”或“方法修订”导致序列断层)上差异显著,例如数据中存在的“break in series”注释便反映了这一难题。此外,数据集需在保持时间序列完整性的同时处理缺失维度和分类体系不一致问题,如部分观测仅提供总计值而无细分,以及不同国家对职业和婚姻状态的分类标准不统一。最终,ILO通过采用国际劳工统计学家会议(ICLS)定义进行数据协调,并标记各来源以实现可追溯性,从而在复杂异构数据中构建出具有可比性的最佳估计值。
常用场景
经典使用场景
作为国际劳工组织(ILO)在亚太地区长期追踪的标准化劳动力统计数据,该数据集以性别、职业与婚姻状况为多维交叉分类维度,系统收录了1997年至2025年间31个亚洲国家雇员的平均每周实际工作时长。其经典使用场景聚焦于结构性劳动力市场分析与国际比较研究,常用于量化不同社会群体(如女性与男性、高技能与低技能职业、已婚与未婚人群)之间的工作负荷差异,以及考察全球化进程中亚洲各国工时模式的演化趋势。
衍生相关工作
围绕本数据集的衍生研究已催生多项经典工作,包括基于性别工资差距的分时段分解分析、利用随机森林或LSTM模型对亚洲典型国家(如韩国、土耳其)短期工时趋势的预测研究,以及将ILOSTAT数据与World Bank教育统计或UN人口数据链接,构建多源耦合数据库以探讨人力资本积累与工作时间配置的长期关联。此外,若干文献已探索将离散化工时数据作为输入特征,训练分类器以识别不同职业类别中婚姻状况对劳动参与率的影响边界。
数据集最近研究
最新研究方向
在劳动经济学与亚洲区域发展研究的交汇地带,该数据集凭借其横跨近三十年、囊括三十一个亚洲经济体的周均工时观测值,成为解析后疫情时代劳动力市场韧性、性别职业隔离与婚姻状况对劳动供给冲击的前沿利器。当前热点聚焦于利用其精细的性别与职业分类维度,结合时间序列建模与面板数据分析,量化自动化浪潮与灵活就业模式兴起对亚洲各国标准工时制度的侵蚀效应,并揭示隐性加班与职业倦怠在不同职业层级中的差异化蔓延。该数据集的持续更新与ILO官方源头的权威性,为验证世界银行与亚洲开发银行关于非正规就业震荡的预测提供了不可多得的实证锚点,其影响正从学术研究向国际劳工标准的本土化调整实践渗透。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务