遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含108,569个观察值,覆盖31个亚洲国家,时间跨度为1997年至2025年,专注于工作时间主题。核心指标为按性别、职业和婚姻状况划分的就业人员每周实际平均工作小时数(指标代码:HOW_TEMP_SEX_OCU_MTS_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,经过ILO协调处理以确保一致性。数据集包含详细列,如国家代码、来源、指标、性别(总计、男性、女性等)、职业分类、婚姻状况分类、观测年份、观测值(单位为小时)以及数据质量标志。数据可用于表格分类、回归和时间序列预测任务,适用于劳动力市场分析、经济研究等场景。

This dataset contains 108,569 observations across 31 Asian countries, spanning from 1997 to 2025, focusing on the Hours of work theme. The core indicator is Mean weekly hours actually worked per employed person by sex, occupation and marital status (indicator code: HOW_TEMP_SEX_OCU_MTS_NB). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries, harmonized by ILO for consistency. The dataset includes detailed columns such as country code, source, indicator, sex (total, male, female, etc.), occupation classification, marital status classification, observation year, observed value (in hours), and data quality flags. It is suitable for tabular classification, regression, and time-series forecasting tasks, applicable to labor market analysis, economic research, and similar scenarios.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接抽取指标代码为HOW_TEMP_SEX_OCU_MTS_NB的原始数据,并依据亚洲地区ISO3国家代码进行筛选过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义标准,对来自各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行统一协调与标准化处理,最终形成涵盖31个亚洲国家、时间跨度从1997年至2025年的108,569条观测记录。数据集以Parquet格式打包发布,确保机器学习就绪的可访问性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载数据集,并转换为Pandas DataFrame进行后续分析。典型应用包括按国家代码筛选特定国家的时间序列数据,使用obs_value字段与time字段绘制指标随年份变化的趋势图,或利用pivot_table方法将数据重塑为国家×年份的透视矩阵,便于跨国家横向比较与面板数据分析。数据集字段设计规范,支持基于性别、职业、婚姻状况等维度的灵活筛选与聚合运算,适合劳动经济学领域的各类量化研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT整理发布,并由Electric Sheep Asia重新封装为机器学习就绪格式。数据集聚焦于亚洲31个国家1997年至2025年间按性别、职业和婚姻状况划分的就业人员平均每周实际工作小时数,共计108,569条观测记录。这一精细化劳动统计指标的研究背景根植于全球劳动经济学中对工作时间的性别差异、职业分层与家庭结构交互作用的关注。ILO作为劳动统计领域的权威机构,通过协调各国劳动力调查数据,为跨区域比较奠定了方法论基础。数据集推动了亚洲劳动市场的时空分析,尤其在理解非正规就业、工作贫困及性别平等进展方面具有里程碑意义,为政策制定者与研究者提供了高分辨率量化工具。
当前挑战
该数据集所解决的领域问题核心在于亚洲劳动统计中长时序、跨国家、多维分层数据的稀缺性——传统图像分类或时间序列预测任务常受限于样本偏差与指标单一性,而此数据通过性别、职业与婚姻状况的交叉分类,揭示工作小时数在亚群体间的异质性。构建过程中面临的挑战包括:31个国家数据来源异质性显著,涉及不同劳动力调查问卷设计与抽样方法,ILO需采用国际劳工统计学家会议定义进行标准化调和;数据质量标注如‘不可靠’状态源于部分观测值因样本量不足或调查波动而产生的不确定性;多源数据冲突时需采用ILO选定的‘最佳来源’阈值决策,这一过程平衡了代表性鲁棒性与统计连续性,但可能引入隐含的系统性偏差。
常用场景
经典使用场景
在劳动经济学与社会科学研究领域,该数据集的核心价值在于为亚洲地区的工作时长动态分析提供了结构化、多维度的量化基础。研究者可借助性别、职业类型及婚姻状况等分层变量,深入剖析不同群体在周平均实际工作时间上的差异与演变趋势。其跨度为近三十年的年度时间序列,使得纵向比较与面板数据分析成为可能,尤其适用于构建固定效应模型或随机效应模型以探究经济发展、劳动力市场政策与工作时长之间的内在联系。数据集的标准化格式与HuggingFace平台的无缝集成,极大降低了数据获取与预处理的门槛,使得从描述性统计到复杂计量回归的各类经典分析流程能够高效落地。
解决学术问题
该数据集精准回应了劳动经济学中多个长期悬而未决的核心学术问题。其中,性别收入与工作时间差距的根源一直是研究焦点,该数据通过提供按性别和职业细分的工时数据,使学者能够分离出职业隔离与家庭责任对男女工时差异的贡献。此外,婚姻状况作为影响劳动力供给的关键社会变量,其与工作时长的交互效应在该数据集中得以量化考察。对于亚洲新兴经济体普遍存在的非正规就业与超时工作现象,本数据集为验证“保留工资理论”与“效率工资假说”等经典理论提供了区域实证证据。其重要意义在于填补了亚洲地区在标准化、可跨国比较的细致度工时数据方面的空白,从而推动了对全球南方劳动力市场异质性的系统性理解。
实际应用
在实际场景中,该数据集为国际组织、政府机构及企业的人力资源策略制定提供了坚实的数据支撑。国际劳工组织可借此监测亚洲各国在体面劳动目标下工作时间的合规性,评估不同职业群体间的劳动强度差异,并据此提出有针对性的政策建议。国家劳动部门能通过时间序列数据分析本国工时结构的长期变迁,为调整最低工资标准、优化劳动法中的工时条款提供实证依据。企业层面,跨国人力资源公司在进行区域劳动力成本核算与人才布局时,可依据不同性别与职业类别的平均工时数据,更精准地预测用工成本与生产率。此外,该数据集还可用于构建预警模型,识别那些可能因超时工作而面临健康风险的高危行业人群。
数据集最近研究
最新研究方向
在国际劳工组织(ILO)的权威数据框架下,该数据集通过性别、职业与婚姻状况的多维交叉拆解,为亚洲劳动经济学研究提供了精细化的实际周工时观测窗口。近年来,后疫情时代工作形态的剧烈转型催生了学界对工时异质性的高度关注——远程办公普及、非正规就业膨胀与性别角色再平衡等议题交织,使得按性别与职业分层解析工时变化成为前沿热点。该数据涵盖1997至2025年间31个亚洲国家逾十万条记录,恰好覆盖亚洲制造业转移、数字经济崛起及新冠疫情冲击等关键经济事件,研究者可借此揭示不同职业群体工时弹性的动态差异,并深入探讨婚姻状态如何调节性别间劳动供给的不对称性。其意义在于,不仅填补了区域级多维度工时数据的空白,更为评估亚洲国家就业质量、设计包容性劳动政策提供了可靠的统计基底。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务