遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-cbr-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲18个国家1999年至2024年期间,按性别和出生地点划分的雇员实际平均每周工作小时数的938个观察值。数据来源于国际劳工组织(ILOSTAT)数据库,涵盖一个核心指标(HOW_XEES_SEX_CBR_NB),用于衡量劳动市场中的工作时间情况。数据集以表格形式组织,包括国家代码、年份、指标值、性别分类(总计、男性、女性)、数据来源和质量标志等列,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Asia重新打包,以支持机器学习和研究使用。

This dataset contains 938 observations of mean weekly hours actually worked per employee by sex and place of birth across 18 Asia countries from 1999 to 2024. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, covering one key indicator (HOW_XEES_SEX_CBR_NB) that measures working hours in labor markets. Organized in tabular format, it includes columns such as country code, year, indicator value, sex disaggregation (total, male, female), data source, and quality flags, suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Asia to facilitate machine learning and research applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-cbr-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集源自ILOSTAT的REST API,通过直接调用官方接口(ID:HOW_XEES_SEX_CBR_NB)获取原始数据,并依据亚洲ISO3国家代码进行地域过滤与筛选。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对微观调查数据进行统一归化处理,数据来源经标注于“source.label”列中,确保可追溯性。数据集由Electric Sheep Asia进行重新封装,以Parquet格式发布,使用户可通过HuggingFace的load_dataset()接口快速加载使用。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,使用`load_dataset`方法获取训练集,并将其转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的时间序列数据,按指标排序后可视化观察值变化趋势,或通过pivot_table构建以年份为行、国家为列的矩阵视图。由于数据集包含标注清晰的列名和统一的ISO国家代码,研究者可无缝衔接统计建模、时序预测或分类回归任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的ILOSTAT统计数据库于2024年整理发布,经Electric Sheep Asia重新打包后发布于HuggingFace平台。核心研究问题聚焦于亚洲地区雇员每周实际工作时间的性别与出生地差异,旨在为劳动经济学、移民研究及国际比较提供精确的微观数据支撑。数据集涵盖18个亚洲国家1999年至2024年的938条观测记录,其来源为各国劳动力调查与行政记录,经ILO统一标准化后形成。作为全球劳动统计的权威枢纽,ILOSTAT长期为联合国可持续发展目标(SDG)中的体面工作指标提供基石性数据,该数据集的出现填补了亚洲区域按移民身份细分的工作时间研究空白,对理解劳动力市场融合、性别平等及跨国劳动流动具有重要推动作用。
当前挑战
该数据集所解决的领域问题在于揭示亚洲劳动力市场中按性别和出生地划分的工作时间模式,这涉及复杂的多重分类与跨国民生指标比较。具体挑战包括:数据来源的异质性导致统计口径与调查方法存在差异,需要ILO通过ICLS定义进行强制统一;部分国家数据稀疏,如塔吉克斯坦仅18条记录且年度不连续,难以构建可靠的时间序列模型;观测状态标注为“不可靠”的条目及方法论修订导致的序列断裂,增加了建模误差的风险。此外,构建过程中需从ILOSTAT的REST API批量提取原始数据,并手动筛选亚洲国家ISO3代码,处理不同来源的标注不一致、缺失值及年度频次的非均衡性,最终形成标准化架构,对整个亚太区域的数据融合能力提出了较高要求。
常用场景
经典使用场景
该数据集记录了亚洲18个国家1999年至2024年间,按性别和出生地划分的雇员每周实际工作平均小时数,共计938条观测值。其经典使用场景在于,研究者可借助这些时序化的面板数据,追踪各国劳动力市场的工作时长波动,尤其适合开展跨国比较分析。通过整合性别与移民背景的双重维度,该数据集为探讨劳动力供给弹性、劳动强度变迁以及全球化对本地就业市场的影响提供了坚实的数据基础。
解决学术问题
该数据集有效回应了劳动经济学与人口迁移研究中的若干关键学术问题。首先,它填补了亚洲区域时长标准化数据的空白,使得学者能够更清晰地揭示工作时间随经济发展阶段的演变规律。其次,通过区分本土出生与外国出生劳动者的工作时长差异,数据集为分析移民融合程度、劳动力市场分割及性别不平等议题提供了经验证据。其长期跨度的纵贯数据特征,使得因果识别和动态面板模型的应用成为可能,从而推动了关于工作条件改善与可持续发展目标实现路径的量化研究。
实际应用
在实际应用层面,该数据集对政府决策与国际组织政策评估具有明确价值。劳工部门可利用其中的分性别与分国籍数据,识别出特定亚群体面临的工作强度过高或就业质量偏低问题,从而制定更具针对性的劳动保护政策。同时,国际移民组织与社会保障机构可依据工作时长变化趋势,评估移民政策调整对本地及外来劳动力市场整合的实际成效。在跨国企业管理中,该数据也可用于区域人力资源规划,辅助制定符合当地劳动规范的工作制度安排。
数据集最近研究
最新研究方向
当前,亚太地区劳动力市场研究的前沿方向聚焦于移民劳工群体的工作强度与性别差异,尤其是通过跨国长期面板数据揭示劳动力流动对就业质量的影响。该数据集整合了国际劳工组织ILOSTAT权威来源,覆盖18个亚洲国家1999至2024年的周度实际工时指标,按出生地和性别进行精细化分层,为量化分析区域移民政策、劳动权益保护及可持续发展目标(SDGs)中的体面劳动进程提供了高质量数据基础。结合近年来亚洲跨境劳务流动加速、疫情后就业恢复不均等热点议题,该时序数据支持研究者开展因果推断与预测建模,推动劳动经济学与公共政策领域的实证突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务