遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲17个国家从1997年至2024年的2,924个观测值,核心指标为HOW_TEMP_SEX_OCU_DSB_NB,即按性别、职业和残疾状况划分的就业人员实际平均每周工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为亚洲国家。数据集提供结构化表格,包括国家代码、数据来源、指标代码、性别分类(总计、男性、女性等)、职业和残疾状况分类、观测年份、数值及数据质量状态等列。数据按性别、职业和残疾状况等维度细分,适用于表格分类、回归和时间序列预测等任务,用于分析亚洲劳动力市场的工作时间趋势和差异。

This dataset contains 2,924 observations across 17 Asia countries spanning 1997–2024, with the core indicator HOW_TEMP_SEX_OCU_DSB_NB, which represents the mean weekly hours actually worked per employed person disaggregated by sex, occupation, and disability status. Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes. The dataset is structured in tabular format with columns including country code, data source, indicator code, sex classification (total, male, female, etc.), occupation and disability status classifications, observation year, value, and data quality flags. It provides disaggregation by dimensions such as sex, occupation, and disability status, suitable for tabular classification, regression, and time-series forecasting tasks, aimed at analyzing working time trends and disparities in Asian labor markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
在劳动力统计领域,准确衡量不同群体的工作时长对于评估劳动市场状况至关重要。该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队从ILOSTAT REST API提取并精加工而成。原始数据以ILO的官方指标代码‘HOW_TEMP_SEX_OCU_DSB_NB’为索引,通过API接口批量获取,随后依据亚洲ISO3国家代码进行地域筛选与过滤。在预处理过程中,数据集遵循ILO基于国际劳工统计学家会议(ICLS)定义的数据协调规范,保留原始调查微观数据中经标准化处理的字段,并通过‘source.label’列标注数据来源以增强可追溯性。最终,数据被整理为结构化的表格形式,以Parquet格式发布,支持通过HuggingFace Datasets库的load_dataset()函数一键加载,为亚洲劳动市场研究提供了ML-ready的便捷数据入口。
特点
该数据集的核心特色在于其精细的多维分类结构与地域覆盖的广度。它聚焦于‘受雇人员实际每周平均工作小时数’这一关键劳动指标,并按照性别、职业与残疾状况三大维度提供交叉细分,使得研究者能够深入剖析特定亚群体的劳动投入差异。数据集囊括了从1997年至2024年间17个亚洲国家的2,924条观测记录,时间跨度近三十年,覆盖了柬埔寨、印尼、以色列、斯里兰卡等代表性经济体,兼顾了长期趋势分析与跨国比较的需求。每个观察值均包含国家代码、数据来源、指标状态标识等元信息,并特别标注了观测值的可靠性状态(如‘不可靠’标记),为用户进行数据质量甄别与敏感性分析提供了透明依据。这种细粒度与广域性相结合的特点,使其成为研究亚洲劳动力市场演化与不平等议题的独特资源。
使用方法
使用该数据集进行劳动经济学分析时,可从HuggingFace平台加载并直接转换为Pandas DataFrame。研究者可按国家代码进行切片,如过滤出印度尼西亚(IDN)的子集以开展国别案例研究;亦可对单一指标的时间序列进行排序与可视化,直观呈现工作时长的年度波动趋势。更深入的分析中,可通过数据透视表将长格式数据重塑为国家×年份的矩阵,便于运用面板数据模型或聚类算法进行跨国比较。由于数据集中包含了性别、职业等分类变量,用户可轻松嵌套分组聚合操作,计算不同领域的均值差异。建议在使用前关注‘obs_status’列中的异常状态标记,结合‘note_indicator’中的注释信息,对可能存在的统计口径变更或数据不可靠观测进行过滤或标注,从而确保实证分析的稳健性与结论的可靠性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Asia于2024年重新打包发布,专注于亚洲地区劳动力市场的关键指标——按性别、职业和残疾状况划分的受雇人员实际每周平均工作时间。数据集收录了1997年至2024年间17个亚洲国家的2924条观测记录,其核心研究问题在于揭示亚洲不同群体在劳动时间投入上的差异,为评估体面劳动政策、分析劳动力市场不平等现象以及追踪可持续发展目标(SDG)中关于工作时间的进展提供了标准化、跨国的定量基础。作为ILO协调的全球劳动力统计数据的重要组成部分,该数据集对劳动经济学、公共政策分析以及社会科学研究领域具有显著价值,尤其填补了亚洲区域在残疾与劳动参与交叉维度上精细数据的空白。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:劳动时间数据存在严重的跨国可比性难题,各国劳动力调查在时间定义(如实际工作时长与通常工作时长)、职业分类标准以及残疾认定细则上差异显著,ILO虽通过ICLS定义进行协调,但数据源标记(source.label列)的存在本身就暗示了原始数据质量参差不齐的问题。在构建过程中,核心挑战在于从ILOSTAT庞大的API接口中精准提取并过滤出亚洲国家子集,同时处理因多源数据竞争导致的同国家同年份多条记录,必须依赖ILO选择的“最佳来源”进行取舍;此外,按性别、职业和残疾状态的多维分类导致数据稀疏,部分国家在某些年份仅有少量或缺失的细分观测值,且数据质量标识(如不可靠标记U)的存在进一步增加了分析复杂性和不确定性。
常用场景
经典使用场景
在劳动经济学与社会科学研究领域,该数据集为分析亚洲地区就业人员实际周平均工时提供了坚实的量化基础。研究者可借助性别、职业与残疾状况等多重分类维度,系统比较不同社会群体在劳动力市场中的时间配置差异,进而揭示工时模式的地域异质性与演化轨迹。以国家为横截面、年份为时间轴的矩阵结构,为开展跨国横向对比与长周期纵向分析创造了便利条件。数据集的标准化架构与一致性的指标定义,使得研究者能够高效地建立回归模型,探索宏观政策、经济结构调整与劳动供给行为之间的复杂关联。
解决学术问题
该数据集有效回应了亚洲劳动市场研究中长期存在的数据碎片化与可比性不足的学术困境。通过提供国际劳工组织统一编纂的标准化工时指标,研究者得以跨越单一的国别限制,系统考察不同亚洲经济体在劳动强度与工作模式上的结构性差异。数据集内的性别、职业与残疾状况细分,为探讨劳动力市场中的性别不平等、职业隔离与残疾包容性等核心议题提供了可靠的实证证据。其跨越1997至2024年的时序窗口,使得分析经济周期、劳动力政策变革与全球化进程对工时演变的动态影响成为可能,推动了关于体面劳动与可持续发展目标的量化研究。
衍生相关工作
基于该数据集的多元分类结构与时序特性,学术界衍生出了一系列富有影响力的研究工作。学者利用性别‑职业‑残疾的多维切分构建交互回归模型,系统量化了亚洲地区女性与残疾劳动者在工时回报上的结构性差距。另有工作将工时数据与宏观经济变量进行特征融合,训练时序预测模型以预报短期劳动供给变动,为劳动力市场预警系统提供了数据驱动的决策基础。该数据集与ILOSTAT其他指标(如工资水平和就业率)的联合分析,催生了多篇探索亚洲经济体非正规就业模式与劳动福利关系的实证论文,进一步丰富了区域劳动经济学的研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务