遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-dsb-nb-average-hourly-earnings-of-employees-by-sex-and-di

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲15个国家从1997年至2024年的员工平均小时收入数据,按性别和残疾状况分类,以当地货币计价。数据集共有542个观测值,涵盖1个核心指标(EAR_EHRA_SEX_DSB_NB),即按性别和残疾状况分类的员工平均小时收入(当地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过筛选,覆盖国家包括柬埔寨、亚美尼亚、印度尼西亚、斯里兰卡、蒙古等。数据集结构包括国家代码、国家名称、数据来源、指标、性别分类、时间、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据为单语种(英语),规模小于1K,遵循CC-BY-4.0许可。

This dataset contains average hourly earnings of employees in 15 Asian countries from 1997 to 2024, disaggregated by sex and disability status, in local currency. It includes 542 observations covering one key indicator (EAR_EHRA_SEX_DSB_NB), which represents Average hourly earnings of employees by sex and disability status (local currency). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries, covering nations such as Cambodia, Armenia, Indonesia, Sri Lanka, Mongolia, and others. The dataset schema includes columns like country code, country name, data source, indicator, sex classification, time, observed value, and more, suitable for tabular classification, regression, and time-series forecasting tasks. It is monolingual (English), with a size category of less than 1K, and is licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-dsb-nb-average-hourly-earnings-of-employees-by-sex-and-di 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区按性别和残疾状况划分的雇员平均时薪(以当地货币计)。数据通过ILOSTAT的REST API直接获取,并筛选出亚洲ISO3国家代码范围内的记录。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义,对原始调查微观数据进行标准化处理,来源信息在`source.label`字段中清晰标注,确保了数据的可追溯性与一致性。数据集由Electric Sheep Asia进行重新打包,以HuggingFace Datasets格式发布,便于研究者直接调用。
使用方法
数据集可通过HuggingFace Datasets库轻松加载,使用`load_dataset`函数即可获取训练集并转化为Pandas DataFrame进行后续分析。用户可按国家代码(如`ref_area == 'IDN'`)筛选特定国家的时间序列,或按指标代码对观测值进行排序和绘图。支持将数据透视为国家×年份的矩阵形式,便于面板数据分析或构建机器学习特征。数据集中还包含了观测状态标志(如序列中断)和注解信息,为数据清洗与预处理提供了重要参考。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过ILOSTAT数据库整理发布,并经Electric Sheep Asia重新封装为机器学习就绪格式。聚焦亚太地区15个国家1997至2024年间按性别与残疾状态划分的雇员平均时薪(以当地货币计),共收集542条观测记录。核心研究问题在于揭示劳动力市场中性别与残疾状态对收入水平的交叉影响,为评估体面劳动与可持续发展目标(SDG)的进展提供量化依据。作为ILO权威数据源与HuggingFace生态的桥梁,该数据集降低了劳动经济学研究者与数据科学家获取亚太地区精细化薪酬数据的门槛,对推动包容性经济增长议题的实证分析具有显著贡献。
当前挑战
该数据集所应对的领域挑战在于,传统收入统计常忽视残疾状态与性别的交叉维度,导致对弱势群体经济状况的刻画不完整;同时,亚太各国在数据采集方法、指标定义及时段覆盖上存在显著异质性,增加了跨国比较与建模难度。在构建过程中,面临的挑战包括:从ILOSTAT REST API攫取原始数据时需处理多来源标志(如劳动调查、行政记录)的一致性;对15个国家不同年份缺失值的隐含处理(如仅1年观测的阿富汗);以及将离散维度的分类信息(sex、classif1)无损映射为宜于时间序列分析与表格建模的扁平结构。
常用场景
经典使用场景
在劳动经济学与政策研究领域,该数据集最经典的应用场景是构建面板回归模型,以探究亚洲15个国家从1997至2024年间按性别与残疾状态划分的雇员平均时薪的演变轨迹。研究者常利用其时间序列与截面并存的特性,剖析工资差异的驱动因素,如在控制宏观经济变量后,量化性别或残疾状况对薪资水平的独立效应。此外,该数据也广泛应用于分解分析,通过Oaxaca-Blinder等统计方法,将观察到的工资差距拆解为由禀赋差异与歧视效应构成的部分,从而揭示劳动力市场中结构性不平等的深层根源。
解决学术问题
该数据集为学术界解决了一个核心难题:在亚洲区域背景下,如何系统性地量化并比较不同性别与残疾状态劳动者在工资回报上的长期不均衡现象。此前,由于缺乏经过标准化整理且覆盖多国、跨年度的微观汇总数据,针对残疾群体的收入差异研究常受限于样本零散或口径不一。此数据集通过ILOSTAT统一构建的统计口径,使研究者能够跨越国界与时间,验证体面劳动(SDG 8)与减少不平等(SDG 10)等可持续发展目标的实际进展。其意义在于为劳动经济学、残疾研究及社会政策评估提供了可靠的经验证据,推动了关于包容性就业政策有效性的实证讨论。
实际应用
在现实世界中,该数据集为国际组织、国家统计局及非政府机构提供了关键支撑,用于制定与评估针对弱势群体的劳动市场干预措施。例如,国际劳工组织(ILO)可借助其分析结果,向成员国提出缩小男女薪资差距或改善残疾雇员工作条件的政策建议。各国劳动部门亦可利用该数据对标区域平均水平,识别本国在促进就业平等方面存在的短板。同时,社会企业或影响力投资机构能依据不同国家、年份的时薪变动趋势,评估其试点项目(如职业技能培训计划)在提升特定群体收入方面的成效,从而优化资源配置。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员按性别与残疾状态划分的平均小时工资,为劳动力市场中的薪资不平等与包容性政策研究提供了跨国、跨时段的微观证据。在可持续发展目标(SDG 8.5)和SDG 10.3框架下,国际劳工组织(ILO)近年着力推动残疾人群体的体面就业与薪资公平,此数据集恰为量化残疾状态与性别交互效应下的薪资差距、追踪各国立法调整(如反歧视法案)的实效提供了独特的纵向剖面。前沿研究方向涵盖:运用面板数据模型或分位数回归解析残疾状态与性别对薪资的非线性影响,结合亚洲多元的文化与制度背景(如柬埔寨、蒙古等国的劳动市场结构差异)评估政策干预效果,以及为机器学习中的公平性审计(如去偏算法训练)提供实证基准。该数据集填补了亚洲地区残疾劳动者薪资统计的系统性空白,其严谨的分类架构与ILOSTAT的标准化采集流程,更强化了跨国民间比较的可靠性与可重复性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务