遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-dsb-nb-median-monthly-earnings-of-employees-by-sex-and-di

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲18个国家从1996年至2024年的856条观察数据,聚焦于按性别和残疾状况划分的员工月收入中位数(本地货币)这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过筛选和标准化处理。数据集涵盖多个维度,包括国家、年份、性别、残疾状况等,并提供了数据来源、观测状态和相关注释的详细信息。它适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的亚洲劳动力市场收入数据。

This dataset contains 856 observations of earnings data across 18 Asia countries, spanning from 1996 to 2024, covering one distinct indicator: Median monthly earnings of employees by sex and disability status (local currency). The data is sourced from the International Labour Organizations ILOSTAT database, retrieved via the REST API, and filtered to Asia ISO3 country codes. It includes multiple dimensions such as country, year, sex, disability status, along with details on data sources, observation status, and notes. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, providing a machine learning-ready layer for Asian labor market earnings analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-dsb-nb-median-monthly-earnings-of-employees-by-sex-and-di 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取特定指标(EAR_EMTM_SEX_DSB_NB)的原始数据,并依据亚洲地区ISO3国家代码进行地理过滤。数据背后经过ILO统计部门严格的规范化处理,基于国际劳动统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行清洗与合并,最终以标注源数据来源(source.label字段)的方式确保了每一条观测的可追溯性。整个数据集涵盖了18个亚洲国家1996年至2024年间的856条观测记录。
特点
该数据集聚焦于雇员中位数月收入这一核心劳动经济指标,并创新性地按性别与残疾状况进行交叉细分解构。数据包含4个性别分类(总计、男性、女性及其他),以及丰富的元数据注解字段,如断点标志、货币单位与数据质量标注,为研究人员提供了评估数据可靠性和一致性的依据。值得注意的是,所有收入值均以当地货币计价,真实反映了各国特定的经济环境。数据集的时间跨度长达近三十年,并标注了ILO优选的数据源,确保了纵贯分析的连续性和权威性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并将数据轻松转换为Pandas DataFrame进行后续分析。典型使用场景包括:按国家代码(ref_area字段)筛选特定国家的时间序列数据,对单一指标按时间排序以绘制收入变化趋势图,或利用透视表功能将数据重塑为以年份为行、国家为列的矩阵格式,便于进行跨国收入水平的横向比较与面板数据分析。数据集的标准化架构极大降低了劳动经济学研究的数据预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过ILOSTAT数据库整理并重新打包,由Electric Sheep Asia机构在HuggingFace平台发布,聚焦于亚洲18个国家1996至2024年间按性别与残疾状况划分的雇员月收入中位数(本地货币单位)。作为ILO核心统计数据库的重要组成部分,ILOSTAT整合了全球200多个经济体的劳动力调查、家庭收入调查及行政记录数据,旨在提供标准化的劳动统计指标。该数据集的核心研究问题在于揭示亚洲地区不同性别与残疾状态劳动者在收入分配上的差异,为评估体面劳动目标(SDG 8)及促进包容性就业政策提供量化依据。其发布推动了区域劳动经济学与残疾平等领域的交叉研究,尤其为低资源国家的时间序列分析提供了稀缺的公开数据源。
当前挑战
数据集面临的主要挑战涵盖研究领域与构建过程双重维度。在领域问题层面,其核心挑战在于如何通过有限的国家级中位数指标,准确刻画残疾劳动者与性别间的收入不平等动态,现有数据因样本量较小(856条观测值)而难以支撑细粒度子群体(如特定残疾类型)的差异分析。构建过程中,数据整合需应对ILO多源调查间定义差异(如残疾状态的非标准化统计口径)与时序断裂风险,文档中标记了“系列中断”(Break in series)状态码及非标准残疾定义注释指示了此类质量瑕疵。此外,跨国家汇率波动与购买力平价转换的缺失,使得本地货币单位的收入比较难以反映真实经济福利差异,进一步制约了跨国因果推断的可靠性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于亚洲18个国家、跨越近三十年(1996-2024年)的雇员月收入中位数信息,并依据性别与残疾状况两大维度进行精细划分。在学术研究与社会政策分析领域,最经典的用法是将该数据集作为面板数据,构建多元回归模型,以探究性别与残疾状况如何共同或独立地影响劳动力市场的收入分配格局。研究者可借助其长时序与跨国别特性,深入剖析不同国家在消除收入不平等方面的政策成效,或是追踪某一特定群体(如残疾女性)收入水平随经济发展阶段的演变轨迹。其结构化的数据模式(包含明确的分类变量与数值变量)使得数据清洗、聚合与可视化分析过程极为高效,非常适合用于比较劳动经济学中的跨国收入差距分析及社会排斥度量研究。
解决学术问题
该数据集的核心学术价值在于为量化劳动经济学中的‘交叉性歧视’(Intersectionality)假设提供了可靠的数据基础。它有效回应了传统研究因数据匮乏而难以同时考量性别与残疾双重身份对收入影响的困境,使得学者能够实证检验‘残疾人群内部的性别收入差距’是否大于‘非残疾人群内部的性别收入差距’等前沿命题。依托此数据集,研究者可以计算并分解基尼系数、泰尔指数等不平等度量指标,将收入差异归因为性别效应、残疾效应及其交互效应。此外,跨越近三十年的数据覆盖,使得系统评估《残疾人权利公约》等国际政策框架在亚洲不同发展阶段国家的实际落地效果成为可能,填补了该领域长期存在的基于微观层面跨国比较的实证空白。
衍生相关工作
该数据集的出现可以衍生出若干具有深远影响的经典研究工作,尤其在劳动经济学与计算社会科学交叉领域。首先,基于该数据集可构建‘亚洲残疾人群收入预测模型’,利用机器学习回归任务(如梯度提升树或时序神经网络)从性别、国家、年份等特征中学习收入变化模式,对比不同特征对预测结果的重要性排序。其次,依托其时间序列属性,可发展‘跨国收入趋同性分析’,运用面板向量自回归(PVAR)模型检验亚洲各国残疾员工收入水平是否随全球化进程呈现收敛或发散态势。再者,该数据集为自然语言处理与结构化数据融合提供了一个独特锚点:结合ILOSTAT中其他指标(如失业率、劳动参与率),能够训练出多模态社会学图表描述生成系统,自动为年度报告生成图文并茂的劳动力市场解读段落。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务