遇见数据集

electricsheepasia/asia-ilo-ear-emtg-sex-ocu-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含10,942个观测值,覆盖26个亚洲国家(从1996年至2025年),专注于收入与薪酬不平等主题。具体指标为按性别和职业划分的员工月收入基尼指数(Gini index of monthly earnings of employees by sex and occupation),用于衡量收入分配不平等程度。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过过滤和标准化处理,由Electric Sheep Asia重新打包为机器学习就绪的格式。数据集包含多个维度,如国家、性别、职业分类和时间,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 10,942 observations across 26 Asia countries, spanning from 1996 to 2025, focusing on Income and pay inequality. The specific indicator is the Gini index of monthly earnings of employees by sex and occupation, which measures income distribution inequality. Data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via REST API, filtered, and normalized, and repackaged by Electric Sheep Asia into a machine-learning-ready format. It includes dimensions such as country, sex, occupation classification, and time, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtg-sex-ocu-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于亚洲地区雇员月收入基尼系数按性别与职业的细分。数据通过ILOSTAT的REST API直接拉取,原始API端点返回全球范围的指标数据,随后经由Electric Sheep Asia团队依据亚洲ISO 3166-1 alpha-3国家代码进行地理过滤,从而构建出覆盖26个亚洲国家的专项数据集。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行统一协调与清洗,确保跨国家数据的一致性与可比性,并在`source.label`列中明确标注数据来源以保障可追溯性。最终数据集包含10,942条观测记录,时间跨度从1996年至2025年,以Parquet格式打包发布,便于直接加载使用。
使用方法
该数据集的使用高度便捷,借助HuggingFace Datasets库的`load_dataset()`函数即可一键加载为pandas DataFrame对象。用户可直接对原始数据框执行过滤操作,例如通过`ref_area`列筛选特定国家(如印度尼西亚IDN)的子集,或利用`indicator`列锁定'EAR_EMTG_SEX_OCU_NB'指标进行专注研究。典型工作流包括按年份排序绘制时间序列趋势图,以直观呈现收入不平等随时间的演变;亦可运用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行跨国家比较分析或作为面板数据输入计量模型。数据以年频率发布,用户需留意观测值附带的`obs_status`标记以识别质量波动。整个加载与处理流程无需手动下载或数据清洗,极大提升了从原始统计指标到科研分析之间的转化效率。
背景与挑战
背景概述
在劳动经济学与社会不平等研究领域,收入分配状况的度量一直是核心议题,基尼系数作为衡量收入不平等程度的经典指标,广泛应用于跨国比较与政策评估。该数据集由国际劳工组织(ILO)于其ILOSTAT统计平台发布,并经Electric Sheep Asia于2025年重新整理封装,聚焦于亚洲地区雇员月度收入的基尼指数,涵盖1996年至2025年间26个亚洲国家的10,942条观测记录。数据集不仅提供了按性别与职业分类的基尼系数,还整合了ILO基于国际劳工统计学家会议定义协调的微观调查数据,来源可追溯至各国劳动力调查与行政记录。这一资源为探究亚洲劳动市场中的性别薪酬差距、职业分层与收入不平等的动态演变提供了可靠的量化基础,对区域比较研究与可持续发展目标监测具有重要意义。
当前挑战
该数据集所应对的领域挑战在于,传统的收入不平等研究多依赖于宏观国家层面的数据,难以精细刻画性别与职业交叉维度下的内部差异,而亚洲各国统计标准与调查方法的不一致更增加了跨国可比性的障碍。ILOSTAT通过统一的数据协调框架与标准化元数据部分缓解了此问题,但数据集中仍存在因调查来源变更导致的序列中断标记(obs_status字段为'Break in series'),以及某些国家观测年份稀疏、样本量分布不均的挑战。在构建过程中,数据整合面临多重困难:从ILOSTAT REST API抽取的数据需经严格的ISO国家代码筛选与维度对齐,同时要处理多源调查中同一国家与年份的“最优来源”选择逻辑,并保留来源标签以供追溯。此外,基尼系数计算的底层调查数据质量参差不齐,如部分国家早期年份记录稀少,可能引入估计偏差,这些因素均对数据分析的稳健性提出了考验。
常用场景
经典使用场景
在劳动经济学与不平等研究领域,该数据集为探究亚洲地区收入分配格局提供了珍贵的量化基础。其核心用途在于构建面板数据模型,分析不同性别与职业类别下基尼系数的演变轨迹。研究者可借助该数据集进行跨国家、跨时间维度的比较研究,揭示各国经济发展阶段、劳动力市场制度及社会政策对工资不平等的影响差异。此外,该数据亦支持分位数回归与分解分析,以探究性别收入差距的构成因素,为理解亚洲劳动力市场的结构性特征贡献力量。
解决学术问题
该数据集精准回应了学术圈关于亚洲发展中国家收入不平等问题的数据匮乏困境。长期以来,区域性的、按性别与职业细分的基尼指数数据零散且口径不一,阻碍了跨国比较与面板计量的严谨应用。此数据集通过ILOSTAT的规范化流程,提供了覆盖26国、跨度三十年的可比序列,使学者得以检验库兹涅茨假说在亚洲的适用性,评估贸易开放、教育扩展等政策对工资分配的影响,并量化女性劳动参与率上升与收入差距缩小之间的内在关联,从而推动发展经济学与劳动经济学的实证研究前.行。
实际应用
于政策制定与评估的实务领域,该数据集扮演着诊断工具与监测平台的双重角色。国际组织与社会保障机构可据此识别哪些亚洲国家存在显著的性别工资鸿沟,进而针对性地设计最低工资调整方案或职业培训补贴政策。对于跨国企业的人力资源部门而言,该数据提供了行业参考基准,助力其在亚洲各分支中实施公平薪酬审计,防范因结构性歧视引发的法律与声誉风险。非政府组织亦可借助该高分辨率数据,为倡导性别平等与体面劳动的倡议提供量化依据。
数据集最近研究
最新研究方向
当前,围绕亚洲地区劳动力市场收入不平等的纵向追踪研究正蓬勃展开,该数据集凭借其覆盖26个亚洲国家、横跨1996至2025年的时序观测记录,为深入剖析性别与职业维度的收入基尼系数演变提供了珍贵素材。前沿方向聚焦于利用机器学习与时间序列建模技术,揭示亚洲各国经济转型、政策干预与全球化进程中收入差距的异质性动态路径,并与ILOSTAT及其他劳动统计数据库联动,开展跨国比较与结构性因素归因分析。尤其在新冠疫情后复苏背景下,该数据为评估劳动市场韧性、探析性别工资鸿沟的固化或缓解态势,以及监测联合国可持续发展目标(SDG)关于体面工作与经济增长的进展,提供了关键实证支撑,对推动区域包容性发展具有重要学术与政策价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务