遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-cur-nb-average-hourly-earnings-of-employees-by-sex-and-cu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的平均每小时员工收入按性别和货币划分指标数据,专门针对亚洲地区。它涵盖了32个亚洲国家从1969年到2025年的2,421个观测值,核心指标为EAR_EHRA_SEX_CUR_NB(平均每小时员工收入按性别和货币划分)。数据以表格形式组织,包括国家代码、年份、性别分类、货币类型、观测值及其状态等字段,适用于表格分类、回归或时间序列预测任务。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层。

This dataset contains Average hourly earnings of employees by sex and currency indicator data from the International Labour Organization (ILO) ILOSTAT database, specifically for Asia. It includes 2,421 observations across 32 Asian countries spanning from 1969 to 2025, with the core indicator being EAR_EHRA_SEX_CUR_NB (Average hourly earnings of employees by sex and currency). The data is organized in tabular format, featuring fields such as country code, year, sex disaggregation, currency type, observed value, and status, suitable for tabular classification, regression, or time-series forecasting tasks. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-cur-nb-average-hourly-earnings-of-employees-by-sex-and-cu 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队重新封装而成。构建过程中,通过调用ILOSTAT REST API,直接提取了以'EAR_EHRA_SEX_CUR_NB'为标识的指标数据,并依据ISO 3166-1 alpha-3标准,将地理范围限定于亚洲地区的32个经济体。原始微观数据经过ILO基于国际劳工统计学家会议(ICLS)定义的统一化处理,确保了数据口径的一致性与跨国的可比较性。最终,数据集以Parquet格式发布,旨在为机器学习应用提供即用型的数据接口。
特点
该数据集涵盖1969年至2025年间亚洲32个国家的2,421条观测记录,聚焦于按性别和货币类型分组的雇员平均小时工资这一核心指标。其显著特点在于丰富的维度拆解,包括性别(总计、男性、女性)与货币类型,并标注了数据来源(如劳动力调查)与观测状态(如序列中断),为深入分析工资的性别差异与货币影响提供了详实的基础。数据以年频发布,且对于同一国家与年份存在多源数据时,优先采用ILO筛选的“最佳来源”,保证了数据的权威性和一致性。
使用方法
该数据集可通过Hugging Face的`datasets`库便捷加载,一行代码即可将数据转化为Pandas DataFrame进行后续分析。研究者可依据`ref_area`列(ISO国家代码)轻松筛选特定国家的时间序列,亦可针对`indicator`列对单一指标进行可视化探索。数据集还支持通过`pivot_table`方法构建国家×年份的矩阵视图,便于进行跨国的面板数据分析或时间序列预测。其结构化的列设计,如`sex`与`classif1`,为分组统计与分类模型训练提供了清晰的输入变量。
背景与挑战
背景概述
在全球劳动力市场研究中,工资水平的性别差异与货币计量体系的复杂性始终是劳动经济学关注的核心议题。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库整合了来自200多个经济体的劳动力调查与行政记录数据。在此背景下,Electric Sheep Asia于2025年重新打包发布了亚洲地区雇员平均小时工资数据集,该数据集涵盖32个亚洲国家、1969至2025年间共2421条观测值,聚焦于按性别和货币分类的工资指标。数据集依托ILO统一的统计方法论与ICLS定义,首次以标准化格式提供了跨越半个多世纪的亚洲工资面板数据,为跨国比较、性别工资差距分析及区域劳动力市场动态研究提供了关键基础设施,显著推动了发展经济学与计量劳动经济学领域的实证研究。
当前挑战
该数据集所应对的核心领域挑战源于亚洲劳动力市场的异质性:各国在数据采集频率、调查方法(如劳动力调查与建立调查的差异)、货币单位(本币与折算问题)以及统计口径上存在显著不一致,使得跨国工资比较面临严重的可比性危机。构建过程中,研究人员遭遇了多重技术障碍:首先,不同国家年度数据中混入月度或季度系列,需通过筛选过滤;其次,当同一国家同一年份存在多个数据源时,需依赖ILO提供的‘最佳来源’进行抉择;最后,性别分类变量(总、男、女)的缺失值模式复杂,且辅助分类字段(如年龄、教育)仅在特定指标发布时非空,增加了数据清洗与归一化难度。此外,断点序列标记(如‘B’状态)的引入要求建模时对时序结构性突变加以考量。
常用场景
经典使用场景
该数据集收录了国际劳工组织(ILO)ILOSTAT数据库中32个亚洲国家1969年至2025年间按性别与货币分组的雇员平均时薪观测值,共计2421条。作为一份融合时间序列与表格结构特性的劳动经济学数据,其经典应用在于构建面板数据模型,揭示亚洲各国工资水平的动态演变规律。研究者常借助该数据集进行跨国比较分析,评估经济发展阶段、产业政策与劳动力市场制度对薪酬结构的影响。同时,该数据还能支持时间序列预测任务,为预测区域工资增长趋势和劳动力成本变化提供可靠的历史参照。
衍生相关工作
该数据集源自ILOSTAT这一权威劳动统计平台,其衍生的经典工作广泛涵盖劳动经济学的多个方向。基于该数据的学术研究已产出关于亚洲国家工资收敛与经济增长的实证论文,以及性别工资差异的地区异质性分析。在方法论层面,研究者利用其长面板特性发展了处理非平衡面板数据的估算技术。此外,该数据集还支持了若干政策评估工作,例如分析货币波动对实际工资的影响。ILO自身也基于此类数据发布年度全球工资报告,为国际社会提供关于体面劳动目标的监测指标,推动了劳动统计的标准化与数据共享进程。
数据集最近研究
最新研究方向
当前,基于国际劳工组织(ILO)ILOSTAT数据库构建的亚洲地区雇员平均小时工资数据集,正被广泛应用于性别薪酬差距的跨国家、跨时序计量分析,以及劳动力市场不平等的追踪评估。研究者利用其涵盖32个亚洲国家、横跨1969至2025年的长序列观测值,结合性别与币种维度进行结构性分解,探讨全球化与产业升级对亚洲不同经济体工资收敛性的影响。此外,该数据集在机器学习领域亦展现出潜力,研究者尝试将其作为时间序列预测与面板数据回归的基准,用以构建区域劳动力市场动态预警模型,从而为联合国可持续发展目标中体面工作指标的监测提供数据驱动的决策支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务