遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-ocu-nb-average-hourly-earnings-of-employees-by-sex-and-oc

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲31个国家从1969年至2025年的员工平均小时收入数据,重点关注按性别和职业划分的指标。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为亚洲国家。数据集共有10,857个观察值,涵盖唯一指标EAR_EHRA_SEX_OCU_NB,即按性别和职业划分的员工平均小时收入(本地货币)。数据模式包括国家代码、国家名称、来源代码、指标代码、性别分类(如总计、男性、女性)、职业分类、观测年份、观测值(以本地货币计价的平均小时收入)、观测状态标志和相关注释列。数据以年度频率发布,ILO使用国际劳工统计学家会议(ICLS)定义对原始调查微数据进行协调,确保数据可比性。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲劳动力市场中的收入差异和趋势。

This dataset contains average hourly earnings data for employees in 31 Asian countries from 1969 to 2025, focusing on indicators disaggregated by sex and occupation. The data is sourced from the International Labour Organization (ILO)s ILOSTAT statistical database, retrieved via API and filtered to Asian countries. It includes 10,857 observations covering the unique indicator EAR_EHRA_SEX_OCU_NB, which represents Average hourly earnings of employees by sex and occupation (local currency). The schema comprises columns such as country code, country name, source code, indicator code, sex classification (e.g., total, male, female), occupation classification, observation year, observed value (average hourly earnings in local currency), observation status flags, and related notes. The data is published at annual frequency, with ILO harmonizing raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions to ensure comparability. The dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, enabling analysis of income disparities and trends in Asian labor markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-ocu-nb-average-hourly-earnings-of-employees-by-sex-and-oc 数据集图片
构建方式
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库的REST API直接摄取而来,经Electric Sheep Asia重新封装整理。数据源从原始API接口获取后,依据亚洲ISO3国家代码进行地域过滤,并仅保留经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调后的最佳来源数据。为确保数据可追溯,每一条观测记录均通过source.label字段标注其原始来源,涵盖劳动力调查、家庭收入调查、机构调查乃至行政记录等多种数据来源。最终形成包含10,857条观测、覆盖31个亚洲国家、时间跨度自1969年至2025年的结构化面板数据。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据,仅需一行代码即可获得pandas DataFrame格式的完整数据表。在具体分析时,可依据ref_area列对国家进行筛选,例如提取印度尼西亚子集;亦可针对特定指示符排序后绘制时间序列曲线,直观观察长期趋势。对于跨国家比较,推荐利用pivot_table方法以年份为行、国家为列构造透视矩阵,从而便捷地进行区域间收入水平对比与可视化。所有操作均基于标准化列名设计,确保数据探索流程简洁高效,降低劳动经济学实证研究的复现门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并由Electric Sheep Asia团队重新打包整理,旨在提供亚洲地区按性别和职业划分的雇员平均时薪数据(以本币计)。作为全球劳动统计领域的权威来源,ILO通过整合各国劳动力调查、家庭收支调查及行政记录,形成了覆盖31个亚洲国家、跨越1969至2025年间共计10,857条观测值的数据集。这些数据不仅揭示了不同性别和职业群体在薪酬结构上的长期差异,也为研究区域经济发展、劳动力市场不平等以及性别薪酬差距等核心问题提供了关键定量基础,对劳动经济学、公共政策分析及可持续发展目标监测具有显著影响力。
当前挑战
该数据集所应对的领域挑战在于,亚洲地区长期缺乏标准化、跨国家的时薪统计资料,难以系统分析性别与职业维度的薪酬不平等问题。构建过程中面临的挑战包括:各国原始调查方法与国际劳工统计学家会议(ICLS)定义之间的不一致性,需要通过源标记(source.label)进行追溯;多来源数据在同一国家与年份可能产生冲突,必须依赖ILO选取的‘最佳来源’进行协调;此外,分类变量(如职业技能等级)的覆盖范围与定义差异、部分国家观测年份稀疏以及年度数据频率无法捕捉短期波动,均增加了数据整合与可比性分析的复杂性。
常用场景
经典使用场景
该数据集汇集了1969年至2025年间亚洲31个国家按性别与职业划分的雇员平均小时工资数据,共计10,857条观测记录。在劳动经济学与时间序列分析领域,研究者常利用此类结构化面板数据开展跨国工资水平比较、性别收入差距的动态追踪以及不同职业层级报酬结构的演变研究。通过整合ILOSTAT官方统计资源,数据集为构建预测模型提供了扎实的监督学习基础,特别适用于回归任务中探究性别、职业分类与薪酬之间的定量关系,也为针对亚洲新兴经济体劳动力市场的计量经济学验证设立了标准化数据基准。
解决学术问题
长期以来,发展中国家劳动统计数据的碎片化和标准不统一导致区域性薪酬研究难以深入开展。该数据集通过ILO的国际劳工统计学家会议(ICLS)统一定义对原始调查数据进行协调,系统性地解决了跨国数据可比性问题。学术上,它为量化检验人力资本理论中的性别薪酬差异假设、职业隔离效应以及经济发展阶段与工资收敛性之间的关系提供了可靠证据。其填补了亚洲地区在高频次、细粒度薪酬面板数据方面的空白,使得研究者能够更精确地分离出劳动力市场结构性变化与周期性波动对收入的异质性冲击,从而推动了发展经济学和劳工经济学实证范式的完善。
实际应用
在实际应用中,该数据集为国际组织、政府劳工部门和智库机构评估亚洲各国薪酬政策影响提供了数据基础设施。例如,政策制定者可利用按性别拆分的工资序列来监测同工同酬法规的执行效果,或依据不同职业类别的薪酬趋势调整最低工资标准。对于跨国企业的人力资源规划,该数据有助于识别区域间劳动力成本优势并优化薪酬策略。此外,非政府组织可借助这些时间序列数据生成关于体面工作目标(SDG 8)的进展报告,以数据驱动的方式推动社会公平议题的公众讨论与政策干预。
数据集最近研究
最新研究方向
在亚太地区劳动力市场不平等与性别薪资差距的实证研究中,该数据集凭借跨越半个多世纪(1969–2025年)的时序观测和按性别与职业细分的时薪指标,正成为关键数据支撑。研究者利用ILOSTAT协调后的标准化微观数据,通过面板回归与分解分析,精准刻画亚洲31国在全球化、产业升级及新冠疫情冲击下,不同职业层级的薪资演化轨迹与性别分化特征。此举不仅服务于国际劳工组织体面劳动目标(SDG 8.5)的进展评估,也为各国制定性别平等薪酬政策及区域劳动力流动研究提供了高颗粒度的实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务