遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-age-nb-median-hourly-earnings-of-employees-by-sex-and-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲国家按性别和年龄划分的员工小时收入中位数(本地货币)的表格数据集,来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集包含5,270个观测值,覆盖25个亚洲国家,时间跨度为1996年至2025年,涵盖一个核心指标:EAR_EHRM_SEX_AGE_NB,即按性别和年龄划分的员工小时收入中位数(本地货币)。数据通过ILOSTAT REST API获取,并经过ILO使用国际劳工统计学家会议(ICLS)定义进行标准化处理,包含国家代码、来源、指标、性别、年龄分类、观测年份、观测值等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset is a tabular dataset on median hourly earnings of employees by sex and age (local currency) for Asian countries, sourced from the International Labour Organization (ILO) ILOSTAT database. It contains 5,270 observations across 25 Asia countries, spanning the years 1996 to 2025, and covers one core indicator: EAR_EHRM_SEX_AGE_NB, which represents median hourly earnings of employees by sex and age (local currency). Data is pulled directly from the ILOSTAT REST API and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, including fields such as country code, source, indicator, sex, age classification, observation year, and observed value, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-age-nb-median-hourly-earnings-of-employees-by-sex-and-age 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区雇员按性别与年龄划分的时薪中位数。构建过程中,通过ILOSTAT REST API直接提取指标代码为EAR_EHRM_SEX_AGE_NB的原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出25个亚洲国家。原始数据经ILO基于国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,来源信息在source.label列中加以标注,确保数据可追溯。最终汇集为涵盖1996年至2025年间共5,270条观测值的数据集,以Parquet格式打包发布。
特点
该数据集的核心特点在于其精细的分类维度与区域性聚焦。除总值外,数据按性别(男性、女性、总计及他类)与年龄组(如15岁以上青年与成人)进行分层,支持深层次的群体对比分析。覆盖印度尼西亚、菲律宾、土耳其等25个亚洲经济体,时间跨度近三十年,能够反映亚洲劳动力市场的长期演变趋势。所有观测值均以当地货币计值,并附带观测状态标记(如序列中断、临时值),便于用户评估数据质量与可靠性。
使用方法
用户可通过HuggingFace Datasets库直接加载数据:使用load_dataset函数即可获取训练集并转为Pandas DataFrame进行后续分析。支持按国家筛选特定子集,例如过滤ref_area为IDN获取印度尼西亚数据;也可按时间序列排序特定指标,绘制时薪中位数随时间变化的趋势图。此外,通过pivot_table函数可构建以年份为行、国家为列的透视矩阵,便于开展跨国比较或面板数据分析,适用于劳动经济学、薪资不平等及亚洲区域研究等场景。
背景与挑战
背景概述
在全球劳动经济学研究中,收入分配的性别与年龄差距一直是衡量社会公平与经济健康发展的重要指标。国际劳工组织(ILO)作为全球劳动统计的权威机构,通过其ILOSTAT数据库整合了来自200多个经济体的劳动调查数据。在此背景下,本数据集由Electric Sheep Asia于2025年重新整理发布,聚焦亚洲地区,囊括25个国家从1996年至2025年共5270条雇员小时工资中位数观测值,按性别和年龄维度细分,使用本地货币计价。该数据集系统性地呈现了亚洲区域劳动力市场中性别与年龄维度的收入差异,为研究者深入探究亚洲经济转型过程中的劳动报酬不平等问题提供了高质量、时空连续的数据基础,对推动区域劳动经济学、性别平等及可持续发展目标的研究具有重要意义。
当前挑战
本数据集所面临的挑战显著地体现在两个层面。在领域问题层面,劳动力市场中隐蔽的性别与年龄工资歧视难以通过单一统计指标完全揭示,不同国家在职业隔离、教育回报率及非正规就业比例上的差异使得跨国比较尤为复杂,且区域内的文化传统与政策环境差异进一步加剧了收入不平等机制的解析难度。在构建过程层面,原始数据源来自各国多种调查类型(如劳动力调查、家庭收入调查等),其调查设计、样本覆盖范围及编码体系的异质性极大增加了数据整合与统一的难度;部分国家存在年份缺失、数据标记为临时或序列中断等问题,需要谨慎处理观测状态标记与数据质量的权衡;此外,多源数据中最佳来源的选择标准亦需维持透明且可溯源,以确保重构后数据集的分析可靠性。
常用场景
经典使用场景
该数据集收录了1996年至2025年间25个亚洲国家雇员按性别和年龄划分的时薪中位数观测数据,共计5270条。经典使用场景聚焦于劳动经济学领域的跨国面板分析,研究者可借助时间序列回归或固定效应模型,探究亚洲地区性别收入差距的演变趋势、年龄溢价效应以及经济发展阶段对薪酬结构的影响。数据按性别与年龄维度分拆,为解析劳动力市场中的性别不平等与代际收入分化提供了细粒度支撑。
衍生相关工作
该数据集衍生出一系列标志性研究工作:基于ILOSTAT面板数据的《亚洲性别薪酬差距的收敛与分化》计量分析,运用分位数回归与Oaxaca-Blinder分解法识别不可解释部分;《劳动年龄群体收入流动性的跨国比较》借助伪面板方法追踪代际收入弹性;以及《最低工资制度对性别收入差距的调节效应》采用双重差分模型评估政策冲击。这些成果不仅深化了对亚洲劳动力市场运行机制的理解,还催生了开源统计工具包如`ilostatr`与`pyilostat`,推动数据复用与学术生态共建。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区员工按性别与年龄划分的时薪中位数,为劳动经济学中的性别薪酬差距与代际收入流动研究提供了关键微观证据。结合国际劳工组织发布的《全球工资报告2024-25》,该数据可服务于跨国比较分析,揭示亚洲各国在劳动力市场包容性方面的结构性差异。在可持续发目标(SDG)框架下,尤其是目标8(体面工作与经济增长)与目标5(性别平等)的量化评估中,该数据集成为追踪亚洲新兴经济体消除性别薪酬鸿沟、促进青年就业质量提升的前沿基准。其时间跨度覆盖1996至2025年,支持动态面板回归与结构断点检验,对捕捉数字化转型与后疫情时代劳动力市场韧性具有独特实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务