遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-edu-nb-average-monthly-earnings-of-employees-by-sex-and-e

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和教育划分的员工平均月收入(本地货币)指标数据,涵盖亚洲27个国家,时间跨度为1996年至2025年,共有9,787条观测记录。数据按性别(总计、男性、女性、其他)和教育水平(总计分类)进行细分,包括国家代码、年份、观测值、数据来源、观测状态和注释等信息。数据集主要用于表格分类、回归和时间序列预测任务,适用于劳动经济学研究和机器学习分析。

This dataset contains the Average monthly earnings of employees by sex and education (local currency) indicator from the International Labour Organization (ILO) ILOSTAT database, covering 27 Asia countries from 1996 to 2025, with 9,787 observations. Data is disaggregated by sex (total, male, female, other) and education level (total classification), and includes columns such as country code, year, observed value, data source, observation status, and notes. It is designed for tabular classification, regression, and time-series forecasting tasks, suitable for labour economics research and machine learning analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-edu-nb-average-monthly-earnings-of-employees-by-sex-and-e 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队从ILOSTAT REST API直接抽取、筛选并重新打包而成。原始数据基于各国劳动力调查、家庭收入调查及行政记录等多元来源,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集聚焦于亚洲地区,依据ISO3国家代码筛选出27个亚洲国家,涵盖1996年至2025年间的年度观测值,最终整合为9787条记录,并标注了原始数据来源以便追溯。
特点
数据集以精细的维度拆解为突出亮点,提供了按性别(Sex)和受教育程度(Education)交叉分类的员工平均月收入指标(以当地货币计价)。每条记录包含国家代码、来源标注、观测值、状态标识及多种分类注释字段,支持用户从时间序列、国别对比和分层聚合等多个角度展开分析。数据质量经过ILO统一协调,并在出现多来源时选用‘最佳来源’,确保了跨时空比较的可靠性与一致性。
使用方法
用户可通过HuggingFace Datasets库快速加载数据,使用`load_dataset()`命令一步获取可直接操作的Pandas DataFrame。针对单一国家的子集筛选、特定指标的时间序列可视化,以及构建国家×年份的透视矩阵等常见分析任务,均提供了简洁的Python代码示例。数据集字段设计清晰,支持按性别、教育水平等分类变量进行灵活的分组与过滤,适合用于经济与劳动经济学领域的回归建模、时间序列预测及分类任务。
背景与挑战
背景概述
在国际劳动统计领域,性别与教育程度对工资差异的影响始终是核心议题,然而亚洲地区长期缺乏标准化、跨国家的可比时序数据。为弥合这一数据鸿沟,国际劳工组织(ILO)于2025年依托其ILOSTAT数据库,整合来自27个亚洲国家、覆盖1996至2025年的近万条观测记录,构建了本数据集。该数据集聚焦于按性别与教育程度划分的雇员月平均收入(以本币计),由Electric Sheep Asia团队在HuggingFace上重新封装发布,旨在为劳动经济学、性别平等及教育回报率等研究提供机器就绪的高质量数据基础。其面世显著增强了亚洲劳动市场微观面板数据的可获取性,为推动区域政策评估与跨文化比较研究提供了坚实支撑。
当前挑战
该数据集所应对的领域挑战在于,亚洲各国既有的劳动收入统计多源于调查口径不一、分类标准迥异的国别报告,导致性别与教育维度的跨国比较常因定义差异而失效。ILOSTAT虽采用国际劳工统计学家会议(ICLS)定义进行协调,但原始调查数据中仍存在序列断裂、来源变更与观测值标记为临时性或不稳定等质量问题,需通过obs_status与note_source等字段进行审慎过滤。在构建层面,数据的自动化抽取与亚细地区ISO代码的精确筛选需应对庞大API的接口限制与逐年增加的多源数据碎片化问题,而性别维度中仅含四项分类,教育层面的非标准分级亦为深度融合与建模带来了额外清洗挑战。
常用场景
经典使用场景
在劳动经济学与社会科学研究领域,该数据集常被用于分析亚洲各国不同性别与教育程度员工的平均月收入水平及其演进规律。基于ILOSTAT官方统计资源,该数据涵盖了27个亚洲国家自1996年至2025年的近万条观测记录,为跨国家、跨时段的面板数据分析提供了扎实基础。研究者可借助该数据集构建时间序列模型,揭示性别收入差距的演变轨迹,或评估教育对劳动报酬的边际贡献,从而为学术探讨不平等问题提供量化支撑。
实际应用
在实际应用中,该数据集对国际组织、政府智库与企业的人力资源部门具有重要参考意义。国际劳工组织可运用这些数据监测《2030年可持续发展议程》中的体面劳动目标进展,尤其是性别平等与收入增长相关指标。各国政策制定者能够基于时间序列分析,评估薪酬政策的实施效果,识别教育投资对收入提升的时效性。同时,跨国企业在进入亚洲市场时,也可借助该数据校准薪酬基准,优化人力资源管理策略。
衍生相关工作
基于该数据集,衍生出的经典工作主要包括利用面板回归模型分析教育程度对收入的异质性影响,以及运用机器学习方法预测未来薪酬趋势的研究。部分学者进一步构建了性别收入差距的分解模型,量化歧视性与禀赋性因素的贡献比例。此外,该数据还催生了交互式可视化平台,便于公众与决策者动态探索亚洲各国薪酬格局的变化。这些衍生工作不仅深化了对劳动市场运行机制的理解,也推动了数据驱动型政策评估方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务