遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲15个国家从1997年至2024年的员工中位小时收入数据,重点关注按性别和残疾状况及货币分类的统计。数据集共包含1,529个观察值,覆盖一个独特指标:EAR_EHRM_SEX_DSB_CUR_NB,即按性别和残疾状况及货币分类的员工中位小时收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤到亚洲国家代码。数据集以表格形式呈现,包括国家代码、国家名称、数据来源、指标代码、性别分类、残疾状况分类、货币类型、观察年份、观察值、观察状态等列。数据为年度频率,ILOSTAT使用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,确保数据可比性。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层,方便研究人员和开发者使用。

This dataset contains median hourly earnings data for employees in 15 Asian countries from 1997 to 2024, disaggregated by sex, disability status, and currency. It includes 1,529 observations covering one distinct indicator: EAR_EHRM_SEX_DSB_CUR_NB (Median hourly earnings of employees by sex and disability status and currency). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via REST API and filtered to Asian country codes. The dataset is presented in tabular format with columns such as country code, country name, data source, indicator code, sex classification, disability status classification, currency type, observation year, observed value, and observation status. Data is annual in frequency, with ILOSTAT harmonizing raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions for comparability. Repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia, facilitating use by researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于亚洲地区雇员按性别和残疾状况分类的时薪中位数指标。研究者通过ILOSTAT REST API直接提取原始数据,并依据亚洲ISO3国家代码进行地理范围筛选,最终汇聚了来自15个亚洲国家的1529条观测记录。ILOSTAT机构依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化处理,并在数据集的'source.label'列中明确标注数据源,确保了数据的可追溯性与跨国的可比性。
特点
该数据集的一大特色在于其精细的多维分类体系,包含'sex'(性别)和'classif1'(残疾状况)等重要维度,能够支持对不同社会群体的工资差异进行深入剖析。数据覆盖了1997年至2024年的长时间跨度,提供了年度频率的时间序列数据。同时,数据集引入了'obs_status'和'note_indicator'等质量标识列,标注了如序列中断、数据可靠性等状态,为研究者评估数据质量提供了透明且严谨的参考依据。
使用方法
用户可借助HuggingFace的'datasets'库,通过一行代码'load_dataset()'便捷地加载该数据集。加载后,数据可转换为Pandas DataFrame格式,利用'to_pandas()'方法进行后续分析。典型应用包括按国家代码(如'ref_area')筛选特定国家的数据子集,或针对单一指标按时间序列排序以绘制趋势图。此外,通过pivot_table操作,还能轻松将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或横向比较研究。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)监测领域,薪酬数据的性别与残障维度交叉分析长期受制于碎片化与可比性不足的困境。国际劳工组织(ILO)统计司(ILOSTAT)作为全球劳动统计的核心枢纽,于2024年通过其官方API发布了涵盖1997年至2024年亚洲15国的“按性别与残障状况及货币分列的雇员小时工资中位数”数据集。该数据集由Electric Sheep Asia团队重新打包并托管于HuggingFace平台,聚焦于揭示亚洲地区残障群体在劳动力市场中的经济参与状况及其与性别的交互影响,为推进体面劳动与包容性经济增长提供了关键的数据基础设施。其核心价值在于将通常被边缘化的残障维度纳入收入不平等分析框架,填补了区域级交叉性薪酬研究的空白。
当前挑战
该数据集所解决的领域核心挑战在于系统性地量化亚洲国家中性别与残障状况对小时工资中位数的复合影响,突破传统研究中仅关注单一维度的局限。在构建过程中,面临的首要挑战是多国调查口径的高度异质性——不同国家的劳动力调查(LFS)对“残障”的定义、调查频率及本地货币单位不尽相同,ILO虽按国际劳工统计学家会议(ICLS)标准进行协调,但数据中仍存在序列断裂(如阿富汗数据仅覆盖2020年)与来源编码差异。其次,样本规模在国别间极不平衡,柬埔寨(321条)与巴基斯坦(27条)的数据量相差十余倍,可能导致群体间统计推断的偏差。此外,时间跨度的不连续性(如塔吉克斯坦仅含2003-2007年数据)与分类标识(如货币种类)的复杂性,为跨时期、跨国别的可比分析设置了额外障碍。
常用场景
经典使用场景
该数据集的核心价值在于为劳动经济学与收入不平等研究提供了横跨1997至2024年、覆盖15个亚洲国家的雇员时薪中位数面板数据。研究者可据此构建性别与残疾状态交叉分类的多元回归模型,深入剖析劳动力市场中基于性别和残疾状况的收入差异。在时间序列分析领域,该数据为捕捉亚洲各国工资水平的长期演变趋势、识别收入分配格局的结构性变化提供了稀有的跨国可比数据源,是评估亚洲劳动力市场包容性发展进程的基准材料。
实际应用
在实际应用层面,该数据集是国际组织、国家劳工部门及非政府组织制定包容性就业政策的核心依据。决策者可利用分性别与残疾状态的时薪中位数数据,精准识别哪些亚洲国家的残疾女性面临最严重的收入边缘化,从而优先配置公共资源。在跨国比较中,该数据为评估《残疾人权利公约》实施效果提供了量化指标,助力世界银行及亚洲开发银行设计针对性的技能培训与就业扶持项目,并为企业ESG报告中的社会维度(S)披露提供了可信的行业薪酬基准。
衍生相关工作
围绕该数据集已衍生出一系列标志性学术探索,包括基于多国面板数据的双边随机前沿模型,用以分解性别-残疾交互效应中的歧视成分与禀赋差异;利用间断时间序列设计评估特定国家反残疾歧视立法对工资收敛的动态效应;以及融合机器学习方法构建亚洲劳动力市场脆弱性预测框架。此外,该数据集常与ILOSTAT体系中的就业率、非正规就业比例及教育回报率指标联合使用,构建综合性社会包容指数,相关成果屡见于《World Development》与《Journal of Human Resources》等顶级期刊的劳动经济学专题中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务