遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-mts-cur-nb-average-monthly-earnings-of-employees-by-sex-marit

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、婚姻状况和货币划分的雇员月平均收入 | 亚洲(ILOSTAT),包含7,476个观测值,覆盖27个亚洲国家(如菲律宾、印度尼西亚、塞浦路斯等),时间跨度为1996年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过筛选和标准化处理,以确保数据一致性和可追溯性。数据集包括一个核心指标:EAR_EMTA_SEX_MTS_CUR_NB,表示按性别、婚姻状况和货币划分的雇员月平均收入。数据结构为表格形式,包含多个列,如国家代码(ref_area)、性别(sex)、婚姻状况分类(classif1)、货币类型(classif2)、年份(time)、观测值(obs_value)等,并提供了数据质量说明(如年度频率、最佳来源选择)。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲地区劳动力收入趋势和差异。数据以Parquet格式发布,遵循CC-BY-4.0许可证,由Electric Sheep Asia重新打包,便于机器学习研究使用。

This dataset, titled Monthly Average Employee Income by Sex, Marital Status and Currency | Asia (ILOSTAT), contains 7,476 observations covering 27 Asian countries including the Philippines, Indonesia, Cyprus and others, with a time span from 1996 to 2025. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via REST API, and has undergone screening and standardization processing to ensure data consistency and traceability. The dataset includes a core indicator: EAR_EMTA_SEX_MTS_CUR_NB, which represents the monthly average employee income classified by sex, marital status and currency. It is structured in tabular format with multiple columns such as country code (ref_area), sex (sex), marital status classification (classif1), currency type (classif2), year (time), observed value (obs_value), etc., and provides data quality explanations such as annual frequency and optimal source selection. This dataset is applicable to tasks including tabular classification, regression and time series forecasting, and can be used to analyze labor income trends and disparities in the Asian region. The dataset is released in Parquet format, licensed under CC-BY-4.0, and repackaged by Electric Sheep Asia to facilitate machine learning research.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-mts-cur-nb-average-monthly-earnings-of-employees-by-sex-marit 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API获取编码为EAR_EMTA_SEX_MTS_CUR_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出亚洲27个国家的观测记录。数据经ILO依据国际劳工统计学家会议(ICLS)定义进行协调统一,来源包括劳动力调查、家庭收入调查及行政记录等,并在source.label列中标注以保障可追溯性。最终以Parquet格式重新打包,由Electric Sheep Asia整理发布。
特点
数据集包含7,476条观测值,覆盖1996年至2025年的时间跨度,聚焦亚洲地区的雇员平均月收入状况。其核心特色在于多维度的分类变量,可按性别(总、男、女、其他)、婚姻状态及货币类型进行细分,同时支持国家与年份的交叉分析。数据以年度频率呈现,并提供了观察状态标志以说明数据质量,如序列中断或临时性估计,适合进行跨国家、跨时期的比较研究。
使用方法
该数据集设计为可直接通过HuggingFace Datasets库加载,用户只需调用load_dataset函数即可将数据导入为pandas DataFrame,便于进行后续的分析与建模。使用者可以依据国家代码(ref_area)筛选特定地区的数据,或根据指示器代码(indicator)抽取单一指标的时间序列。此外,利用pivot_table功能可便捷地将数据重塑为国家×年份的矩阵形式,为时间序列预测和面板数据分析提供便利。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库发布,经Electric Sheep Asia于2025年重新整理并托管于HuggingFace平台,聚焦亚洲27个国家1996年至2025年间按性别、婚姻状况和货币分类的雇员平均月收入。ILOSTAT作为全球劳动统计的权威来源,整合了来自劳动力调查、家庭收入调查及行政记录等多源数据,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。这一数据集的核心研究问题在于揭示亚洲地区劳动力市场中不同性别与婚姻状况群体的收入差异及其时间演化趋势,为劳动经济学、性别平等研究及可持续发展目标(SDG)中体面工作的量化评估提供了关键数据支撑。其影响力体现在,通过提供统一、高质量且可直接用于机器学习的时间序列数据,显著降低了亚洲区域劳动统计研究的准入门槛,推动了基于数据的政策分析与跨国比较研究。
当前挑战
该数据集在领域应用层面所面临的挑战主要包括:一是收入数据受宏观经济波动、汇率变动及通货膨胀影响,不同国家间的货币单位与购买力差异导致直接比较困难,需要复杂的标准化或购买力平价调整;二是性别与婚姻状况的交叠效应使得收入差距的归因变得复杂,难以区分歧视性因素与结构性因素(如行业隔离或职业选择)的贡献。在构建过程中,数据集需克服跨国数据源在定义、分类与统计口径上的异质性,例如ILOSTAT虽已进行协调,但部分国家仍存在序列中断(break in series)或可靠性标记不一(如观测状态标记为临时性或不可靠),这些标注本身即构成建模时的噪声来源。此外,从REST API提取并过滤至亚洲国家时,需确保地理编码的完备性与数据版本的一致性,而年度频率的限制则无法捕捉季度或月度内的波动特征。
常用场景
经典使用场景
在劳动经济学与性别平等研究领域,该数据集为分析亚洲地区雇员平均月薪的时空差异提供了核心数据支撑。研究者可借助其涵盖27国、跨越近30年的观测值,构建多维度面板数据模型,系统考察性别、婚姻状况及币种对薪酬水平的影响。经典应用包括利用时间序列分解方法识别薪酬变动的长期趋势与周期波动,或通过固定效应模型控制国家异质性后量化性别薪酬差距的演变轨迹。数据集中细致的分类变量(如婚姻状态总计与细分)使得交叉分析成为可能,为理解劳动力市场中婚姻溢价与性别歧视的交互作用提供了实证基础。
实际应用
在实际应用层面,该数据集是政策制定者与国际组织进行劳动市场监测与评估的得力工具。各国劳动部门可据此基准化本国薪酬水平,识别与区域平均水平的偏离,进而调整最低工资标准或制定针对性别的就业促进政策。跨国企业人力资源团队能利用薪酬趋势数据优化亚洲各国的薪酬体系设计,确保内部公平性并符合当地法规要求。此外,国际发展机构可借助这份数据监督可持续发展目标(SDG)中关于体面工作与经济增长指标的具体进展,特别是在识别弱势群体(如已婚女性)的经济赋能成效方面发挥着数据基石作用。
衍生相关工作
该数据集直接衍生了多项具有影响力的研究工作,尤其在亚洲劳动市场比较研究中占据独特地位。典型的衍生工作包括利用该数据构建的亚洲性别薪酬差距追踪指数,该指数已被后续研究用于分析经济发展阶段与性别平等的关系。另一类经典工作聚焦于婚姻状态对薪酬影响的跨国差异,研究者通过此数据集验证了婚姻溢价在不同文化背景下的异质性表现。此外,该数据中附带的来源标签与观测状态信息催生了一系列关于国际劳动统计数据质量的元研究,探讨了调查方法与行政记录数据对薪酬估计偏误的方向与大小,为后续数据使用者的方法论选择提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务