遇见数据集

electricsheepasia/asia-ilo-eip-3wap-sex-age-stu-rt-youth-inactivity-rate-by-sex-age-and-school-attend

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲36个国家从1970年至2025年的15,666条观测数据,核心指标为青年非活动率按性别、年龄和就学状态分类(%),用于衡量青年劳动力未充分利用情况。数据来源于国际劳工组织(ILOSTAT)数据库,涵盖国家代码、年份、性别(总计、男性、女性)、年龄分组(如15-29岁)、就学状态(总计)等维度,并包含数据来源、观测状态和质量注释。数据集适用于表格分类、回归和时间序列预测任务,旨在为研究亚洲青年劳动力市场提供标准化、机器学习就绪的数据支持。

This dataset contains 15,666 observations across 36 Asia countries from 1970 to 2025, focusing on the indicator Youth inactivity rate by sex, age and school attendance status (%), which measures youth labour underutilization. Sourced from the International Labour Organizations ILOSTAT database, it includes dimensions such as country codes, year, sex (total, male, female), age groups (e.g., 15-29), school attendance status (total), along with source metadata, observation flags, and quality notes. It is designed for tabular classification, regression, and time-series forecasting tasks, providing standardized, ML-ready data for analyzing youth labour markets in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-3wap-sex-age-stu-rt-youth-inactivity-rate-by-sex-age-and-school-attend 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接提取原始指标数据,并依据亚洲国家ISO3代码进行地理范围过滤。数据经过ILO统计部门基于国际劳工统计学家会议(ICLS)定义进行统一调和,确保跨国可比性。随后由Electric Sheep Asia团队对数据进行重新封装与标准化处理,转换为机器学习友好的Parquet格式,并以HuggingFace Datasets库的标准接口发布。数据来源在source.label列中标注,便于用户追溯每一条观测的原始调查或行政记录。
特点
数据集的核心特点在于其专注于亚洲36个国家青年不活跃率的精细维度拆解,涵盖性别、年龄带与就学状态三类关键交叉分类。时间跨度覆盖1970年至2025年,共计15,666条观测,为长时序比较分析提供了坚实基础。每个观测均附带数据质量标记(如断点、临时值),以及来源备注和指标注释,提升了数据使用的透明度与可信度。此外,数据集采用统一架构设计,列名清晰、类型明确,便于直接进行数据框操作与时间序列建模。
使用方法
使用方式极为便捷,用户可直接通过HuggingFace Datasets库的load_dataset函数一键加载数据,并快速转换为pandas DataFrame进行后续分析。典型应用包括筛选特定国家的子集以开展国别研究,或按时间排序绘制单个指标的年度变化曲线。也可利用pivot_table将数据重塑为国家×年份的矩阵形式,便于面板数据分析或跨国家比较。数据集的Schema设计友好,分类变量如性别、年龄组等可直接作为分组或过滤条件,支持灵活的多维分析需求。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,由Electric Sheep Asia于2025年重新打包并发布在HuggingFace平台,聚焦亚洲地区青年因性别、年龄及就学状态导致的未参与劳动率问题。核心研究问题在于揭示亚洲36个国家在1970至2025年间,不同社会人口特征群体在劳动力市场边缘化的动态模式。作为劳动经济学与公共政策研究的关键资源,该数据集通过整合15,666条观测记录,支持时间序列预测、分类与回归任务,为分析亚洲青年劳动力闲置的结构性成因、跨时期演变及性别与教育不平等提供了标准化、可复用的数据基础,对推动联合国可持续发展目标中体面劳动议题的实证研究具有重要影响力。
当前挑战
领域内首要挑战在于准确量化并拆解青年失业与未充分就业的复杂成因,特别是区分因教育参与、性别歧视和劳动市场结构僵化所导致的非自愿性闲置。该数据构建过程面临多重难题:需从各国劳动调查(如劳动力调查)中抽取原始微观数据,并依据国际劳工统计学家会议定义进行标准化与一体化处理,以弥合不同来源间在调查设计、年龄分组和学校出勤分类上的显著异质性。此外,时间跨度跨越半个世纪,需应对数据源断链、方法修订(如代理变量更替)及观测值的不可靠性标记,确保跨年、跨国可比性的同时保留原始溯源信息,从而为稳健的劳动力动态分析提供可信支撑。
常用场景
经典使用场景
该数据集收录了1970年至2025年间亚洲36个国家青少年的不活跃率,按性别、年龄组及在校状态进行细致划分,共计15666条观测记录。研究者可基于这些结构化面板数据,运用时间序列分析或回归模型,探究不同维度下青少年劳动参与行为的演变趋势。典型使用场景包括构建多国纵向比较模型,以识别亚洲区域内部青少年不活跃模式的共性与差异,或通过分类与回归任务预测特定群体(如女性或低龄组)的失能风险。数据集的时间跨度和地理覆盖使其成为分析代际变迁与教育—就业转换路径的重要素材。
衍生相关工作
围绕这一数据集已涌现出多项衍生性研究。其中既有利用贝叶斯结构时间序列模型对特定国家(如印度尼西亚或韩国)青年不活跃率进行点预测的工作,也有构建多国混合效应模型以量化教育出勤率对降低不活跃率的区域异质性影响的分析。此外,部分研究将其与ILOSTAT其他指标(如NEET比率或非正规就业比例)联合,构建综合性的青年劳动脆弱性指数,用于跨维度对比。另一些工作则致力于开发可复现的标准化数据清洗管道,推动亚太地区劳动统计数据的FAIR化(可发现、可访问、可互操作、可重用)进程。
数据集最近研究
最新研究方向
该数据集聚焦于亚太地区青年不活跃率的性别、年龄与在校状态交叉分析,服务于国际劳工组织(ILO)在衡量劳动力利用不足方面的前沿研究。随着全球青年就业危机加剧,尤其是后疫情时代青年NEET(Not in Education, Employment, or Training)问题引发广泛关注,该数据为监测可持续发展目标中体面劳动指标提供了关键实证基础。基于1970至2025年36个亚洲国家的时序观测,研究者可深入探讨教育扩展与劳动力市场退出之间的动态关联,以及性别不平等在青年经济参与中的持续影响。其精细化的分类维度支持多层级建模——从国家对比到代际变迁,为政策制定者识别高辍学率与低就业潜力群体、设计针对性技能培训方案提供了数据驱动的决策支撑,推动了区域劳动力市场研究从描述性统计向因果推断与预测预警的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务