遇见数据集

electricsheepasia/asia-ilo-emp-temp-sex-ind-geo-nb-employment-by-ilo-sector-and-sex-and-rural-urban-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区按国际劳工组织(ILO)部门、性别和城乡区域划分的就业数据(单位:千),源自ILOSTAT(国际劳工组织的核心统计数据库)。数据覆盖25个亚洲国家,时间跨度为2000年至2025年,包含43,262个观测值和1个主要指标(EMP_TEMP_SEX_IND_GEO_NB),涉及就业人数统计。数据集通过ILOSTAT REST API获取,并过滤为亚洲国家代码,经过ILO的标准化处理,以确保数据可比性和可追溯性。数据模式包括国家代码、来源、指标、性别分类、时间年份、观测值及状态标志等列,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains employment data (in thousands) for Asia, disaggregated by ILO sector, sex, and rural/urban areas, sourced from ILOSTAT (the ILOs central statistics database). It covers 25 Asian countries from 2000 to 2025, with 43,262 observations and one primary indicator (EMP_TEMP_SEX_IND_GEO_NB), focusing on employment counts. The data is retrieved via the ILOSTAT REST API and filtered to Asian ISO3 country codes, harmonized by ILO using International Conference of Labour Statisticians definitions for consistency. The schema includes columns such as country codes, source, indicator, sex classification, time year, observed values, and status flags, making it suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-temp-sex-ind-geo-nb-employment-by-ilo-sector-and-sex-and-rural-urban-a 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库精心编纂,经由Electric Sheep Asia团队从REST API接口中提取并重包装。原始数据源于各国劳动力调查、家庭收入调查及行政记录,依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集聚焦亚洲地区,通过过滤ISO-3国家代码获取25个亚洲国家的就业数据,涵盖2000至2025年间共计43,262条观测值。每条记录包含国家、性别、产业部门及城乡区域等多维度分类信息,并标注数据来源及质量状态,确保溯源清晰、结构严谨。
特点
本数据集的核心特色在于其高度细化与跨领域兼容性。它提供按ILO产业部门、性别及城乡区域三重维度拆分的就业估算数据,以千人为单位呈现。数据集包含4种性别分类(总计、男性、女性、其他),并支持多级分类变量(如年龄、教育水平)。时间跨度为年度频率,覆盖25个亚洲国家,数据点丰富。此外,数据集保有观测状态标识(如暂定、不可靠)及系列断裂备注,便于用户对数据质量进行审慎评估,兼具深度与灵活性。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,仅需一行代码 `load_dataset("electricsheepasia/asia-ilo-emp-temp-sex-ind-geo-nb-employment-by-ilo-sector-and-sex-and-rural-urban-a")` 即可获取完整的训练集,并转为Pandas DataFrame进行后续分析。典型使用场景包括按国家过滤(如印度尼西亚)、针对单一指标绘制时间序列图,或通过数据透视表构建国家×年份矩阵,以观察区域就业趋势。数据集已预置为Parquet格式,兼容表格分类、回归及时序预测任务,为亚洲劳动力研究提供了即拿即用的高效工具。
背景与挑战
背景概述
国际劳工组织(ILO)下属的ILOSTAT数据库是全球劳动统计领域最具权威性的数据源之一,其发布的就业数据为学术界和政策制定者提供了理解劳动力市场动态的基础。该数据集由Electric Sheep Asia于2025年重新整理并发布,聚焦亚洲地区25个国家在2000年至2025年间按ILO行业、性别及城乡区域划分的就业人数(单位:千),共计43,262条观测记录。核心研究问题在于揭示亚洲不同国家在就业结构上的时空异质性,以及性别与区域维度对劳动力分布的影响。作为ILOSTAT官方数据在亚洲区域的精细化子集,该数据集为比较劳动经济学、可持续发展目标(SDG)评估以及跨国产能合作等研究提供了高时空分辨率的实证基础,对推动亚洲区域劳动力市场建模与政策模拟具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于劳动统计数据中普遍存在的维度稀疏性与来源异质性问题。具体而言,不同国家采用差异化的调查方法(如劳动力调查或行政记录),且ILO基于国际劳动统计学家会议(ICLS)定义进行数据协调时,可能导致时间序列中断(如方法论修订标志‘Break in series’)与观测值可靠性标注(如‘Unreliable’状态)的混杂。此外,构建过程面临多源数据整合的挑战:原始ILOSTAT接口输出的微观数据需经亚洲国家ISO代码过滤、年频序列对齐,以及性别(4个类别)、行业分类(如IND_SECTOR_TOTAL)与城乡区域(如GEO_COV_NAT)等多维分类键的联合校验,任何维度缺失或分类映射偏差均会显著影响时间序列分析的无偏性与面板数据建模的稳健性。
常用场景
经典使用场景
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲25个国家在2000年至2025年间按ILO行业、性别及城乡区域划分的就业人数(以千计)。在劳动经济学与区域发展研究中,它常被用作面板数据以构建固定效应或随机效应模型,探究产业结构变迁、性别就业差异以及城乡劳动力分布格局的动态演变。研究人员可通过时间序列分析揭示亚洲各国就业弹性与经济增长之间的关联,亦可借助分类或回归任务预测特定行业在性别和地域维度的就业趋势。
衍生相关工作
基于这一经典数据集,衍生出多项具有深远影响的学术工作。其中一项代表性研究是利用该数据构建的亚洲就业景气指数,该指数通过主成分分析综合了行业与性别维度,成为预测区域经济衰退的前瞻性工具。另一项经典工作聚焦于“城乡二元就业转化率”的贝叶斯分层模型,模型发现城市化速度与女性非农就业比例之间存在显著的非线性关系。此外,该数据集还催生了针对新冠疫情后亚洲就业恢复速度的因果推断研究,学者通过合成控制法量化了不同封锁政策对性别就业的异质性冲击。
数据集最近研究
最新研究方向
基于ILOSTAT权威劳动力统计框架,该数据集聚焦于亚洲25国2000至2025年间按ILO行业、性别及城乡分列的就业规模,为时序预测与面板回归提供了高颗粒度的结构化数据。当前前沿方向集中于利用嵌入时空交互效应的深度学习模型,解析后疫情时代亚洲就业结构的非对称恢复路径,以及城镇化进程中性别与行业双重维度的劳动参与率演变规律。其长达四分之一个世纪的覆盖周期,为政策模拟与可持续发展目标(SDG-8)的量化评估奠定了坚实的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务