遇见数据集

electricsheepasia/asia-ilo-emp-stem-sex-ocu-nb-employment-in-stem-occupations-by-sex-and-occupati

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲国家STEM职业就业数据,由Electric Sheep Asia重新打包。数据集涵盖32个亚洲国家,时间跨度为2000年至2025年,共4237个观测值。核心指标为“按性别和职业划分的STEM职业就业人数(千)”,数据按性别(总计、男性、女性)和职业分类进行细分。数据集适用于表格分类、回归和时间序列预测任务,结构包括国家代码、数据来源、指标、性别、年份、观测值等字段,可用于分析亚洲地区STEM劳动力市场的趋势和差异。

This dataset contains STEM occupation employment data for Asian countries sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged by Electric Sheep Asia. It covers 32 Asian countries, spanning the period from 2000 to 2025, with a total of 4237 observations. The core indicator is "STEM Occupation Employment (in thousands) by Gender and Occupation", which is disaggregated by gender (total, male, female) and occupational category. This dataset is suitable for tasks including table classification, regression and time series forecasting. Its structure includes fields such as country code, data source, indicator, gender, year and observation value. It can be used to analyze trends and disparities in the STEM labor market across the Asian region.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-stem-sex-ocu-nb-employment-in-stem-occupations-by-sex-and-occupati 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取亚洲32个国家的STEM就业数据,涵盖2000年至2025年间的观测记录。原始数据经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一化处理后,由Electric Sheep Asia团队进一步筛选出亚洲国家ISO3编码对应的数据条目,并重新打包为机器学习友好的格式。数据集包含4,237条观测值,每条记录均附有数据来源标签以供追溯,确保了数据整理过程的可复现性与透明度。
特点
数据集的核心特点在于其多维度的分类结构,除了提供STEM就业人数这一关键指标外,还按照性别(总、男、女)和职业分类进行细化分解,使用户能够深入分析不同群体在STEM领域的就业分布。数据质量方面,当同一国家与年份存在多个数据来源时,ILO会自动选用'最佳来源',同时通过观测状态标志(如'不可靠')和注释字段清晰标注方法论修订、非标准职业分类等潜在数据问题,为研究人员提供了审慎使用数据的必要上下文。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,并以pandas DataFrame格式进行后续分析。典型操作包括按国家代码筛选特定国家的数据子集,或针对单一指标进行时间序列可视化。对于需要国家间横向比较的研究,可借助数据透视表将原始表结构转换为以年份为行、国家为列的矩阵形式,便于执行跨国的统计建模或趋势分析。数据集采用CC-BY-4.0许可协议,使用时应同时标注ILO原始来源与Electric Sheep Asia的重包装贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年创建,并经Electric Sheep Asia重新整理发布,聚焦亚洲32国2000至2025年STEM(科学、技术、工程与数学)领域就业人数的性别与职业分类统计。STEM人才储备是衡量区域创新能力和经济竞争力的核心指标,尤其在亚洲新兴经济体快速数字化转型的背景下,性别与职业双维度的结构性缺口备受学术界与政策制定者关注。该数据集凭借ILOSTAT数据库的权威性与时序跨度,为跨性别比较分析、职业变迁预测及劳动力政策评估提供了标准化、可复现的高质量数据基础,对发展经济学、劳动社会学及计算社会科学领域具有重要推动力。
当前挑战
领域层面,亚洲各国STEM就业常面临数据碎片化与定义不统一的问题,多数公开数据仅涵盖单一国家或短期断面,难以支持跨国性别偏差异质性分析;此外,职业分类变动(如“非标准职业”注释)与调查方法论修订频繁,导致时序数据存在隐含断裂,若不加以校正,易引发统计推断偏误。构建层面,数据集虽依托ILOSTAT的协调流程,但原始来源涉及劳动力调查、行政记录等多源异构数据,且部分观测值标记为“不可靠”,需人工甄别质量;同时,32国数据的时间跨度与性别分组覆盖度参差不齐(如日本338行对阿联酋不足百行),如何平衡稀疏性与长尾分布以服务于稳健建模,仍是数据整合中未竟的挑战。
常用场景
经典使用场景
该数据集的核心应用场景在于分析亚洲地区STEM(科学、技术、工程、数学)领域就业的性别与职业分布特征。研究者可借助该数据,对32个亚洲国家在2000至2025年间STEM就业人数的时序演化进行追踪,通过国家间横向比较与纵向趋势分析,揭示区域STEM劳动力市场的动态格局。其结构化表格形式天然支持分类任务(如预测职业类别)、回归任务(如估算就业人数)以及时间序列预测(如未来STEM岗位需求建模),为劳动经济学与教育政策研究提供量化基石。
实际应用
在实际政策与商业场景中,该数据集是监测联合国可持续发展目标(SDG 9——产业创新与基础设施)中STEM就业指标的重要工具。各国劳动力部门可据此评估本国STEM人才供需缺口,设计针对性培训计划。跨国企业可利用此数据洞察亚洲各国技术劳动力池的性别构成与规模,辅助区域投资与人才布局决策。同时,教育机构能依据不同国家的STEM就业趋势校准课程设置,以匹配未来产业需求,实现从学术研究到社会价值的无缝转化。
衍生相关工作
围绕该数据集已衍生出一系列创新性研究:基于时序特征的STEM就业预测模型,如结合ARIMA与深度学习算法对菲律宾、越南等国2025年后的岗位缺口进行模拟;采用面板回归与因果推断方法,探讨教育投入、研发支出与STEM女性占比之间的交互效应;利用多维度特征(性别、职业、国家)构建聚类分析,识别出东亚与南亚在STEM技能结构上的差异化集群。这些工作不仅验证了数据集的扩展性,更催生了诸如“亚洲STEM备才指数”等复合指标,推动劳动统计学与公共政策分析的前沿融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务