遇见数据集

electricsheepafrica/africa-ilo-emp-dwap-sex-edu-cct-rt-employment-to-population-ratio-by-sex-education-an

收藏
Hugging Face2026-05-25 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了关于非洲42个国家1991年至2025年期间,按性别、教育程度和公民身份细分的就业人口比率(%)的统计数据,共计6,816个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,并通过其REST API获取,经过筛选仅包含非洲地区的国家代码。数据集中的核心指标为EMP_DWAP_SEX_EDU_CCT_RT,即按性别、教育程度和公民身份划分的就业人口比率。数据模式(Schema)包含多个字段,如国家代码(ref_area)、年份(time)、观测值(obs_value)、性别细分(sex)、教育程度分类(classif1)、公民身份分类(classif2)、数据来源(source)以及各种数据质量注释和状态标志(如obs_status)。数据集旨在为研究人员和开发者提供机器学习就绪的、结构化的非洲劳动力市场数据,特别关注就业人口比率的跨维度分析。

This dataset contains 6,816 observations of Employment-to-population ratio (%) data, disaggregated by sex, education, and citizenship, across 42 African countries from 1991 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to include only African country codes. The core indicator is EMP_DWAP_SEX_EDU_CCT_RT, which stands for Employment-to-population ratio by sex, education and citizenship (%). The dataset schema includes fields such as country code (ref_area), year (time), observed value (obs_value), sex disaggregation (sex), education classification (classif1), citizenship classification (classif2), data source (source), and various data quality notes and status flags (e.g., obs_status). The dataset is designed to provide machine learning-ready, structured labor market data for Africa, with a focus on cross-dimensional analysis of employment-to-population ratios.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-dwap-sex-edu-cct-rt-employment-to-population-ratio-by-sex-education-an 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,由Electric Sheep Africa进行标准化再封装。原始数据经系统化采集与整理,涵盖非洲42个国家自1991年至2025年的劳动力市场统计信息,总计6,816条观测记录。Electric Sheep Africa在此基础上补充了标准化的发现元数据、加载指南、来源注释与分析背景,并以Parquet列式存储格式发布,确保数据在机器学习工作流中的可复现性与高效读取。
特点
数据集聚焦于按性别、教育程度和公民身份分列的就业人口比率,以百分比形式呈现,属于经济学与金融领域的表格型数据。其覆盖范围横跨非洲大陆,时间序列长达三十余年,具备1K至10K的中等规模,标签体系包含“ilostat”“labour”“employment”等主题词。数据以表格与文本两种模态呈现,适合进行分组比较与趋势分析,但部分元数据字段如国家与上游发布者存在缺口,使用时需加以留意。
使用方法
研究人员可通过Hugging Face的datasets库以单行代码加载数据集,并借助内置查看器快速浏览数据结构。加载后可获取特征列表与前几行样本,并利用to_pandas方法转换为数据框以支持传统统计分析。在使用过程中,建议先检查模式与缺失值分布,保留原始缺失直至确立合理的插补规则,并利用显式的国家、年份与指标字段开展跨数据集连接,以构建可复现的分析流程。
背景与挑战
背景概述
就业人口比是衡量劳动力市场吸纳能力的关键指标,其按性别、教育程度与公民身份的分层数据对理解结构性不平等具有重要价值。国际劳工组织(ILO)依托ILOSTAT数据库长期采集全球劳动力统计,为政策评估提供权威依据。Electric Sheep Africa于2026年将非洲区域相关数据整理发布至Hugging Face平台,覆盖42个非洲国家、1991至2025年间6816条观测,旨在促进非洲数据的可发现性与可复现分析。该数据集为探究教育回报、性别差距与移民就业融入等议题提供了跨时空的实证基础,对发展经济学与劳动政策研究具有显著参考意义。
当前挑战
该数据集所回应的核心领域问题在于如何量化并比较非洲各国不同性别、教育水平及公民身份群体的就业参与差异,以揭示劳动力市场中的分层机制。构建过程中面临多重挑战:源数据跨越三十余年,各国统计口径与调查方法存在异质性,导致指标可比性受限;教育程度与公民身份的细分维度在部分国家存在系统性缺失;元数据清单显示国家字段与上游发布者信息尚未完整声明,需依赖标题与来源元数据推断地理覆盖。此外,缺失值的合理保留与插补规则的建立、单位与变量定义的核实,均构成后续分析中不可回避的方法论难题。
常用场景
经典使用场景
在劳动经济学与非洲发展研究的交汇处,该数据集凭借其按性别、教育程度与公民身份三重维度分列的就业人口比指标,成为刻画非洲各国劳动力市场结构性差异的基准性数据资源。研究者通常将其用于构建跨国面板数据模型,考察教育禀赋与性别因素如何交互影响就业参与水平,亦可用于追踪1991年至2025年间非洲42国就业结构的长期演变轨迹。凭借标准化元数据与Parquet列式存储格式,该数据集特别适合作为非洲劳动市场比较研究的经典入门数据源。
解决学术问题
该数据集有效回应了非洲劳动统计中长期存在的两个学术难题:其一是跨国可比性不足,各国就业定义与统计口径的差异使横向比较困难;其二是性别与教育维度的细分数据稀缺,难以支撑交叉性分析。通过整合ILOSTAT标准化指标,该数据集使研究者得以系统检验教育回报的性别异质性、公民身份对就业机会的调节效应等假设,为非洲劳动市场分层研究提供了可复现的实证基础。
衍生相关工作
围绕该数据集已衍生出一系列非洲劳动市场研究的经典工作,包括基于ILOSTAT多指标面板的就业弹性估计、教育错配与性别就业差距的分解分析,以及移民身份与劳动力市场融入的跨国比较研究。Electric Sheep Africa的元数据标准化框架亦催生了非洲开放数据目录的互操作性实践,推动后续研究者将本数据集与国际移民存量、非正规就业等关联数据集进行联合建模,拓展了非洲劳动经济学的实证边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务