遇见数据集

electricsheepeurope/europe-ilo-emp-publ-sex-ocu-nb-public-sector-employment-by-sex-and-occupation-tho

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含14,417个观测值,记录了14个欧洲国家从1993年至2025年按性别和职业划分的公共部门就业数据(以千计)。核心指标为EMP_PUBL_SEX_OCU_NB,即公共部门就业按性别和职业分类的统计。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至欧洲国家,涵盖了国家代码、年份、性别分类(总计、男性、女性)、观测值及数据来源注释等字段。数据集以表格形式呈现,适用于表格分类、回归或时间序列预测任务,并遵循CC-BY-4.0许可协议。

This dataset contains 14,417 observations of public sector employment data across 14 Europe countries, spanning 1993–2025, with one distinct indicator: EMP_PUBL_SEX_OCU_NB (Public sector employment by sex and occupation in thousands). Sourced from the ILOSTAT database of the International Labour Organization (ILO), it includes fields such as country codes, years, sex disaggregation (total, male, female), observed values, and source annotations. The data is provided in tabular format for use in tabular classification, regression, or time-series forecasting tasks, under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-publ-sex-ocu-nb-public-sector-employment-by-sex-and-occupation-tho 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取标识为EMP_PUBL_SEX_OCU_NB的原始指标数据,并依据欧洲ISO3国家代码进行地域筛选。数据经由ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行规范化处理,将各国民调微观数据统一整合为年度观测值,最终包装为适用于机器学习的Parquet格式,共计涵盖14个欧洲国家、1993年至2025年间14417条记录。
特点
数据集以公共部门就业为核心,按性别(男性、女性、合计)与职业技能水平进行细粒度分层,每条记录均包含观测值及状态标记。数据来源清晰标注(如劳动力调查),并附有方法论变更、数据可靠性等质量注解。时间跨度长达32年,兼顾国家与年度间的可比性,且以单一指标EMP_PUBL_SEX_OCU_NB聚焦,避免了多指标混杂带来的分析复杂性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载数据,并转换为Pandas DataFrame进行操作。支持按国家代码筛选单一国家的时间序列,或基于指标列排序后绘制观测值随时间变化的趋势图。对于跨国的面板分析,可借助pivot_table将数据重塑为国家×年份的矩阵,便于后续回归或分类建模。整个数据集以cc-by-4.0许可发布,使用时需同时引用原始ILO数据源与Electric Sheep Europe的再包装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Europe重新打包后托管于HuggingFace平台,聚焦欧洲14个国家1993至2025年间公共部门就业人口按性别与职业分类的统计观测值。共包含14,417条记录,数据源自ILOSTAT这一全球劳动统计权威数据库,其整合了各国劳动力调查、行政记录等多源资料,并依据国际劳动统计学家会议(ICLS)定义进行标准化处理。核心研究问题在于追踪公共部门劳动力结构的长期演变,揭示不同性别与职业类别下的就业分布格局,为欧洲劳动力市场分析、政策评估及国际比较提供关键依据。该数据集因覆盖时间长、国别范围广且指标高度细化,对劳动经济学、社会保障研究及可持续发展目标(SDG)监测领域具有重要参考价值。
当前挑战
领域问题方面,该数据集主要应对公共部门就业结构性分析中的数据碎片化与可比性不足挑战。由于各国统计标准、调查频率与职业分类体系存在差异,跨国家、跨时间段的统一比较极为困难,同时性别维度的细化分析常受限于样本量不足。构建过程中的挑战则包括:从多源异构的原始调查数据中提取并统一清洗就业指标,需处理缺失值、连续性断点(如方法论修订标注)及来源标记的兼容性;对14国数据按ILO最佳来源优先原则进行冲突消解,确保国别间数据在1993–2025年跨度内的时间序列连续性;以及将复杂维表(如职业技能等级分类)与观测值规范对齐,最终封装为机器学习就绪的表格格式,保留原始统计元数据并支撑高效查询。
常用场景
经典使用场景
在劳动经济学与公共政策研究的交汇地带,该数据集为剖析欧洲公共部门就业结构提供了坚实的数据基座。研究者常利用其按性别与职业类别交叉细分的年度观测值,构建面板数据模型,以追踪不同国家公共部门劳动力规模的演变轨迹。其应用涵盖了对公共就业政策效应的量化评估,例如分析财政紧缩措施对男女雇员比例的差异化冲击,或是探究技能层级分布与公共服务供给质量之间的关联。数据覆盖1993至2025年的长周期,使得长期趋势分析与跨周期比较成为可能。
实际应用
在实际应用领域,该数据集为跨国政策评估与人力资源规划提供了可操作的量化工具。欧盟委员会及各成员国劳动部门可借此监控公共部门就业的性别平衡状态,为制定促进女性职业发展的专项政策提供证据支持。国际组织与非政府机构也能基于各国公共雇员的职业分布数据,比较不同治理模式下的公共服务效率。此外,数据的高频更新特性使其能够服务于短期劳动市场预警和结构性改革成效的即时追踪。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于两大方向。其一是构建欧洲公共部门就业的预测模型,利用时间序列特征如季节性与趋势分量,结合机器学习方法推测未来劳动力需求,为财政预算与人力配置提供前瞻依据。其二是将其与其他ILOSTAT数据源或宏观经济指标(如GDP、教育支出)进行融合,开展跨领域的因果推断研究,例如分析公共部门薪酬溢价对私营部门人才流失的诱发效应。这些衍生工作持续拓展着数据在量化社会学与公共经济学中的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务