遇见数据集

electricsheepeurope/europe-ilo-ees-tees-age-oc2-nb-employees-by-age-and-occupation-isco-level-2-thous

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲38个国家按年龄和职业(ISCO 2级)划分的雇员数据集,包含1992年至2025年的99,143个观测值,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖一个核心指标(EES_TEES_AGE_OC2_NB),并以表格形式提供详细分类和时间序列信息,适用于表格分类、回归和时间序列预测等任务。

This is an employee dataset covering 38 European countries, categorized by age and occupation (ISCO Level 2). It contains 99,143 observations from 1992 to 2025, sourced from the ILOSTAT database of the International Labour Organization (ILO). The dataset includes a core indicator (EES_TEES_AGE_OC2_NB), and provides detailed categorized and time-series information in tabular format, which is applicable for tasks such as table classification, regression and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-age-oc2-nb-employees-by-age-and-occupation-isco-level-2-thous 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=EES_TEES_AGE_OC2_NB)直接提取原始数据,并依据欧洲ISO3国家代码进行筛选,最终由Electric Sheep Europe重新打包发布。ILOSTAT本身依托各国劳动力调查、家庭收入调查、企业调查及行政记录等多元数据源,按照国际劳工统计学家会议(ICLS)的定义对微观数据进行标准化调和,确保指标的可比性与一致性。数据覆盖38个欧洲国家,时间跨度为1992年至2025年,共计99,143条观测值,以年度频率记录。
特点
该数据集聚焦于按年龄和职业(ISCO-08二位码)分类的雇员人数(以千计),提供细粒度的分类变量,包括年龄组(classif1)和职业类别(classif2),并附带来源标识、观测状态及注释信息,便于追溯数据质量与修订情况。其地理覆盖广泛,涵盖从西欧到东欧的38个国家,时间序列长达三十余年,适合开展跨国比较与长期趋势分析。数据以表格形式组织,包含22个字段,支持表格分类、回归及时间序列预测等任务,且以cc-by-4.0许可开放,兼顾学术研究与商业应用。
使用方法
研究人员可通过Hugging Face的datasets库便捷加载数据,使用load_dataset函数获取数据集并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的子集、针对单一指标提取时间序列并可视化、或将数据透视至国家×年份矩阵以观察跨地区演变。数据集亦支持直接接入机器学习流程,用于分类、回归或预测建模。使用时应留意观测状态标志与注释信息,以识别临时性数据或方法论断点,确保分析结论的稳健性。
背景与挑战
背景概述
在国际劳工统计领域,跨国、跨时期且按年龄与职业精细分类的就业数据长期稀缺。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库整合了各国劳动力调查与行政记录,为比较研究提供了基准。Electric Sheep Europe于2025年对ILOSTAT中EES_TEES_AGE_OC2_NB指标进行规范化重打包,覆盖38个欧洲国家、1992至2025年间99,143条观测,以CC-BY-4.0许可发布。该数据集聚焦雇员人数(千人),按ISCO-08二级职业分类与年龄组交叉呈现,为劳动力市场结构变迁、职业年龄构成及跨国比较研究提供了高粒度、可复现的数据基础,对劳动经济学、人口学及社会政策评估具有重要支撑价值。
当前挑战
该数据集所应对的领域问题在于,如何从异质性极强的各国劳动力调查中构建出可跨时空比较的年龄—职业就业矩阵,以揭示欧洲劳动力市场的结构性演变。构建过程中的挑战则体现为多源数据的协调与质量把控:各国调查口径、抽样设计及职业编码版本存在差异,ILO虽以国际标准加以调和,但序列断裂、方法修订及不可靠观测仍被标注为遗留问题;部分国家或年份存在缺失,且“最佳源”策略可能掩盖测量误差。此外,分类变量的非全覆盖导致稀疏单元,时间序列分析需谨慎处理断点与异常值,对预测建模构成实质性障碍。
常用场景
经典使用场景
在劳动经济学与人口统计学领域,剖析就业结构的年龄与职业维度始终是核心议题。该数据集以国际标准职业分类(ISCO)二级编码为骨架,按年龄组别系统记录欧洲38国1992至2025年间的雇员数量,为探究劳动力市场的年龄分层与职业分布提供了长时序、跨国家的标准化面板数据。经典场景之一在于刻画不同年龄群体在各类职业中的就业密度演变轨迹,从而揭示欧洲劳动力市场的结构性变迁。
解决学术问题
该数据集有效回应了劳动经济学中关于年龄—职业匹配、劳动力市场分割以及代际就业差异等长期争论。通过提供统一协调的跨国观测,研究者得以检验年龄组别在职业层级中的分布是否遵循相似模式,抑或受国别制度与政策影响而呈现异质性。其长时序特性亦有助于识别经济周期、结构性改革对特定年龄—职业组合就业规模的冲击效应,为跨国比较研究奠定实证基础。
衍生相关工作
基于该数据集的衍生研究多见于跨国劳动力市场比较、就业极化与职业结构转型等方向。学者利用其构建年龄—职业就业矩阵,结合自动化风险指标探究技术变革对就业的异质性影响;亦有研究将其与工资、教育等ILOSTAT指标联结,分析职业层级中的年龄工资溢价与技能错配。此外,部分工作以此数据为基准检验欧洲各国劳动力市场一体化进程中的结构趋同假说,推动了比较劳动经济学的实证进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务