遇见数据集

electricsheepasia/asia-ilo-gdp-2hrw-noc-nb-output-per-hour-worked-gdp-constant-2021-internati

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从2005年至2027年的1,118个观测值,涵盖1个独特的指标:每小时工作产出(以2021年不变价国际美元购买力平价计算)——国际劳工组织模型估计值。数据来源于国际劳工组织的ILOSTAT数据库,经过重新打包以便于机器学习使用。

This dataset contains 1,118 observations of labour productivity data across 49 Asia countries, spanning 2005–2027, covering 1 distinct indicator: Output per hour worked (GDP constant 2021 international $ at PPP) -- ILO modelled estimate. The data is sourced from the International Labour Organizations ILOSTAT database and repackaged for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-gdp-2hrw-noc-nb-output-per-hour-worked-gdp-constant-2021-internati 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦亚洲地区劳动力生产率这一核心议题。通过调用ILOSTAT REST API接口,直接获取标识符为GDP_2HRW_NOC_NB的指标数据,并依据亚洲ISO3国家代码进行地域筛选与整合。ILO依据国际劳工统计学家会议(ICLS)的定义标准,对原始调查微观数据进行系统化调和处理,并在数据集中通过source.label字段标注数据来源,确保每一条观测值均具备可追溯性。最终形成了涵盖1,118条观测、跨越2005年至2027年时间序列的亚洲劳动力生产率数据集。
特点
该数据集的核心特色在于其精密的亚洲聚焦与多维时间跨度。它囊括了49个亚洲国家,时间维度覆盖从2005年至2027年共计23个年份,为研究者提供了宏观而连贯的劳动力生产率演变图景。数据集中仅包含一个核心指标——'每工作小时产出(按2021年不变价国际购买力平价美元计算)',由ILO建模估算,确保了统计口径的一致性。每条记录均包含国家代码、来源标签、指标名称及观测值等结构化字段,便于进行跨国比较与时间序列分析。此外,数据来源标注为ILO建模估计,保证了数据的权威性与可比性。
使用方法
研究人员可通过HuggingFace的datasets库便捷加载此数据集,使用`load_dataset`函数即可将数据导入为Pandas DataFrame格式,便于后续分析。针对单国分析,可利用'ref_area'字段筛选特定国家,例如过滤印度尼西亚的观测数据。如需进行时间序列分析,可按'indicator'字段过滤核心指标后,依据'time'字段排序并可视化其趋势。数据透视功能支持将原始长格式数据转换为以国家为列、年份为行的矩阵结构,极大便利了面板数据分析与建模工作。该数据集为研究亚洲劳动力生产率动态、进行跨国比较及构建预测模型提供了标准化、易于处理的数据基础。
背景与挑战
背景概述
在全球劳动经济学研究领域,劳动生产率的跨国比较与动态追踪是解析经济增长、评估政策效果及预测可持续发展进程的核心议题。国际劳工组织(ILO)作为劳动统计的权威发布机构,其ILOSTAT数据库为全球学者与政策制定者提供了系统化的劳动指标。该数据集由Electric Sheep Asia于2025年重新打包整理,聚焦亚洲49个国家在2005至2027年间的每小时产出(以2021年不变价美元按购买力平价计算)这一关键指标。数据集源自ILO基于多国劳动力调查和行政记录的建模估计,不仅填补了亚洲区域高精度劳动生产率数据的空白,更通过统一标准化模式为社会科学领域的面板数据分析与时间序列预测提供了坚实支撑。其在数据可复现性、跨国家可比性及机器学习集成性方面的提升,显著推动了以数据驱动的亚洲经济发展研究。
当前挑战
该数据集所应对的领域问题主要源于劳动生产率研究中的多重障碍:首先,各国原始统计口径、调查周期与数据质量参差不齐,使得跨国家、跨年份的可比性难以保障;其次,传统数据获取过程依赖各国分散的发布渠道,时效性与整合效率较低,限制了宏观经济建模与政策模拟的实时性。在构建过程中,挑战则体现为对ILOSTAT庞大API接口的精准调用与海量异构数据的清洗重排,需确保亚洲区域国家代码的精确筛选和不同来源数据的一致化处理;同时,处理建模估计中的季节性、缺失值与最佳来源选择等数据质量难题,要求谨慎权衡精度的损失与覆盖度的完整。此外,数据集采用CC-BY-4.0许可协议,虽便利了学术与工业应用,但引用链路的明确性与不同贡献主体的归属管理仍需持续关注,以维护数据的透明与可信度。
常用场景
经典使用场景
该数据集收录了2005至2027年间亚洲49个国家的单位工时产出数据,以2021年不变价购买力平价计算,共包含1118条观测记录。其经典使用场景在于构建跨国劳动生产率的纵向面板数据,研究者可据此分析亚洲各国劳动生产率的时间演化轨迹、区域差异格局以及收敛性特征。通过将obs_value变量与ref_area、time字段结合,能够支撑固定效应模型、随机前沿分析等计量经济方法,探讨资本深化、制度质量或人口结构变迁对生产率增长的驱动机制。
实际应用
在实际应用中,该数据集为国际组织、政府部门及研究智库开展亚洲经济监测与政策评估提供了关键支撑。例如,可以基于时间序列数据预警特定国家或行业的劳动生产率增速放缓趋势,辅助设计提升人力资本配置效率的劳动力市场改革方案。跨国企业亦能利用该数据集进行亚洲各经济体的投资环境比较,识别具有成本竞争力及技术升级潜力的目标市场,从而优化供应链布局与资源配置决策。
衍生相关工作
围绕该数据集已衍生出多项经典研究工作。研究者利用其面板结构构建了劳动生产率收敛模型,检验亚洲国家是否存在俱乐部收敛现象;另有工作将其与教育年限、产业结构或基础设施投资等协变量结合,运用工具变量法或动态面板广义矩估计揭示生产率决定因素。此外,部分学者将该数据集与劳动力参与率、失业率等ILO其他指标联动,构建了亚洲体面劳动指数体系,为联合国可持续发展目标8的实现进展提供了量化评估工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务