遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-est-geo-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲22个国家从2000年至2025年的9,340个观测值,核心指标为“按性别、机构规模和城乡划分的就业人员实际平均每周工作时间”。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API获取,并过滤为亚洲国家。数据集涵盖了就业人员的工作时间信息,并按性别(总计、男性、女性)、机构规模和城乡区域进行细分。数据经过ILO harmonization处理,使用国际劳工统计学家会议(ICLS)的定义,确保一致性。数据质量方面,为年度频率,当同一国家×年份有多个数据源时,使用ILO选择的“最佳来源”。数据集以表格形式存储,包含国家代码、年份、观测值、数据来源、分类变量等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 9,340 observations across 22 Asia countries from 2000 to 2025, with the core indicator being Mean weekly hours actually worked per employed person by sex, establishment size and rural / urban areas. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via its REST API and filtered to Asia countries. It provides information on working hours for employed persons, disaggregated by sex (total, male, female), establishment size, and rural/urban areas. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions for consistency. In terms of data quality, it is annual frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. The dataset is stored in tabular format with columns such as country code, year, observed value, data source, and classification variables, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-est-geo-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集由Electric Sheep Asia团队从ILOSTAT官方REST API直接获取,涵盖了亚洲22个国家和地区2000年至2025年间关于“按性别、企业规模和城乡划分的就业人员实际周平均工作小时数”的9,340条观测记录。原始数据源自国际劳工组织(ILO)对各国劳动力调查、家庭收入调查及行政记录等微数据的统一整合与标准化处理,确保了跨国家与跨时期数据的可比性与统计口径的一致性。数据集采用Parquet格式存储,并通过HuggingFace Datasets库发布,用户可通过一行代码轻松加载。
特点
该数据集以精细的维度划分为显著特色,不仅按性别(男性、女性、总计)进行分层,还结合了企业规模(如总规模、微型、小型等分类)与城乡地域(如全国、城乡区域)等交叉分类变量,从而提供了多层次的劳动工时画像。其时间跨度长达25年,覆盖了东南亚、南亚、中亚及西亚等多个亚文化区域,在区域比较研究中具有极高的价值。此外,每条观测均附带了数据来源、观测状态及注释标记,为数据质量评估与使用场景的甄别提供了透明依据。
使用方法
用户可通过HuggingFace的`datasets`库直接加载该数据集,将其转换为Pandas DataFrame后即可进行灵活的探索与分析。典型操作包括按国家代码筛选单一国家的时间序列数据,利用`pivot_table`方法将数据重塑为以年份为行、国家为列的矩阵,便于进行多国横向对比或面板回归分析。对于单一的“实际周平均工作小时数”指标,可对`obs_value`字段直接绘图以观察其随时间变化的趋势。该数据集尤其适合从事劳动经济学、国际发展或区域政策研究的学者进行统计建模与可视化工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于其ILOSTAT统计数据库中创建,并由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲22个国家2000至2025年间按性别、企业规模及城乡划分的就业人员平均每周实际工作小时数。数据集涵盖9340条观测记录,旨在填补亚洲区域劳动市场中关于工时结构化比较的系统性空白,为发展经济学、劳动政策及可持续发展目标(SDG)中体面工作指标的量化评估提供高粒度数据支撑。作为ILO这一全球劳动统计权威机构的数据衍生品,其促进了跨国产学研界对亚洲工时变异的严谨实证分析。
当前挑战
领域层面,主要致力于解决亚洲劳动统计中多国异构调查数据在工时指标准确性、可比性及细分维度(如性别与城乡差异)上的标准化与统一难题。构建过程中,面临多重挑战:第一,通过ILO REST API从海量原始调查数据中筛选特定亚洲国家的子集,需处理来源标识(source.label)的复杂性以确保数据可追溯性;第二,对年度频率数据及ILO指定的“最佳来源”进行整合,需要严格过滤多源冲突并保留细分分类变量(sex、classif1、classif2)的完整性;第三,观测状态标记(如“不可靠”)的保留与标准化,要求在保证数据保真度的同时提供清晰的质量警示,这对后续建模的稳健性提出了考验。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域中,该数据集为研究者提供了衡量亚洲各国劳动者实际工作强度的标准化指标——即按性别、企业规模及城乡地域细分的周均实际工作小时数。凭借其跨越2000至2025年、覆盖22个亚洲国家的9,340条观测记录,数据集天然适用于构建面板数据模型,用以剖析工作时间随经济发展阶段、产业结构变迁及劳动力市场政策调整的演变规律。例如,学者可借此验证工作时间的收敛假说,或考察女性劳动参与率提升对周均工时的影响路径。
实际应用
在实际应用层面,该数据集为政府劳动部门与国际组织提供了一套动态的工时监测工具,支持基于证据的政策评估与调整。例如,通过追踪特定国家或地区内不同企业规模下的周均工时变化,政策制定者可精准识别用工过度或就业不足的行业及群体,进而设计差异化的劳动保护措施。此外,跨国企业的人力资源规划亦可借鉴此类数据,以了解目标市场劳动强度的行业基准,优化工作制度安排,实现生产效率与员工福祉的平衡。
衍生相关工作
基于此数据集已催生出若干具有启发性的衍生工作。研究者利用其多维分类架构,拓展了关于非正规就业与工时关系的实证分析,通过建立不同企业规模与城乡属性下的工时异质性模型,揭示了亚洲经济体内部隐蔽的劳动力市场分割现象。另有工作将其与人均GDP、教育水平等宏观指标关联,构建了预测劳动力参与率与工作强度的综合计量框架。这些衍生探索不仅验证了原始数据的可靠性,更将其分析半径从单纯的劳动统计延伸至发展经济学、社会分层与公共政策的交叉对话场域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务