遇见数据集

US-Child-Care-Providers

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

该数据集名为“美国儿童保育提供者”,旨在收集美国各州持照儿童保育服务提供者的公开数据,整合来自各州政府数据库的信息,为研究人员、开发者和公众提供统一访问入口。数据集按州组织,包含阿拉巴马州、亚利桑那州、阿肯色州、加利福尼亚州、科罗拉多州、佛罗里达州、佐治亚州、夏威夷州、伊利诺伊州、密歇根州、明尼苏达州、蒙大拿州、内华达州、新泽西州、新墨西哥州、纽约州、北卡罗来纳州、北达科他州、俄亥俄州、宾夕法尼亚州、罗得岛州、南卡罗来纳州、德克萨斯州、犹他州、弗吉尼亚州、华盛顿州和西弗吉尼亚州等多个州的配置,每个州对应一个独立的JSON数据文件。数据规模估计在10万到100万条记录之间,主要适用于儿童保育、公共政策分析、地理信息研究和社会服务相关任务。需要注意的是,数据集目前专注于持照提供者;地理位置数据主要通过美国人口普查局API获取,对于地址信息不全的提供者(尤其是家庭托儿所)可能不准确;数据标准化工作仍在进行中,结构可能发生变化;数据集计划每周更新。

This dataset, titled "U.S. Child Care Providers", aims to collect publicly available data on licensed child care service providers across U.S. states, integrate information from state government databases, and provide a unified access portal for researchers, developers, and the general public. The dataset is organized by state, covering multiple U.S. states including Alabama, Arizona, Arkansas, California, Colorado, Florida, Georgia, Hawaii, Illinois, Michigan, Minnesota, Montana, Nevada, New Jersey, New Mexico, New York, North Carolina, North Dakota, Ohio, Pennsylvania, Rhode Island, South Carolina, Texas, Utah, Virginia, Washington, and West Virginia, with an independent JSON data file corresponding to each state. The dataset is estimated to contain between 100,000 and 1,000,000 records, and is primarily applicable to tasks related to child care, public policy analysis, geographic information research, and social services. It should be noted that the dataset currently focuses solely on licensed providers; geographic location data is primarily obtained via the U.S. Census Bureau API, and may be inaccurate for providers with incomplete address information (especially family child care homes); data standardization work is still underway, and the dataset's structure may change; the dataset is scheduled for weekly updates.

创建时间:
2026-07-04
原始信息汇总

数据集名称

US Child Care Providers

数据集概览

该数据集汇集了美国各州持证托儿服务提供者的许可数据,旨在通过整合各州的公开数据,为研究人员、开发者及公众提供更易用的信息。

数据集结构

  • 配置:每个美国州作为一个独立的数据集配置(config),共包含28个州的配置,例如 alabamaalaskacaliforniatexas 等。
  • 数据文件:每个配置对应一个JSON文件,例如 alabama.jsoncalifornia.json
  • 数据量:规模在10万至100万条记录之间(100K < n < 1M)。
  • 许可协议:Creative Commons Attribution 4.0 International (CC-BY-4.0)。

数据内容

  • 聚焦持证服务提供者:主要来源于各州官方数据库,覆盖持证的托儿机构。
  • 地理信息:许多州的数据通过美国人口普查局API获取地理位置信息,但若地址信息不完整(例如家庭式托儿所),坐标数据可能不准确或缺失。
  • 数据规范化仍在进行中,字段结构可能随后续处理而调整。

数据来源与更新

  • 数据来源:各州公开数据,详细来源列表见数据集仓库中的 sources.md 文件(https://huggingface.co/datasets/ryan-koch/US-Child-Care-Providers/blob/main/SOURCES.md)。
  • 更新频率:计划每周更新,通常在周末运行爬虫,周一上传更新。
  • 爬虫仓库:数据采集脚本开源于 https://github.com/Ryan-Koch/child-care-provider-scraper

使用方式

  • 在数据集查看器中选择特定州,或通过 load_dataset("<repo>", "alabama") 等方式加载对应配置。

已知局限

  • 仅包含持证服务提供者数据。
  • 部分州未提供家庭式托儿所的完整地址,可能导致其地理坐标缺失或不完整。
  • 数据字段结构尚未最终确定。
搜集汇总
数据集介绍
US-Child-Care-Providers 数据集图片
构建方式
该数据集聚焦于美国各州持证儿童保育机构的信息整合,通过公开的州级政府数据库进行系统性采集。数据收集工作依托于一套开源爬虫工具,该工具针对每个州独立运行,并从各州公开的许可机构名录中提取结构化信息。为了确保数据的实用性和一致性,项目设计了一套数据转换流程,对原始字段进行规范化处理,并将各州数据以独立配置(config)形式存储,方便研究者按需加载特定州的子集。
特点
数据集覆盖美国29个州,每个州的数据被封装为独立的配置项,便于分区调用。数据规模介于十万至百万条记录之间,主要包含持证保育机构的详细信息,如地址、坐标等地理空间数据。地理坐标信息通过美国人口普查局API进行补充,但由于部分州对家庭型保育机构的地址披露不完全,可能导致此类机构的地理覆盖存在缺失。数据集遵循CC-BY-4.0许可协议,支持开放研究与商业应用。
使用方法
用户可通过HuggingFace Datasets库按州名加载数据,例如使用`load_dataset('ryan-koch/US-Child-Care-Providers', 'alabama')`获取阿拉巴马州的子集。数据集计划每周更新一次,更新通常在周一完成。由于数据规范化工作仍在进行中,字段结构可能随时间演变。用户若发现数据问题,可通过爬虫仓库的GitHub Issues功能进行反馈。对于地理信息不完整的州,建议在分析家庭型保育机构时审慎处理坐标缺失的情况。
背景与挑战
背景概述
该数据集名为US-Child-Care-Providers,由Ryan Koch在近期创建并维护,旨在系统性地收集美国各州注册儿童保育提供者的许可数据。数据集覆盖阿拉巴马至西弗吉尼亚等数十个州,每个州作为独立配置供用户访问,数据来源于各州公开的官方许可数据库。核心研究问题在于解决儿童保育资源分布与质量评估中的数据碎片化问题,通过整合分散的政府信息,为教育政策分析、社会服务优化及家庭决策提供统一且结构化的数据基础。鉴于儿童早期教育对人口发展的重要性,该数据集有望推动相关领域的研究,提升数据驱动的公共治理能力,并促进跨州比较分析的标准化。
当前挑战
当前围绕该数据集的挑战主要体现在两个层面。领域层面,儿童保育研究长期受限于各州数据格式不统一、字段定义差异大及更新的滞后性,系统性的整合需要协调多样化的法律与行政标准,以可靠地支撑关于服务覆盖率、质量指标及区域不均等问题的实证分析。构建过程层面,数据爬取与规范化工作仍在早期阶段,面临地址信息不足导致的地理编码不准确(如家庭式保育机构因隐私保护而缺失完整地址)、各州数据形状不一致以及跨州字段映射的复杂性,这些因素使得数据质量的稳定性、覆盖的完整性及更新频次成为持续需要克服的难点。
常用场景
经典使用场景
在儿童保育与公共政策研究领域,US-Child-Care-Providers数据集被广泛应用于分析美国各州持证儿童保育机构的分布格局与运营特征。研究者常借助该数据集探讨保育资源的空间可达性,例如结合地理信息系统(GIS)技术,评估不同社区中保育供给的密度与质量差异。此外,该数据还可用于构建预测模型,揭示影响保育机构许可状态的关键因素,如区域经济水平、人口结构或政策干预的影响。通过跨州比较,学者能够识别出保育服务配置中的潜在不均衡现象,为优化资源配置提供数据支撑。
解决学术问题
该数据集有效回应了儿童保育研究中长期存在的州际数据碎片化与标准化不足的难题。以往由于各州独立监管,导致研究者难以获得统一格式的全美保育机构信息,限制了宏观比较分析的可能性。US-Child-Care-Providers通过整合公开的政府数据库,建立了一个跨州的标准化数据集合,使学术界能够系统性地探究保育供给与家庭需求之间的匹配程度、保育质量的社会经济梯度,以及政策法规对保育市场动态的影响。这一整合极大促进了儿童福祉、劳动经济学及城市研究等领域的实证分析深度。
衍生相关工作
围绕这一数据集,已衍生出多项具有影响力的研究工作与工具开发。在学术层面,研究者利用其构建了儿童保育供给与母亲劳动参与率之间的关联模型,揭示了保育可达性对女性就业决策的调节作用。技术社区则基于该数据开发了交互式可视化仪表盘,如州际保育资源对比地图,用于公众教育与政策倡导。此外,还存在将本数据集与人口普查、健康调查等多源数据融合的尝试,以深入剖析保育环境对儿童早期发展的长期影响,推动了跨学科的数据驱动研究范式发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务