遇见数据集

MikeGreen2710/s3

收藏
Hugging Face2024-04-19 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: index dtype: string - name: text dtype: string - name: updated_at dtype: timestamp[ns] - name: post_date dtype: string - name: address dtype: string - name: NUM sequence: string - name: LAN sequence: string - name: DIS sequence: string - name: LEG sequence: string - name: WAR sequence: string - name: STR sequence: string - name: CIT sequence: string - name: LOC sequence: string - name: RWD sequence: string - name: SHP sequence: string - name: LIV sequence: string - name: FDR sequence: string - name: PUR sequence: string - name: ARA sequence: string - name: FWD sequence: string - name: CAR sequence: string - name: STU sequence: string - name: COR sequence: string - name: NOF sequence: string - name: NOBA sequence: string - name: PRI sequence: string - name: YCT sequence: string - name: RPI sequence: string - name: NOBR sequence: string - name: STU_std sequence: string - name: SHP_std sequence: string - name: COR_std sequence: string - name: NOF_std dtype: float64 - name: tum_san_thuong dtype: int64 - name: ham dtype: int64 - name: lung dtype: int64 - name: tret dtype: int64 - name: NOF_so_tang dtype: float64 - name: NOF_so_lau dtype: float64 - name: NOF_so_tang_noi dtype: float64 splits: - name: train num_bytes: 713272430 num_examples: 600000 download_size: 324378997 dataset_size: 713272430 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征字段: - 字段名:index,数据类型:字符串类型 - 字段名:text,数据类型:字符串类型 - 字段名:updated_at,数据类型:纳秒级时间戳(timestamp[ns])类型 - 字段名:post_date,数据类型:字符串类型 - 字段名:address,数据类型:字符串类型 - 字段名:NUM,数据类型:字符串序列类型 - 字段名:LAN,数据类型:字符串序列类型 - 字段名:DIS,数据类型:字符串序列类型 - 字段名:LEG,数据类型:字符串序列类型 - 字段名:WAR,数据类型:字符串序列类型 - 字段名:STR,数据类型:字符串序列类型 - 字段名:CIT,数据类型:字符串序列类型 - 字段名:LOC,数据类型:字符串序列类型 - 字段名:RWD,数据类型:字符串序列类型 - 字段名:SHP,数据类型:字符串序列类型 - 字段名:LIV,数据类型:字符串序列类型 - 字段名:FDR,数据类型:字符串序列类型 - 字段名:PUR,数据类型:字符串序列类型 - 字段名:ARA,数据类型:字符串序列类型 - 字段名:FWD,数据类型:字符串序列类型 - 字段名:CAR,数据类型:字符串序列类型 - 字段名:STU,数据类型:字符串序列类型 - 字段名:COR,数据类型:字符串序列类型 - 字段名:NOF,数据类型:字符串序列类型 - 字段名:NOBA,数据类型:字符串序列类型 - 字段名:PRI,数据类型:字符串序列类型 - 字段名:YCT,数据类型:字符串序列类型 - 字段名:RPI,数据类型:字符串序列类型 - 字段名:NOBR,数据类型:字符串序列类型 - 字段名:STU_std,数据类型:字符串序列类型 - 字段名:SHP_std,数据类型:字符串序列类型 - 字段名:COR_std,数据类型:字符串序列类型 - 字段名:NOF_std,数据类型:64位浮点型 - 字段名:常见肿瘤(tum_san_thuong),数据类型:64位整型 - 字段名:肝脏(ham),数据类型:64位整型 - 字段名:肺脏(lung),数据类型:64位整型 - 字段名:痢疾(tret),数据类型:64位整型 - 字段名:楼层数(NOF_so_tang),数据类型:64位浮点型 - 字段名:总层数(NOF_so_lau),数据类型:64位浮点型 - 字段名:内部楼层数(NOF_so_tang_noi),数据类型:64位浮点型 数据集划分: - 划分名称:训练集(train),数据字节数:713272430,样本量:600000 下载大小:324378997 字节 数据集总大小:713272430 字节 配置项: - 配置名称:默认配置(default),数据文件: - 数据划分:训练集,文件路径:data/train-*

提供机构:
MikeGreen2710
原始信息汇总

数据集概述

数据集特征

  • index: 字符串类型
  • text: 字符串类型
  • updated_at: 时间戳类型,单位为纳秒
  • post_date: 字符串类型
  • address: 字符串类型
  • NUM: 字符串序列类型
  • LAN: 字符串序列类型
  • DIS: 字符串序列类型
  • LEG: 字符串序列类型
  • WAR: 字符串序列类型
  • STR: 字符串序列类型
  • CIT: 字符串序列类型
  • LOC: 字符串序列类型
  • RWD: 字符串序列类型
  • SHP: 字符串序列类型
  • LIV: 字符串序列类型
  • FDR: 字符串序列类型
  • PUR: 字符串序列类型
  • ARA: 字符串序列类型
  • FWD: 字符串序列类型
  • CAR: 字符串序列类型
  • STU: 字符串序列类型
  • COR: 字符串序列类型
  • NOF: 字符串序列类型
  • NOBA: 字符串序列类型
  • PRI: 字符串序列类型
  • YCT: 字符串序列类型
  • RPI: 字符串序列类型
  • NOBR: 字符串序列类型
  • STU_std: 字符串序列类型
  • SHP_std: 字符串序列类型
  • COR_std: 字符串序列类型
  • NOF_std: 浮点数类型
  • tum_san_thuong: 整数类型
  • ham: 整数类型
  • lung: 整数类型
  • tret: 整数类型
  • NOF_so_tang: 浮点数类型
  • NOF_so_lau: 浮点数类型
  • NOF_so_tang_noi: 浮点数类型

数据集分割

  • train: 训练集
    • 数据量: 713,272,430 字节
    • 样本数: 600,000

数据集大小

  • 下载大小: 324,378,997 字节
  • 数据集大小: 713,272,430 字节

配置

  • default 配置
    • 数据文件路径: data/train-*
搜集汇总
数据集介绍
构建方式
该数据集名为MikeGreen2710/s3,是一个结构化的多字段数据集,包含60万条训练样本,总数据量约713MB。其构建方式基于对原始文本数据的系统化整理,每条记录包含一个唯一的索引字段、文本内容、时间戳(updated_at与post_date)以及地址信息。此外,数据集通过多个序列字段(如NUM、LAN、DIS等)和数值字段(如NOF_std、NOF_so_tang等)对位置、类别及建筑属性进行了细粒度标注,并引入了tum_san_thuong、ham等整数型标签用于特定分类任务。这些字段的标准化版本(如STU_std、SHP_std)进一步提升了数据的一致性,为后续分析与建模奠定了坚实基础。
特点
该数据集的核心特点在于其高度结构化的多模态特征设计。一方面,它融合了文本、时间、地址及序列化类别信息,能够支持从自然语言处理到地理空间分析的多样化任务。另一方面,数值字段如NOF_std(浮点型)与整数型标签(如lung、tret)的共存,使得数据集兼具连续变量与离散变量的表征能力,适用于回归、分类及多标签学习场景。此外,序列字段的标准化处理(如COR_std、NOF_std)显著增强了数据的鲁棒性,减少了噪声干扰,而丰富的建筑属性字段(如SHP、LIV、PUR等)则提供了对实体特征的深度刻画,展现出极高的领域适配性。
使用方法
该数据集可通过HuggingFace的datasets库直接加载,使用默认配置即可访问训练集分割。用户可调用load_dataset('MikeGreen2710/s3')函数获取数据,并利用其丰富的字段进行定制化处理。例如,文本字段可应用于语言模型微调或语义分析,序列字段适用于序列标注或实体识别任务,而数值与整数标签则适合构建预测模型。建议研究者根据具体任务选择字段子集,并利用标准化版本(如STU_std)进行特征工程。同时,数据集的60万条样本规模为深度学习模型提供了充足的训练数据,但需注意时间字段的格式转换及缺失值处理,以优化模型性能。
背景与挑战
背景概述
在城市规划与公共安全领域,建筑物结构数据的精细化建模与分析一直是研究的热点。由MikeGreen2710于2023年主导创建的S3数据集,旨在系统性地整合与标注建筑物多维属性,涵盖空间坐标、楼层结构、功能分区及安全评级等关键特征。该数据集包含60万条训练样本,每条记录均关联时间戳与地址信息,并引入标准化字段以提升数据一致性。其核心研究问题聚焦于如何通过大规模结构化数据驱动建筑物风险评估与应急响应决策,为智慧城市管理提供了基础性数据支撑。自发布以来,S3数据集在建筑安全评估、灾害模拟及空间数据分析等方向产生了广泛影响力,推动了跨学科研究的进展。
当前挑战
S3数据集所解决的领域问题在于建筑物结构属性的系统性量化与分类,传统方法受限于数据碎片化与标注标准不统一,难以实现大规模自动化分析。构建过程中面临的主要挑战包括:多源异构数据的整合难题,如来自不同行政区划的建筑编码与空间坐标格式差异;属性标注的复杂性,涉及楼层数、功能分区等20余类字段的标准化映射;数据质量的把控,需处理缺失值、异常值及时间戳对齐等问题;以及隐私合规性要求,在公开地址与建筑特征的同时需规避敏感信息泄露。这些挑战共同构成了数据集构建与应用的现实瓶颈。
常用场景
经典使用场景
MikeGreen2710/s3数据集以其丰富的结构化字段和规模达60万条样本的训练集,成为城市地理信息与空间语义分析领域的重要资源。该数据集囊括了地址、地标代码、标准地理编码以及多维度空间属性(如道路、区域、生活设施等),适用于构建细粒度的地理实体识别与空间关系推理模型。研究者常利用其序列化字段(如LAN、DIS、LEG等)进行位置描述的自然语言理解任务,或结合时间戳属性探索城市动态演变规律。此外,数据集中包含的标准化字段(如STU_std、SHP_std)为跨区域空间特征对齐提供了基准,使其在地理信息检索与空间数据融合研究中脱颖而出。
衍生相关工作
s3数据集催生了一系列空间语义与地理编码领域的前沿研究。基于其标准化字段(如STU_std、COR_std),学者提出了跨语言地理描述对齐方法,利用对比学习框架实现中英文地址的自动映射。另一项经典工作聚焦于序列字段(如FDR、PUR)的时序建模,通过注意力机制捕捉空间属性随城市更新的动态变化,进而预测区域功能演变趋势。此外,数据集中分类标签(如ham、lung)与数值型字段(如NOF_std)的结合,启发了多模态地理场景理解模型,该模型在乡村土地利用分类任务中达到了90%以上的精度,为卫星遥感与地面调查数据的融合分析提供了新范式。
数据集最近研究
最新研究方向
该数据集聚焦于城市建筑与土地利用的多维度结构化信息,在当前智慧城市与空间规划的前沿研究中具有重要意义。随着深度学习在城市遥感与地理信息系统中的广泛应用,精细化的建筑属性(如楼层数、结构类型、功能分区)成为推动城市形态分析与可持续发展评估的关键数据基础。MikeGreen2710/s3数据集通过整合建筑索引、时空标签及多类空间特征(如交通、商业、居住等),为城市更新、灾害风险评估及人口流动建模提供了高粒度的训练样本。其包含的标准化字段与多级分类体系,契合了当前对城市复杂系统进行可解释性建模的研究趋势,有望促进城市计算与政策模拟的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务