遇见数据集

Major-TOM/Core-AlphaEarth-Embeddings

收藏
Hugging Face2025-08-22 更新2025-08-09 收录
官方服务:

资源简介:

这是一个样本数据集,包含71,426个覆盖的网格单元,每个单元包含1,068x1,068个64维的嵌入。总共覆盖了超过800万平方公里的区域,包含了81亿个嵌入。

This is a sample dataset with 71,426 grid cells covered, each containing 1,068 by 1,068 embeddings of dimensionality 64. It covers an area of over 8 million square kilometers, containing a total of 81 billion embeddings.

提供机构:
Major-TOM
搜集汇总
数据集介绍
Major-TOM/Core-AlphaEarth-Embeddings 数据集图片
构建方式
在遥感与地理空间分析领域,大规模、高质量的嵌入表示对于地表覆盖分类与环境监测至关重要。Major-TOM/Core-AlphaEarth-Embeddings数据集源自Google DeepMind的AlphaEarth项目,由Major TOM项目团队精心构建。该数据集通过将AlphaEarth模型生成的64维嵌入向量与Major TOM网格系统相结合,实现了对全球地表信息的结构化存储。具体而言,每个网格单元对应一个1,068×1,068的嵌入阵列,平均嵌入向量被提取并存储为元数据,同时保留了地理坐标、UTM投影信息及缩略图等辅助字段,从而构建了一个兼具空间精度与语义丰富度的原型数据集。
特点
该数据集的核心特点在于其规模与精度的平衡。总计62,489个网格单元覆盖超过700万平方公里,包含约710亿个独立嵌入向量,为大规模地球观测研究提供了前所未有的数据基础。每个样本均包含64维嵌入向量、地理坐标、UTM投影足迹及经过JPEG压缩的三维主成分分析缩略图,支持多模态分析。此外,数据集的元数据以Parquet格式存储,便于高效读取;而嵌入数据则以GeoTIFF格式组织,兼容标准遥感处理流程。这种设计既保证了数据的可扩展性,又降低了实验与原型开发的准入门槛。
使用方法
使用该数据集时,研究者可通过Python环境轻松访问。首先,利用fsspec与pyarrow库从HuggingFace仓库读取元数据文件(metadata.parquet),按需筛选网格单元标识符与子目录字段。随后,通过rasterio库以/vsicurl虚拟文件系统方式直接打开GeoTIFF格式的嵌入文件,获取完整的嵌入阵列。该流程无需本地下载全部数据,支持按索引或地理范围进行流式访问,尤其适合与Major TOM项目其他数据集联合使用,用于训练下游模型或进行空间模式分析。
背景与挑战
背景概述
地球观测领域正经历着从传统像素级分析向语义化、可泛化特征表征的深刻变革,大规模嵌入表征数据集的构建成为推动遥感智能发展的关键基石。Major-TOM/Core-AlphaEarth-Embeddings 数据集由 Asterisk Labs 的 Mikolaj Czerkawski 于 2024 至 2025 年间主导创建,依托 Google DeepMind 的 AlphaEarth 基础模型,旨在提供覆盖全球的高密度地理空间嵌入向量。该数据集将 AlphaEarth 生成的 64 维嵌入特征与 Major TOM 网格系统有机结合,涵盖约 62,489 个网格单元,每个单元包含 1,068×1,068 个嵌入点,总计超过 710 亿个独立嵌入,覆盖面积逾 700 万平方公里。其核心研究问题在于如何将深度学习模型提取的连续语义特征与地理空间离散网格高效映射,从而支撑土地覆盖分类、环境监测等下游任务的精准实施。作为连接基础模型与地理空间分析的枢纽,该数据集为全球尺度下的遥感智能计算提供了可复现、可扩展的数据基础设施,显著推动了嵌入表征在地球科学中的实际应用。
当前挑战
该数据集在构建与应用中面临多重挑战。首先,从领域问题层面,地球观测场景下嵌入表征需同时应对地理空间异质性与时间动态性,单一模型生成的 64 维嵌入向量是否足以捕获森林、水体、城市等不同地物的判别性特征,并在跨区域、跨时相场景中保持鲁棒性,是亟待验证的核心难题。其次,构建过程中需解决超大规模数据的高效存储与组织问题,数据集包含 710 亿个嵌入点,如何通过 Major TOM 网格系统实现无损索引与快速检索,同时平衡元数据(如地理变换矩阵、投影坐标系)与影像数据的耦合关系,对数据管道设计提出了严苛要求。此外,嵌入向量与原始遥感影像之间的可解释性鸿沟,使得用户难以直观评估特征质量,需借助 PCA 降维缩略图等间接手段进行可视化验证,这增加了数据质量控制的复杂性。最后,作为原型数据集,其覆盖范围有限,未来向全球扩展时需应对计算资源消耗与数据一致性维护的显著挑战。
常用场景
经典使用场景
Major-TOM/Core-AlphaEarth-Embeddings 数据集作为地球观测与遥感领域的重要资源,其核心应用场景在于为大规模地理空间分析提供预训练的嵌入表示。该数据集包含了由Google DeepMind的AlphaEarth模型生成的64维平均嵌入向量,覆盖超过700万平方公里的区域,共计约710亿个独立嵌入。研究人员常利用这些高密度、全局分布的嵌入特征,结合Major TOM项目中的其他数据集,进行土地覆盖分类、环境变化监测以及多模态遥感信息的融合分析。其原型性质特别适合于算法原型设计与实验验证,为地理空间机器学习模型的快速迭代提供了标准化基准。
实际应用
在实际应用中,该数据集为自然资源管理、农业监测和灾害响应等场景提供了高效的数据基础。例如,通过嵌入特征与少量地面真值结合,可快速生成高分辨率土地利用图,辅助国土规划部门优化资源配置。在农业领域,基于嵌入的时序分析能够早期识别作物胁迫或产量异常,支持精准农业决策。此外,其与Major TOM网格系统的集成,使得城市热岛效应分析、森林砍伐追踪等任务能够以统一的地理框架进行批量处理,降低了遥感数据工程的门槛,加速了地球观测成果向实际政策的转化。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作。其核心依托的AlphaEarth Foundations论文(arXiv:2507.22291)首次提出了嵌入场模型,为全局映射任务确立了新标杆。同时,Major TOM项目本身(IGARSS 2024)构建了可扩展的遥感数据架构,而后续研究如《Global and Dense Embeddings of Earth: Major TOM Floating in the Latent Space》(arXiv:2412.05600)则深入探讨了稠密嵌入在地理空间分析中的特性。这些工作共同推动了自监督学习与地球观测的交叉领域发展,孕育出如跨模态嵌入对齐、时空嵌入推理等前沿方向,为下一代地理智能系统奠定了理论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务