遇见数据集

MahtabBg/MIMIC

收藏
Hugging Face2023-08-09 更新2024-03-04 收录
官方服务:

资源简介:

MIMIC数据集是一个为视觉社区设计的预训练数据集,包含310万对图像,这些图像来自多样化的视频、3D扫描、街景等。数据集的特点是无需标注,仅需图像本身,且可以通过快速扩展的数据整理策略进行扩展。数据集由华盛顿大学和艾伦人工智能研究所的研究团队创建,并由亚马逊科技公司资助。数据集中的实例均为图像,主题包括街景、物体、室内场景和Mannequin挑战中的静止人物。每对图像至少有50%的共视性。数据集是自包含的,不包含任何标签,但提供了每对图像的匹配补丁字典。数据集的收集过程涉及从公开许可的数据集中提取图像,并通过SIFT关键点检测和单应性变换来确定图像对的共视性。数据集已发布,并通过GitHub进行分发,遵循特定的许可协议。

MIMIC数据集是一个为视觉社区设计的预训练数据集,包含310万对图像,这些图像来自多样化的视频、3D扫描、街景等。数据集的特点是无需标注,仅需图像本身,且可以通过快速扩展的数据整理策略进行扩展。数据集由华盛顿大学和艾伦人工智能研究所的研究团队创建,并由亚马逊科技公司资助。数据集中的实例均为图像,主题包括街景、物体、室内场景和Mannequin挑战中的静止人物。每对图像至少有50%的共视性。数据集是自包含的,不包含任何标签,但提供了每对图像的匹配补丁字典。数据集的收集过程涉及从公开许可的数据集中提取图像,并通过SIFT关键点检测和单应性变换来确定图像对的共视性。数据集已发布,并通过GitHub进行分发,遵循特定的许可协议。

提供机构:
MahtabBg
原始信息汇总

数据集概述

数据集名称

MIMIC

创建目的

该数据集旨在为下游密集预测任务提供预训练数据,包含3.1M对来自多样视频、3D扫描、街景等的图像。

创建者

由Kalyani Marathe1,2∗, Mahtab Bigverdi1,2∗, Nishat Khan1, Tuhin Kundu, Aniruddha Kembhavi2, Linda G. Shapiro1, Ranjay Krishna1,2创建,代表华盛顿大学和Allen Institute for Artificial Intelligence。

资金来源

由Amazon Technologies, Inc.资助,作为Amazon-UW Science HUB的一部分。

数据组成

  • 实例类型:所有实例为图像。
  • 实例数量:共3.1百万对图像(总计6.2百万张图像)。
  • 数据来源:样本来自公开授权的数据集。
  • 数据内容:图像大小调整为224x224。
  • 标签信息:无直接标签,但提供匹配的图像块字典。

收集过程

  • 数据获取:图像从公开授权的数据集中提取,通过算法确定图像对的共同可见性。
  • 收集时间:使用的公共图像数据集的拍摄时间跨度至2022年。

预处理/清洗/标注

  • 处理步骤:使用sift关键点检测和单应性变换定义图像对之间的共同可见性,并调整图像大小至224x224。
  • 软件工具:预处理算法可在项目GitHub仓库中找到。

数据分布

  • 分布方式:通过GitHub分发。
  • 许可信息:数据集使用许可协议和使用条款可在GitHub仓库中查看。

维护

  • 维护者:数据集将由HuggingFace托管。
  • 联系方式:可通过电子邮件kmarathe@cs.washington.edu联系。
  • 更新计划:可能添加新的图像对,不移除现有数据。

数据集详细信息

实例描述

  • 图像内容:包括街道位置、物体、室内场景和Mannequin挑战中的人物。
  • 图像关系:每对图像至少有50%的共同可见性。

数据完整性

  • 数据样本:数据集包含所有授权的实例。
  • 错误与噪声:由于近似匹配算法,匹配的图像块和重叠测量可能存在噪声,但对预训练影响不大。

数据敏感性

  • 隐私问题:数据集可能揭示种族信息,但所有图像来自公开的Mannequin数据集。
  • 数据影响:使用公开数据集,对个人影响有限。

数据使用限制

  • 使用建议:无特定使用限制。
  • 贡献机制:用户可使用提供的算法从不同数据源生成具有所需共同可见性的图像对。
搜集汇总
数据集介绍
MahtabBg/MIMIC 数据集图片
构建方式
在计算机视觉领域,大规模无标注预训练数据集的构建一直是推动密集预测任务发展的关键瓶颈。MIMIC数据集基于一种无需人工标注的数据筛选策略,从公开许可的视频、三维扫描及街景等多元数据源中提取图像对。具体而言,研究团队利用SIFT关键点检测与单应性变换技术,计算图像对之间的共视度指标,仅保留共视度在50%至75%之间的图像对,从而确保每对图像具有足够的空间对应关系。所有图像最终被统一缩放至224×224像素分辨率,形成包含310万对图像(共计620万张图像)的预训练数据集,为下游任务提供了丰富的视觉对应关系基础。
特点
该数据集的核心特色在于其大规模、无标注且高度结构化的图像对组织形式。每对图像均源自同一场景或物体,并经过严格的共视度筛选,确保了图像间存在可靠的几何对应关系。数据集还提供了匹配图像块的字典,为后续的密集对应学习任务提供了监督信号。此外,数据来源涵盖街景、室内场景、物体以及静态人物(如人体冻结挑战)等多种场景,展现了广泛的视觉多样性。构建策略的可扩展性也是其突出优势,无需额外标注即可快速从公开数据集中生成新样本,为视觉预训练研究提供了高效的数据支撑。
使用方法
该数据集专为视觉预训练任务设计,尤其适用于密集预测场景,如光流估计、深度估计、语义匹配等。用户可直接下载图像对及其对应的匹配块字典,用于训练自监督学习模型。数据集以CSV文件记录所有图像路径及元数据(如来源数据集和场景标识),便于按需筛选或扩展。研究团队还开源了生成图像对的算法代码,允许用户基于自有数据源、按自定义共视度阈值构建新样本。使用时需注意,匹配块和共视度测量因近似算法存在一定噪声,但在大规模预训练场景下,这种噪声水平是可接受的,且有助于提升模型的鲁棒性。
背景与挑战
背景概述
在计算机视觉领域,密集预测任务(如深度估计、语义分割和光流计算)对大规模、多样化的训练数据有着迫切需求。然而,现有数据集往往局限于特定场景或依赖昂贵的人工标注,限制了模型的泛化能力和可扩展性。为应对这一挑战,华盛顿大学与艾伦人工智能研究所的研究人员于2023年联合发布了MIMIC数据集。该数据集由Kalyani Marathe、Mahtab Bigverdi等学者主导,旨在为无监督预训练提供海量图像对资源。MIMIC包含310万对图像,来源涵盖视频序列、三维扫描、街景及静态场景,通过创新的数据策展策略实现快速扩展,无需任何人工标注。其核心研究问题在于:如何利用图像间的共视关系(至少50%重叠)构建高质量预训练数据,以提升下游任务的表现。自发布以来,该数据集因其规模与多样性,已成为推动密集预测模型发展的关键基础资源。
当前挑战
MIMIC数据集面临的核心挑战首先在于所解决的领域问题:密集预测任务要求模型从图像中提取精细的空间结构信息,而传统图像分类数据集无法提供足够的几何与场景变化。MIMIC通过多源图像对弥补了这一空白,但匹配补丁与重叠度量依赖近似算法(如SIFT关键点检测和单应性变换),存在噪声,可能影响预训练质量。此外,构建过程中面临显著技术挑战:从视频、三维扫描等异构数据源中提取图像对时,需精确控制共视比例(50%至75%),这涉及复杂的空间对齐与筛选流程。数据集未对人物面部进行模糊处理,虽源自公开数据集,但可能引发隐私与伦理争议。同时,数据来源的多样性(如Mannequin挑战场景)虽丰富了内容,但也引入了非自然姿态和光照变化,增加了模型鲁棒性训练的难度。
常用场景
经典使用场景
MIMIC数据集的核心应用场景在于为视觉领域的密集预测任务提供大规模无监督预训练数据。该数据集包含310万对图像,这些图像对来自视频、3D扫描、街景等多种来源,且每对图像之间具有至少50%的共视区域。研究者通常利用该数据集进行自监督表征学习,通过图像对之间的几何与光度一致性约束,训练模型捕捉场景的深度、法线、光流等密集特征,从而提升下游任务如单目深度估计、语义分割和视觉里程计的泛化能力。其无需人工标注的数据构建策略,使得大规模预训练成为可能,尤其适用于数据稀缺的学术场景。
衍生相关工作
MIMIC数据集催生了一系列经典工作,主要集中在自监督密集预测与跨模态学习领域。例如,研究者基于其共视图像对设计了对齐损失函数,提出了改进的深度估计网络(如MIMIC-Depth),在KITTI和NYUv2基准上刷新了无监督方法的精度。此外,该数据集的构建策略被后续工作采纳,衍生出诸如MVS-MIMIC等用于多视角立体匹配的扩展版本。在理论层面,相关工作深入分析了共视比率对表征质量的影响,推动了关于几何一致性在自监督学习中作用的理论探讨,进一步巩固了MIMIC作为自监督几何学习基准数据集的重要地位。
数据集最近研究
最新研究方向
在计算机视觉领域,自监督预训练范式正逐步摆脱对人工标注的依赖,转而从数据内在结构挖掘监督信号。MIMIC数据集正是这一趋势下的前沿成果,它汇聚了310万对来自视频、3D扫描及街景等多元场景的图像对,通过创新的共视性度量策略(基于SIFT关键点与单应性变换),在无需任何标注的前提下,为密集预测任务提供大规模预训练语料。该数据集的设计直击传统方法在数据扩展性与标注成本间的矛盾,其可快速扩展的 curation 策略为视觉基础模型在复杂环境下的泛化能力研究开辟了新路径。结合近期多模态大模型对场景理解深度与鲁棒性的迫切需求,MIMIC所强调的几何一致性约束与跨域覆盖特性,有望推动自监督学习从分类任务向像素级理解任务的关键跃迁,对构建更通用的视觉表征具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务