遇见数据集

ciFAIR-10, CUB, ISIC 2018, EuroSAT, CLaMM

收藏
arXiv2022-12-24 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

本研究涉及五个不同的数据集,用于图像分类任务。ciFAIR-10数据集包含10个类别的日常物品低分辨率图像;CUB数据集是200种鸟类的细粒度分类数据集;ISIC 2018数据集包含7种皮肤病的医学图像;EuroSAT数据集是基于Sentinel-2卫星图像的多光谱数据集,包含10种土地覆盖类别;CLaMM数据集用于中世纪手稿的分类,包含12种手稿风格。这些数据集涵盖了从自然图像到专业领域图像的多样化应用,旨在解决小样本学习问题,特别是在数据稀缺情况下的图像分类挑战。

This study utilizes five distinct datasets for image classification tasks. The ciFAIR-10 dataset comprises low-resolution images of daily objects belonging to 10 categories; the CUB dataset is a fine-grained classification dataset covering 200 bird species; the ISIC 2018 dataset contains medical images of 7 types of skin disorders; the EuroSAT dataset is a multispectral dataset based on Sentinel-2 satellite imagery, which includes 10 land cover categories; the CLaMM dataset is intended for medieval manuscript classification, encompassing 12 manuscript styles. These datasets span diverse applications from natural images to professional domain images, and are designed to address few-shot learning problems, particularly the image classification challenges under data-scarce scenarios.

提供机构:
罗马大学
创建时间:
2022-12-24
搜集汇总
数据集介绍
ciFAIR-10, CUB, ISIC 2018, EuroSAT, CLaMM 数据集图片
构建方式
该基准数据集由ciFAIR-10、CUB、ISIC 2018、EuroSAT和CLaMM五个子数据集构成,覆盖自然图像、细粒度分类、医学影像、卫星遥感与手写文档等多个领域。除CUB因原始规模较小而直接采用外,其余数据集均通过子采样策略调整为每类约50张训练图像,以契合小样本学习场景。为降低子采样带来的随机波动,每个数据集(CUB除外)均构建了三组独立的训练-验证-测试划分,其中验证集用于超参数优化,测试集用于最终性能评估。
特点
该基准的核心特点在于其跨领域与多模态的多样性,涵盖了RGB、灰度及多光谱等不同数据类型的图像,有效避免了研究过度拟合于单一自然图像域的风险。研究揭示,经过细致的超参数调优后,标准交叉熵基线竟能超越十种专门方法中的九种,仅逊色于Harmonic Networks。这一发现凸显了超参数优化在小样本场景中的关键作用,并表明该领域近年来的性能增长实际上呈现停滞状态。
使用方法
使用该基准时,研究者需遵循统一的实验协议:对所有方法采用相同的骨干网络(ciFAIR-10使用WRN-16-8,其余使用ResNet-50),并借助ASHA算法对学习率、权重衰减、批量大小及方法专属超参数进行联合优化。模型在验证集上完成超参数选择后,在独立的测试集上重复训练十次以评估性能,最终结果取三组划分共三十次重复的平均平衡分类准确率。所有代码、数据划分及实现均公开在GitHub仓库中。
背景与挑战
背景概述
在计算机视觉领域,大规模数据集上的预训练已成为提升图像分类性能的常态,然而,诸多实际应用场景(如医学影像、卫星多光谱数据、古籍手稿分类)因强烈的领域偏移或数据模态差异,无法依赖外部大规模数据集进行预训练,这催生了从小样本数据中直接学习的迫切需求。2022年,由罗马大学与弗里德里希·席勒大学的研究人员共同提出的ciFAIR-10、CUB、ISIC 2018、EuroSAT及CLaMM五个数据集构成的基准,系统性地覆盖了自然图像、细粒度分类、医学影像、遥感和手写文档等多个领域,旨在为小样本图像分类研究提供统一的评估平台。该基准的发布填补了领域内长期缺乏客观比较标准的空白,通过严格的超参数优化揭示了传统交叉熵损失在充分调优后仍具极强竞争力,仅有一项专门方法(Harmonic Networks)能稳定超越该基线,从而深刻改变了学界对小样本学习进展的认知。
当前挑战
该数据集基准所应对的核心挑战在于:在数据极度匮乏(每类仅数十至数百样本)且无法借助外部预训练的条件下,如何有效抑制深度神经网络对训练特征中虚假关联的记忆,从而学习到泛化能力强的分类函数。构建过程中面临多重困难:首先,需确保数据集覆盖跨领域、跨模态的多样性,以规避研究过度拟合于单一自然图像域的风险;其次,为每个数据集设计合理的子采样策略(如每类50张图像)并创建多组独立训练/验证/测试划分,以评估方法对采样变异的鲁棒性;此外,针对非RGB数据(如EuroSAT的13通道多光谱图像、CLaMM的灰度图像),需解决标准预训练-微调流程无法直接适用的问题,从而凸显从头学习方法的必要性。
常用场景
经典使用场景
在图像分类领域,当训练样本极度匮乏时,ciFAIR-10、CUB、ISIC 2018、EuroSAT 和 CLaMM 这五个数据集共同构成了一个跨领域、多模态的小样本基准测试平台。它们涵盖了自然图像、细粒度物种识别、医学皮肤病变诊断、多光谱卫星遥感以及中世纪手写文档分类等迥异的视觉任务,旨在系统评估算法在无外部预训练数据条件下,仅凭每类数十张样本即可完成分类的能力。这一基准的设计初衷是填补此前研究因缺乏统一评测标准而导致的碎片化困境,为数据高效深度学习提供客观、可复现的竞技场。
实际应用
在实际应用中,这五个数据集所模拟的小样本场景广泛存在于诸多对数据获取成本敏感或存在强领域偏移的领域。例如,在医学影像分析中,ISIC 2018 代表了对罕见皮肤病进行自动筛查的需求,专家标注的昂贵性使得算法必须从少量样本中高效学习;EuroSAT 则映射了遥感图像处理中多光谱数据的特殊性,此时基于 ImageNet 的预训练策略因通道数不匹配而失效,亟需从头训练的方法;CLaMM 数据集则体现了文化遗产数字化中对古籍手稿风格的自动分类,这类任务与自然图像存在巨大语义鸿沟,无法依赖通用预训练模型。这些场景共同指向一个迫切需求:开发能够在数据匮乏条件下直接学习的鲁棒分类器,以降低对大规模标注数据的依赖,加速垂直领域的智能化落地。
衍生相关工作
该基准的提出直接催生了一系列关于小样本图像分类方法的重新审视与改进工作。最显著的是,它促使研究者重新评估此前发表于 CVPR、ICCV、ICLR 等顶会的十种专有方法(如 Harmonic Networks、OLÉ、Cosine Loss、Distilling Visual Priors 等),并在统一框架下进行公平比较。结果表明,仅有 Harmonic Networks(一种基于离散余弦变换先验的架构)能够持续超越经过充分调优的交叉熵基线,而其余方法在性能上并无显著优势。这一结论引发了学界对“数据高效深度学习”领域进展的深刻反思,并推动了后续工作更加注重超参数搜索的透明度与基线的公平性。此外,该基准的公开代码和标准化流程也为后续研究者提供了可扩展的评测平台,促进了新方法的可复现性评估与跨论文的客观比较。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务