遇见数据集

dazhangyu123/AEM-dataset

收藏
Hugging Face2024-10-19 更新2024-12-14 收录
官方服务:

资源简介:

该数据集来源于公开的CAMELYON16和CAMELYON17数据集,包含从全切片图像(WSI)的组织切片中提取的特征嵌入,使用了多种预训练模型生成。数据集设计用于基于多实例学习(MIL)的WSI分类任务,特别是用于注意力熵最大化(AEM)方法。

This dataset is derived from the publicly available CAMELYON16 and CAMELYON17 datasets, consisting of feature embeddings extracted from tissue patches of whole slide images (WSIs) using various pre-trained models. It is designed for use in multiple instance learning (MIL) based WSI classification tasks, particularly for the Attention Entropy Maximization (AEM) method. The dataset creation involves extracting tissue patches from WSIs and generating feature embeddings using models such as ResNet18, Lunit pre-trained DINO, and PathGen-CLIP. The dataset is primarily intended for research in computational pathology, specifically for developing and evaluating MIL-based WSI classification methods.

提供机构:
dazhangyu123
搜集汇总
数据集介绍
dazhangyu123/AEM-dataset 数据集图片
构建方式
在计算病理学领域,全切片图像分类是辅助疾病诊断的关键技术。AEM-dataset数据集源自公开的CAMELYON16与CAMELYON17数据集,旨在为基于多实例学习的全切片图像分类提供标准化特征表示。构建过程中,首先利用CLAM工具包从全切片图像中提取组织补丁,随后采用ResNet18、Lunit预训练DINO及PathGen-CLIP等模型对每个补丁进行特征嵌入提取,最终形成适用于注意力熵最大化方法的特征数据集。
特点
该数据集的核心特点在于其专注于多实例学习范式下的全切片图像分类任务,尤其适配注意力熵最大化方法。数据规模庞大,涵盖约900张全切片图像,特征维度丰富且来源多样,包括通用与病理专用预训练模型。通过提取组织补丁的深层特征,数据集有效降低了原始图像的高维冗余,同时保留了关键的病理信息,为模型训练提供了高效且针对性的输入。
使用方法
使用该数据集时,研究者应首先参考AEM官方GitHub仓库与arXiv论文,以获取完整的实现细节与示例代码。数据可直接用于训练和评估基于注意力熵最大化方法的多实例学习模型,用户需将预提取的特征嵌入加载至模型输入层,并依据任务需求调整分类头与注意力机制参数。建议结合CAMELYON数据集的原始标注信息进行性能验证,以确保模型在淋巴结转移检测等任务中的泛化能力。
背景与挑战
背景概述
在计算病理学领域,全切片图像分类是癌症诊断与预后评估的关键环节,然而其面临图像尺寸巨大、标注成本高昂以及组织异质性显著等固有难题。为应对上述挑战,由张云龙等研究人员于2023至2024年间构建的AEM数据集应运而生,该数据集基于公开的CAMELYON16与CAMELYON17资源,包含约900张淋巴结全切片图像,并由来自多所机构的研究团队通过CLAM工具提取组织斑块,再经ResNet18、Lunit预训练DINO及PathGen-CLIP等模型生成特征嵌入。其核心研究问题聚焦于借助注意力熵最大化策略优化多实例学习范式,从而提升弱监督场景下全切片图像的分类性能。该数据集为后续开发诊断辅助工具提供了标准化基准,对推动计算病理学从算法验证向临床落地具有重要影响力。
当前挑战
AEM数据集所解决的领域问题在于全切片图像分类中的弱监督学习瓶颈,即传统多实例学习方法易陷入注意力塌陷,导致模型仅关注少数判别性区域而忽略全局病理信息,进而影响分类鲁棒性。在构建过程中,挑战主要体现在三个方面:其一,原始CAMELYON数据集存在标注不均衡与组织类型分布偏差,需通过特征级重采样缓解;其二,从大规模全切片图像中提取组织斑块时,需平衡计算效率与保留关键形态学特征,CLAM工具的参数调优成为技术难点;其三,不同预训练模型(如通用ResNet与病理专用DINO)生成的特征嵌入存在语义鸿沟,融合时需设计对齐策略以避免信息损失。这些挑战共同制约着数据集在跨中心泛化与临床可信度方面的表现。
常用场景
经典使用场景
AEM-dataset数据集专为基于多实例学习(MIL)的全切片图像分类任务而构建,其经典应用场景聚焦于计算病理学领域中的肿瘤区域自动识别。该数据集源自CAMELYON16与CAMELYON17公开数据集,通过对组织补丁提取特征嵌入,并利用ResNet18、Lunit预训练DINO及PathGen-CLIP等模型进行表征学习,为注意力熵最大化(AEM)方法提供了标准化评估基准。研究者可借助该数据集高效验证MIL框架下注意力机制对关键病理区域建模的有效性,推动弱监督学习在数字病理图像分析中的发展。
解决学术问题
该数据集系统性地解决了全切片图像分类中标注稀疏与实例冗余导致的模型泛化瓶颈。传统方法依赖像素级标注,成本高昂且难以推广,而AEM-dataset通过特征嵌入压缩与注意力熵正则化,缓解了MIL中实例噪声与包级标签弱监督的冲突。其构建过程揭示了预训练特征质量对下游任务的影响,为探究注意力分布与分类决策的可解释性提供了实验载体。该研究推动了计算病理学从粗粒度分类向细粒度病灶定位的范式演进,显著提升了模型在跨数据集场景下的鲁棒性。
衍生相关工作
AEM-dataset的发布催生了多项突破性研究,包括基于对比学习的全切片表征蒸馏方法、动态图卷积网络驱动的组织拓扑建模,以及跨尺度注意力融合框架。其中,AEM方法本身作为核心基线,启发了后续工作如熵感知伪标签生成与自监督特征对齐策略。该数据集亦被用于验证Transformer架构在病理图像中的可扩展性,以及多实例学习与知识蒸馏的协同优化路径,形成了从特征工程到模型压缩的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务