ADBench
收藏数据链接:
官方服务:
资源简介:
ADBench是一个全面的异常检测基准,包含30种算法在57个基准数据集上的评估,特别贡献了来自自然语言和计算机视觉领域的新数据集,用于帮助研究人员进行全面和公平的方法评估。
ADBench is a comprehensive anomaly detection benchmark that evaluates 30 algorithms across 57 benchmark datasets. It specifically contributes new datasets from the fields of natural language processing and computer vision, aiming to help researchers conduct comprehensive and fair evaluations of anomaly detection methods.
创建时间:
2022-06-19
搜集汇总
数据集介绍

构建方式
ADBench的构建基于对异常检测领域研究与实际部署需求的深度剖析,整合了30种检测算法与57个基准数据集。数据集既涵盖了来自ODDS、DAMI等公开资源库的47个经典数据集,亦引入了从计算机视觉与自然语言处理领域改造的10个复杂数据集,通过预训练模型(如BERT与ResNet18)提取嵌入特征以适配表格型异常检测任务。算法方面,系统囊括了14种无监督、7种半监督及9种全监督方法,并针对监督程度、异常类型及数据噪声三大核心维度设计了系统化的实验框架,从而实现了对算法性能的全方位评估。
特点
ADBench的显著特点在于其无与伦比的全面性与多维度的比较视角。其不仅涵盖了从经典浅层方法到前沿深度学习架构的广泛算法谱系,更开创性地引入了对监督信息可用性、局部与全局等四种异常类型以及数据污染(如重复异常、无关特征与标注错误)下算法鲁棒性的系统性分析。通过多达98,436次实验,该基准揭示了无监督算法间无统计显著差异的‘无免费午餐’现象,并证实了少量标注异常(如1%)即可使半监督方法超越最优无监督方法,为算法选择与设计提供了深刻洞见。
使用方法
研究者可利用ADBench开源框架对新提出的异常检测算法进行高效且公平的评估。使用方式包括:在57个数据集上运行算法,并通过提供的标准化代码库与预定义超参数设置,复现与对比现有30种基线方法的性能。框架支持无监督、半监督及全监督三种模式的灵活切换,并允许用户通过调整标注异常比例、注入特定类型异常或引入噪声与数据污染,在三个核心比较角度下深入探究算法的特性与局限性,从而促进可复现且具有统计意义的算法验证与创新。
背景与挑战
背景概述
异常检测作为机器学习领域的关键任务,在反洗钱、罕见病检测、社交媒体分析及入侵检测等诸多应用中扮演着不可或缺的角色。尽管过去几十年间涌现了大量异常检测算法,但对其性能的全面、公平评估却长期缺乏系统性基准。为填补这一空白,来自上海财经大学与卡内基梅隆大学的研究人员于2022年共同创建了ADBench数据集与基准框架。该工作旨在回答三个核心研究问题:不同监督程度下算法表现如何?面对不同类型的异常(如局部、全局、依赖及聚类异常),算法响应是否存在差异?在噪声与数据污染环境下,算法鲁棒性又如何?ADBench涵盖了30种算法与57个基准数据集,通过超过98,000次实验,为异常检测领域提供了迄今为止最为全面的评估平台,对算法选择与设计产生了深远影响。
当前挑战
ADBench所应对的核心挑战源于异常检测领域长期存在的评估困境。首先,现有基准大多仅关注无监督方法,忽略了日益兴起的半监督与全监督算法,且未能深入分析算法在局部、全局等不同异常类型下的性能差异。其次,模型在噪声标签、无关特征等数据污染环境下的鲁棒性评估长期缺位,而这一特性在实际部署中至关重要。在构建过程中,ADBench面临了诸多困难:需要从计算机视觉与自然语言处理领域引入大规模数据集,并利用预训练模型提取嵌入以适配表格异常检测任务;同时,需设计包含四种异常类型的合成数据生成流程,以系统性地解耦异常类型对算法性能的影响。此外,如何确保30种算法在57个数据集上的公平比较与统计显著性检验,亦是构建过程中的重大挑战。
常用场景
经典使用场景
ADBench作为目前最为全面的表格数据异常检测基准,其经典应用在于系统性地评估和比较30种算法在57个数据集上的性能。它通过设计三个核心评估维度——监督程度、异常类型多样性以及数据噪声与污染下的鲁棒性,为研究者提供了一个标准化的实验平台。该基准不仅涵盖了无监督方法,还首次大规模纳入了半监督和全监督算法,使得对算法在不同标签可用性下的表现进行公平对比成为可能。
解决学术问题
ADBench解决了异常检测领域长期存在的几个关键学术问题。首先,它通过大规模实验揭示了无监督算法之间不存在统计上显著的性能差异,强调了算法选择的重要性。其次,它量化了标签信息的价值,发现仅需1%的标注异常,半监督方法即可超越最优的无监督算法。此外,该基准深入分析了算法对不同类型异常(如局部、全局异常)的响应,证明了先验知识在特定场景下甚至比部分标签更有效,为算法设计提供了重要指导。
衍生相关工作
ADBench衍生了多个方向的重要工作。在算法层面,它推动了半监督异常检测方法的发展,如DevNet和DeepSAD,这些方法被证明能高效利用有限标签。在评估体系上,它促进了基于统计检验(如临界差异图)的算法比较范式的普及。此外,ADBench所揭示的“无免费午餐”定理推动了自动化异常检测模型选择(如MetaOD)的研究,以及针对特定异常类型的算法设计,如针对聚类异常的OCSVM改进,形成了从基准到算法创新的良性循环。
以上内容由遇见数据集搜集并总结生成



