遇见数据集

METU-ALET

收藏
arXiv2020-12-13 更新2024-06-21 收录
官方服务:

资源简介:

METU-ALET数据集是由中东技术大学计算机工程系KOVAN研究实验室创建,专注于在复杂环境中检测和识别工具,包括农业、园艺、办公、石工、车辆、木工和车间工具等49个类别。该数据集包含2699张图像,每张图像都标注有超过200个边界框,确保了数据的丰富性和多样性。创建过程中,研究团队通过网络爬取、自行拍摄和合成图像三种方式收集数据,确保了数据集的全面性和实用性。METU-ALET数据集不仅适用于机器人视觉和工具识别研究,还特别关注了人类工作者的安全检测,如安全帽、口罩、手套等的佩戴情况,为机器人与人类协作环境中的安全问题提供了重要数据支持。

The METU-ALET dataset was developed by the KOVAN Research Laboratory, Department of Computer Engineering, Middle East Technical University. It focuses on detecting and identifying tools in complex environments, covering 49 categories including agricultural, horticultural, office, masonry, vehicle, woodworking, and workshop tools. The dataset contains 2,699 images, each annotated with more than 200 bounding boxes, ensuring the richness and diversity of the data. During its development, the research team collected data through three methods: web crawling, on-site photography, and synthetic image generation, guaranteeing the comprehensiveness and practicality of the dataset. The METU-ALET dataset is applicable not only to robotic vision and tool recognition research but also specifically focuses on safety detection for human workers, such as the wearing status of safety helmets, masks, gloves and other protective gear, providing important data support for safety issues in human-robot collaborative environments.

创建时间:
2019-10-25
搜集汇总
数据集介绍
构建方式
在真实人机协作场景中,工具检测是机器人感知能力的关键一环。METU-ALET数据集通过三种途径构建:首先从共享图片网站爬取免版税图像;其次在校园内自行拍摄办公室与车间环境照片;最后利用Unity3D模拟环境生成合成图像,确保每类工具至少包含200个边界框。所有图像中的工具均使用VGG图像标注工具进行人工标注,覆盖农业、园艺、办公、石工、车辆、木工和车间七大类共49种工具类别。
特点
该数据集呈现出显著挑战性:工具尺度差异悬殊,大量工具属于小目标;许多工具具有铰接结构,外观随视角剧烈变化;场景高度杂乱,工具间相互遮挡且类间相似性高(如螺丝刀与凿子)。此外,数据集包含22,835个边界框,平均每张图像含6.6个实例,远超PASCAL VOC数据集。其独特之处还在于包含ALET安全子集,涵盖安全帽、护目镜、口罩、耳机和手套五类安全装备实例。
使用方法
数据集可直接用于训练和评估目标检测模型,论文提供了Faster R-CNN、Cascade R-CNN、RepPoint和RetinaNet的基线结果。使用时可按照80%训练、10%验证、10%测试的比例划分数据。对于安全检测应用,可结合OpenPose人体姿态估计,将安全工具位置与对应关节点距离小于0.2视为穿戴状态,训练多标签分类网络。代码、预训练模型及完整数据集均已在GitHub开源。
背景与挑战
背景概述
在机器人技术与人类协作日益紧密的背景下,精准感知工作环境中的工具成为实现智能交互的关键一环。然而,现有研究多聚焦于工具的抓取与功能迁移,缺乏针对真实复杂场景中工具检测的专用数据集。为填补这一空白,中东技术大学KOVAN研究实验室于2020年发布了METU-ALET数据集,由Fatih Can Kurnaz等人构建。该数据集涵盖农业、园艺、办公、石工、车辆、木工及车间七大类共49种工具,包含2699张图像与22835个边界框,图像来源涵盖网络爬取、实地拍摄与合成渲染。其核心研究问题在于推动机器人在杂乱环境中对小型、铰接式及类间相似工具的鲁棒检测,并拓展至工人安全装备(如头盔、口罩、手套等)的识别。该数据集为机器人工具感知领域提供了首个大规模基准,显著促进了相关算法的发展与实际应用。
当前挑战
METU-ALET数据集所解决的领域问题极具挑战性:工具检测面临目标尺度微小、铰接结构多变、类间差异低微(如螺丝刀与锉刀外形相似)以及场景高度杂乱带来的遮挡与光照干扰,导致主流目标检测器(如Faster R-CNN、RetinaNet)在小型工具和易混淆类别上性能显著下降。在构建过程中,研究人员遭遇多重困难:首先,真实场景图像中工具实例分布不均,需通过合成渲染补充数据以确保每类至少200个实例;其次,人工标注耗时且易出错,尤其对窄长工具(如笔、刀)的边界框需精细界定;此外,合成图像需模拟真实环境的随机性(如工具掉落、视角变化),以避免过拟合。这些挑战共同构成了工具检测领域独特而严峻的研究瓶颈。
常用场景
经典使用场景
在机器人共融与工业自动化领域,METU-ALET数据集为工具检测提供了首个面向真实复杂场景的基准。其经典使用场景聚焦于机器人对农业、园艺、办公、石工、车辆、木工及车间等七大类共49种工具的精准识别。数据集包含2699幅图像与22835个边界框,涵盖小尺度、铰接结构、遮挡及类间相似性等挑战,尤其适合评估Faster R-CNN、Cascade R-CNN、RepPoint和RetinaNet等深度检测器在杂乱环境中的鲁棒性。通过真实拍摄、网络爬取与合成图像的三元融合,该数据集有效模拟了人机协作中工具被操作或闲置时的多样状态,为机器人感知系统提供了关键训练与测试资源。
解决学术问题
METU-ALET数据集系统性地解决了工具检测领域长期存在的学术空白:现有通用目标检测数据集(如PASCAL VOC、MS-COCO)虽包含少量工具类别,但缺乏对工具特有的小尺度、铰接结构、高度类间相似性及杂乱背景的针对性标注。该数据集通过提供密集边界框与多源图像(真实+合成),首次支持对工具检测中尺度不变性、铰接鲁棒性及细粒度分类等核心问题的量化研究。实验表明,主流检测器在狭长工具(如笔、锉刀)和视觉相似工具(如螺丝刀与凿子)上表现欠佳,揭示了当前算法在极端小目标与结构歧义性方面的局限性,从而推动了面向工具特性的检测架构创新。
衍生相关工作
METU-ALET数据集催生了一系列衍生工作,深化了工具检测与机器人操作的研究。其基线实验对比了Faster R-CNN、Cascade R-CNN、RepPoint和RetinaNet四种检测器,发现Cascade R-CNN在卷笔刀(AP 84.057)等独特工具上表现优异,而RetinaNet借助合成数据将mAP从11.980提升至20.118,验证了数据增强的有效性。后续工作可继承其三元数据融合策略,探索针对小工具的高分辨率特征金字塔或铰接感知的锚点设计。同时,ALET Safety子集推动了安全穿戴检测的独立模型开发,未来可结合姿态估计与工具检测的联合框架,实现更鲁棒的工人安全评估。该数据集已成为机器人领域工具理解与安全监控研究的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务