OmniNOCS
收藏资源简介:
OmniNOCS是由谷歌研究和佐治亚理工学院共同创建的一个大规模单目数据集,专注于3D标准化对象坐标空间(NOCS)图、对象掩码和3D边界框注释,适用于室内外场景。该数据集包含380k张图像,覆盖97个对象类别,远超现有NOCS数据集的多样性和规模。数据集的创建过程包括对多个来源的数据进行深度和实例分割的增强,以及对象方向的标准化。OmniNOCS主要应用于3D场景理解,如机器人抓取和自动驾驶车辆对周围物体的定位和形状识别。
OmniNOCS is a large-scale monocular dataset co-developed by Google Research and Georgia Institute of Technology, focusing on 3D normalized object coordinate space (NOCS) maps, object masks and 3D bounding box annotations, and designed for both indoor and outdoor scenarios. This dataset contains 380,000 images spanning 97 object categories, which far exceeds the diversity and scale of existing NOCS datasets. The dataset creation process involves enhancing multi-source data with depth and instance segmentations, and standardizing object orientations. OmniNOCS is primarily utilized for 3D scene understanding tasks, such as robotic grasping, as well as surrounding object localization and shape recognition for autonomous vehicles.
OmniNOCS 数据集概述
数据集简介
OmniNOCS 是一个统一的大规模单目数据集,包含室内和室外场景的3D Normalized Object Coordinate Space (NOCS) 图、对象掩码和3D边界框注释。该数据集拥有超过90个对象类别,是现有NOCS数据集(如NOCS-Real275和Wild6D)的20倍以上的对象类别和200倍以上的实例。
数据集用途
OmniNOCS 数据集用于训练一个新型的基于Transformer的单目NOCS预测模型“NOCSformer”。该模型能够从2D对象检测中预测准确的NOCS、实例掩码和姿态,适用于广泛的类别。
数据集特点
- 大规模: 包含20倍以上的对象类别和200倍以上的实例。
- 多样性: 覆盖室内和室外场景,适用于多种应用。
- 高质量注释: 提供3D NOCS图、对象掩码和3D边界框注释。
数据集链接
相关模型
NOCSformer 是一个基于Transformer的模型,能够从2D对象框中预测NOCS和6DoF姿态。该模型不包含任何类别特定的参数,并能泛化到互联网收集的野生图像。
模型架构
NOCSformer 使用DINOv2主干从输入图像中提取特征,通过输入的2D对象框进行池化,并将每个对象的特征输入到NOCS和大小头部。基于自注意力的NOCS头部联合预测RoI的NOCS和实例掩码。学习的PnP头部用于姿态估计,使用预测的NOCS和实例掩码来预测对象的投影3D质心和3D方向。
数据集应用
OmniNOCS 数据集和NOCSformer模型在3D定向边界框预测任务中取得了与现有3D检测方法(如CubeRCNN)相当的结果。此外,该模型还提供了详细和准确的3D对象形状和分割。




