遇见数据集

SPARE3D

收藏
arXiv2020-09-02 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

SPARE3D是由纽约大学坦登工程学院开发的一个专注于三维空间推理的数据集。该数据集包含10,369个三维CAD对象,主要用于评估智能系统的空间推理能力。SPARE3D通过三种类型的任务(视图一致性推理、相机姿态推理和形状生成推理)来测试系统的空间智能,这些任务难度递增,旨在激发新的数据驱动研究方向。数据集的创建过程涉及自动生成大量具有标准答案的挑战性问题,用于训练和评估。SPARE3D的应用领域主要集中在提升智能机器人在三维世界中的操作效率,尤其是在没有昂贵三维传感器的情况下。

SPARE3D is a 3D spatial reasoning-focused dataset developed by the Tandon School of Engineering at New York University. This dataset contains 10,369 3D CAD objects, and is primarily used to evaluate the spatial reasoning capabilities of intelligent systems. SPARE3D tests the spatial intelligence of systems through three types of tasks: view consistency reasoning, camera pose reasoning, and shape generation reasoning. These tasks increase in difficulty and are designed to inspire new data-driven research directions. The dataset creation process involves automatically generating a large number of challenging questions with standard answers for training and evaluation purposes. The application scenarios of SPARE3D mainly focus on improving the operational efficiency of intelligent robots in the 3D world, especially when expensive 3D sensors are not available.

创建时间:
2020-03-31
搜集汇总
数据集介绍
构建方式
空间推理作为人类智能的核心组成部分,使个体能够从二维线条图中想象三维物体的形状并推理其空间关系。SPARE3D数据集基于认知科学与心理测量学原理,构建了三类难度递增的2D-3D推理任务:视图一致性、相机姿态与形状生成。数据集的构建依赖于两个三维物体库——SPARE3D-ABC(从ABC数据集中采样10,369个CAD模型)与SPARE3D-CSG(随机生成11,149个构造实体几何模型)。通过PythonOCC工具,从11个固定视角生成正交投影线条图,并设计自动化流程生成大量带真实标注的问题实例。为规避数据偏差,所有图像统一尺寸、分辨率与缩放比例,确保正确答案与干扰项在解空间中均匀分布,且每张图纸在任务中仅出现一次。
特点
SPARE3D数据集的核心特点在于其纯粹性与挑战性。它聚焦于几何形状与观测姿态的推理,完全剥离了自然语言与语义信息,使研究能专注于空间认知本身。数据集包含五个子任务:三视图到等轴测图的视图一致性判别、等轴测图到相机姿态的推理、姿态到等轴测图的逆向选择、等轴测图生成与点云生成。线条图作为输入模态,摒弃了光照与纹理的干扰,仅保留最突出的几何轮廓。实验表明,当前最先进的卷积网络(如ResNet-50)在多数任务上的表现接近随机猜测,远低于人类平均水平,揭示了现有深度学习架构在空间推理领域的显著不足。
使用方法
SPARE3D数据集的使用方法灵活多样,适用于监督学习与生成式模型的训练与评估。对于判别性任务(如视图一致性与相机姿态推理),可将前视图、顶视图、右视图与候选等轴测图拼接为多通道输入,采用二元分类或多类分类框架进行训练。对于生成性任务(如等轴测图生成与点云生成),则基于条件生成对抗网络或编码-解码架构,从三视图输入中预测三维形状。数据集同时提供光栅PNG与矢量SVG格式,便于不同网络结构(如CNN或图神经网络)的适配。基准实验采用ResNet-50、VGG-16与BagNet作为骨干网络,并设计了人类性能对比基线,为未来空间推理算法的开发提供了标准化的评估平台。
背景与挑战
背景概述
空间推理作为人类智能的重要组成部分,使个体能够从二维线图中想象三维物体的形状并推理其空间关系。然而,现有深度学习模型在这一领域的表现远逊于人类,这促使纽约大学坦登工程学院的研究团队于2020年提出了SPARE3D数据集。该数据集基于认知科学与心理测量学,设计了视图一致性、相机姿态和形状生成三类递增难度的2D-3D推理任务,旨在系统评估智能系统的空间推理能力。通过从ABC数据集中采样逾万件CAD模型并自动生成大量带标注的问题,SPARE3D为空间推理研究提供了首个纯粹几何推理的基准平台,其影响力在于揭示了当前卷积网络在空间推理任务上的严重不足,推动了数据驱动方法在该方向的探索。
当前挑战
SPARE3D面临的核心挑战在于三大领域难题:其一,空间推理任务要求智能体从稀疏且几何精确的线图中提取全局结构信息,而非依赖纹理或语义类别,这导致基于局部特征的卷积网络(如ResNet)在视图一致性任务上表现接近随机猜测;其二,构建过程中需避免数据偏差,例如为视图一致性任务自动生成非平凡的错误候选答案,需通过切割三维对象来消除局部外观相似性,否则网络会利用统计模式而非真正推理能力求解;其三,生成式任务(如点云生成)要求从三视图还原细节丰富的三维形状,当前基线方法虽能捕捉大致轮廓,却无法精确重建复杂结构,难以支撑分析-合成式的推理策略。
常用场景
经典使用场景
SPARE3D数据集专为评估智能系统的空间推理能力而设计,其经典使用场景聚焦于从二维正投影线条图中推断三维物体的几何属性与空间关系。数据集包含三类递进难度的推理任务:视图一致性推理要求模型从多个候选等轴测图中选出与给定三视图匹配的正确视图;相机位姿推理则需基于输入的三视图和等轴测图,判断该等轴测图的拍摄姿态;形状生成推理更进一步,要求模型直接生成目标物体的等轴测图或三维点云。这些任务剥离了纹理、光照与语义信息,仅以纯几何线条图作为输入,从而纯粹地测试智能体对物体形状和位姿的深层理解能力。
解决学术问题
SPARE3D填补了现有视觉推理数据集在纯几何空间推理方面的空白,解决了如何量化与评估深度学习模型空间智能这一关键学术问题。传统数据集如CLEVR或Visual Genome多依赖自然语言或语义标签,难以分离出纯粹的几何推理能力;而人类心理测量测试如Mental Rotation Tests数据量小且不适用于机器学习。SPARE3D通过自动化生成大规模、无偏见的问答实例,揭示了当前最先进的卷积神经网络(如ResNet、VGG)在视图一致性任务上表现近乎随机猜测,在相机位姿推理上虽略超未训练人类但仍远低于训练后人类水平。这一发现挑战了学界对深度网络视觉理解能力的认知,推动了空间推理新范式与网络架构的研究。
衍生相关工作
SPARE3D的发布催生了多项空间推理领域的衍生研究工作。基于其揭示的CNN在纯几何推理上的不足,研究者开始探索图神经网络(GNN)与向量化线条图表示(如SVG)以替代传统光栅图像编码,从而更好地捕获线条间的拓扑结构。此外,分析合成(analysis-by-synthesis)方法被引入,例如利用可微渲染器或神经场景表示(如GQN)对三维形状进行隐式建模,再通过渲染匹配实现推理。另一方向是融合自监督三维信息,如使用FoldingNet或AtlasNet预训练编码器作为初始化,尽管初期实验提升有限,但启发了更高效的多视图到三维的联合学习范式。这些工作共同推动了从统计模式匹配向真正几何推理的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务