遇见数据集

Compositional Visual Relations (CVR)

收藏
arXiv2022-06-11 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

一个用于推动数据效率学习算法发展的新视觉推理基准,灵感来自流体智力和非言语推理测试,描述了一种大规模创建抽象规则组合和相关图像数据集的新方法。

This novel visual reasoning benchmark, which aims to advance data-efficient learning algorithms and draws inspiration from fluid intelligence and non-verbal reasoning tests, presents a new methodology for large-scale creation of combinations of abstract rules and their associated image datasets.

创建时间:
2022-06-11
搜集汇总
数据集介绍
Compositional Visual Relations (CVR) 数据集图片
构建方式
在视觉推理领域,人类之所以能高效学习新任务,部分归功于其利用组合性的能力。受此启发,Compositional Visual Relations (CVR) 数据集应运而生。其构建方式独具匠心:首先定义一组基础视觉关系,如形状、位置、大小、颜色、旋转、翻转、计数、内嵌和接触,共计9种元关系。随后,通过将这些元关系进行组合,形成多达103条独特的任务规则。每条规则对应一个“找出异类”问题,包含四幅图像,其中一幅根据特定规则成为离群值。生成过程采用程序化方法,基于场景图模板,通过随机或固定参数控制场景的生成,确保规则相关属性在三幅图像中一致,而在第四幅中改变,从而构造出离群项。
特点
CVR数据集的核心特点在于其强调组合性与样本效率的评估。它提供了103条独特规则,涵盖从基础到四重组合的多种抽象层次,远超以往基准如SVRT的23个任务。每条规则均包含10,000个训练样本、500个验证样本和1,000个测试样本,并额外提供1,000个泛化测试样本,支持对模型在低样本条件下的学习能力进行细致分析。数据集中的形状随机生成而非固定集合,位置不限于网格,属性连续采样,这迫使模型必须进行真正的视觉推理而非依赖记忆。此外,CVR通过设计参考规则与离群规则的对比,确保任何解题策略都必须涉及目标关系推理,从而量化模型的组合性利用能力。
使用方法
使用CVR数据集时,研究者可灵活设置实验范式。模型可被训练于单一规则或联合所有规则,后者需提供规则嵌入向量以避免混淆。评估涵盖六个数据量级(20至1000样本),通过样本效率分数(SES)和曲线下面积(AUC)量化性能。自监督预训练(如MoCo-v3)可用于解耦特征学习与抽象推理,对比模型在随机初始化与预训练后的表现。此外,通过课程学习(先学元规则再学组合)和反向课程(从组合迁移到元规则)可测试模型的组合性迁移能力。人类基线实验表明,人类仅需20样本即可达到78.7%准确率,而最佳模型需1000样本才能接近,凸显了数据效率提升的空间。
背景与挑战
背景概述
视觉推理是人工智能领域一项至关重要的能力,它要求系统从高维视觉输入中抽取出抽象的概念与关系。然而,现有的视觉推理基准如RAVEN、PGM和SVRT,虽然在特定任务上推动了技术进步,却普遍忽视了数据效率与组合性这两个人类智能的核心特征。为此,来自布朗大学、法国国立科学研究中心及图卢兹大学的研究人员于2022年提出了组合视觉关系(CVR)基准。该基准由Aimen Zerroug、Mohit Vaishnav、Julien Colin、Sebastian Musslick和Thomas Serre共同创建,旨在系统评估模型在低样本学习、跨规则泛化以及利用组合性进行知识迁移方面的能力。CVR包含103条独特的任务规则,涵盖9种基本视觉关系及其复杂组合,通过程序化生成图像,为研究视觉推理中的数据效率问题提供了标准化的评测平台,对推动更具人类学习效率的神经架构发展具有重要影响力。
当前挑战
CVR基准所面临的挑战主要体现在两个层面。在领域问题层面,它聚焦于解决视觉推理中模型数据效率低下的核心难题:人类仅需少量样本即可掌握新规则,而当前最先进的神经网络即便经过自监督预训练,仍需超过人类50倍的训练数据才能达到同等精度,且无法像人类一样有效利用组合性将复杂任务分解为基本成分进行学习。在构建过程中,挑战则在于如何设计一个既能保证规则多样性与抽象层次,又能避免模型依赖捷径的策略:研究者需要确保每个“找出异类”问题中的干扰项仅与目标关系相关,同时通过参数随机化控制难度,并创建泛化测试集以防止模型通过像素总和等低级特征进行作弊。此外,如何在保持任务结构一致性的前提下,生成涵盖所有关系对组合的103条独特规则,并协调卷积架构与Transformer架构在形状、旋转等任务上的性能差异,也是构建过程中的重大挑战。
常用场景
经典使用场景
Compositional Visual Relations(CVR)数据集的核心经典使用场景在于评估和推动视觉推理模型的组合性与样本效率。该数据集通过构建包含103种独特任务规则的“找出异类”(Odd-One-Out)问题,要求模型在四幅图像中识别出违背隐含规则的异常项。场景设计借鉴了流体智力与非言语推理测试,每个问题由抽象规则组合而成,规则涵盖形状、位置、大小、颜色、旋转、翻转、计数、包含与接触等九种基本关系及其复合形式。研究者常利用CVR测试模型在低样本学习、跨任务泛化以及知识迁移方面的能力,尤其关注模型能否像人类一样高效地利用组合性从少量样例中习得复杂规则。
实际应用
在实际应用中,CVR数据集所强调的样本高效与组合性推理能力,对诸多视觉智能系统具有深远影响。例如,在工业质检场景中,模型需从少量缺陷样本中快速习得异常模式,CVR的“找出异类”任务直接对应此类需求;在自动驾驶中,车辆需在罕见交通场景下依据少量示例判断物体间关系(如“大车包含小车”或“接触状态”),CVR训练出的模型可提升对复杂路况的泛化能力。此外,在医疗影像分析中,医生常依据少量典型病例推断病灶与器官的空间关系,CVR启发的组合性推理方法有望辅助诊断系统在数据匮乏时仍保持高精度。该基准还为人机交互中的智能辅导系统提供了评估框架,用于检验AI在非语言推理测试中的表现。
衍生相关工作
CVR数据集的提出衍生了一系列富有影响力的研究工作。在模型架构方面,SCL(Scattering Compositional Learner)与WReN(Wild Relational Network)等经典视觉推理模型被系统评估,并催生了结合卷积骨干与关系推理模块的混合架构(如SCL-ResNet),该组合在CVR上展现出超越纯Transformer或纯卷积模型的样本效率。在训练策略上,自监督预训练(如MoCo-v3)被证实能显著提升模型在低样本区的表现,推动了视觉表示学习与抽象推理的分离研究。此外,课程学习(curriculum learning)与反向课程学习(reverse curriculum)实验范式被引入,用于量化模型从基本规则到复合规则的迁移能力,这些方法论为后续研究如何构建更高效的推理系统提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务