VPBench
收藏资源简介:
VPBench是由加州大学伯克利分校团队构建的大规模视觉提示基准数据集,包含35,088张标注图像,涵盖相对深度估计(VPBench-RD)和语义对应(VPBench-SC)两大任务。该数据集通过整合DA2k和SPair等现有资源,采用16种视觉标记变体(如形状、颜色、大小和标签位置差异)增强评估鲁棒性,旨在解决视觉语言模型(VLM)在低层次视觉感知任务中因细微设计变化导致的性能波动问题。其数据来源包括密集几何标注的深度图像和语义关键点匹配对,通过标准化BLINK的提示格式重构而成,为评估模型对空间关系和物体识别的真实感知能力提供了更稳定的测试平台。
VPBench is a large-scale visual prompt benchmark dataset constructed by the team at the University of California, Berkeley. It contains 35,088 annotated images, covering two core tasks: relative depth estimation (VPBench-RD) and semantic correspondence (VPBench-SC). This dataset enhances evaluation robustness by integrating existing resources such as DA2k and SPair, and adopting 16 visual token variants including differences in shape, color, size, and label placement. It aims to address performance fluctuations of Vision-Language Models (VLMs) in low-level visual perception tasks caused by subtle design changes. Its data sources include densely geometrically annotated depth images and semantic key point matching pairs, which are reconstructed by standardizing the prompt format of BLINK. This dataset provides a more stable testbed for evaluating models' true perceptual capabilities regarding spatial relationships and object recognition.
数据集概述:VPBench
数据集基本信息
- 数据集名称:VPBench
- 主要目的:作为一个视觉提示基准,旨在以更大的数据集规模(约10倍于BLINK等基准的数据量)来更稳定地评估视觉语言模型(VLM)的纯视觉能力,减少因数据集规模小、视觉标记设计差异等因素导致的排名不稳定性。
- 核心任务:包含两项视觉提示任务:
- 相对深度(Rel. Depth)
- 语义对应(Sem. Corr.)
数据集背景与动机
- 研究背景:现有视觉提示基准(如BLINK)存在脆弱性,微小的设计变更(如标记样式、JPEG压缩率)会导致模型准确率显著变化并重新排序排行榜。
- 创建动机:为了解决因数据集规模小导致的置信区间过宽和排名不稳定问题,并提供一个更稳健的评估基准。
关键特性与发现
- 数据集规模:VPBench每个任务的数据集样本量约为BLINK的10倍,从而具有更小的置信区间。
- 不稳定性来源验证:
- 数据集规模:即使从VPBench中随机抽取与BLINK规模相当的数据子集(100个样本),模型在不同子集上的排名也会出现显著差异。
- 标记样式:视觉标记的颜色、形状、大小、文本位置等细微变化会导致模型准确率发生巨大、模型特定的偏移和排名洗牌。通过策略性地选择标记样式,可以操纵排行榜。
- JPEG压缩:对人类不可察觉的JPEG压缩率等数值差异,会导致视觉提示任务的模型排名发生明显变化,而在传统基准上排名则更稳定。
数据集作用与建议
- 主要作用:提供更大规模的数据以收紧置信区间,减少评估噪声,使排行榜更能反映模型视觉理解能力的真实进展。
- 核心建议:当评估置信区间较宽时,需要更多的评估数据。VPBench的发布旨在帮助缓解此问题。




