遇见数据集

CdSprites+

收藏
arXiv2023-11-24 更新2024-07-24 收录
官方服务:

资源简介:

CdSprites+数据集是由捷克理工大学布拉格信息、机器人与控制论研究所创建的合成图像-文本数据集,旨在评估多模态变分自编码器(VAE)的生成能力。该数据集包含5个不同复杂度级别,每个级别根据特征数量(如形状、大小、颜色、位置和背景)进行区分。CdSprites+数据集支持快速数据生成和易于评估,适用于逐步增加复杂度以评估模型进展。此外,数据集的结构化设计允许自动化定性和定量评估,从而为多模态VAE模型的系统比较提供了有力工具。

The CdSprites+ dataset is a synthetic image-text dataset developed by the Institute of Information, Robotics and Cybernetics, Czech Technical University in Prague, with the goal of evaluating the generative capabilities of multimodal variational autoencoders (VAEs). This dataset comprises five distinct complexity levels, each distinguished by the number of features including shape, size, color, position and background. The CdSprites+ dataset enables rapid data generation and straightforward evaluation, making it suitable for assessing model progress through incrementally escalating complexity. Furthermore, the structured design of the dataset supports automated qualitative and quantitative evaluation, thus providing a robust tool for the systematic comparison of multimodal VAE models.

创建时间:
2022-09-07
原始信息汇总

CdSprites+ 数据集概述

数据集描述

CdSprites+ 是一个用于多模态变分自编码器(VAE)比较的合成双模态(图像-文本)数据集。该数据集扩展了 dSprites 数据集,增加了自然语言描述和额外的特征,共有5个难度级别,每个级别基于不同的属性数量(形状、大小、颜色、位置和背景颜色)。

数据集结构

数据集分为5个难度级别,每个级别包含图像和相应的文本描述。图像和文本数据按照语义匹配的方式组织。

数据集下载

数据集可以通过以下链接下载不同难度级别的版本:

下载后,数据集应放置在 ./data/CdSpritesplus 目录中。

数据集生成

用户也可以自行生成数据集。生成所有级别的命令如下: bash cd ~/multimodal-vae-comparison/multimodal_compare/data_proc python ./cdSprites.py

生成特定级别的命令如下: bash cd ~/multimodal-vae-comparison/multimodal_compare/data_proc python ./cdSprites.py --level 4

数据集使用

数据集用于训练和评估多模态VAE模型。训练和评估的具体步骤在文档中有详细说明。

数据集评估

训练完成后,可以使用以下命令进行评估: bash cd ~/multimodal-vae-comparison/multimodal_compare python eval/eval_cdsprites.py --model model_dir_name --level 2

评估结果将显示在终端中,并保存为 cdsprites_stats.txt 文件。

数据集领导者板

数据集的领导者板展示了不同模型在CdSprites+数据集上的表现。每个模型都有相应的预训练权重和配置文件,可以用于复现结果。

Level 1

Pos. Model Obj. Accuracy (Txt→Img) [%] Accuracy (Img→Txt) [%] Joint Accuracy [%] Weights Config
1. MMVAE ELBO 47(14) 64 (3) 17 (10) Link Link
2. MVAE ELBO 52 (3) 63 (8) 5 (9) Link Link
3. MoPoE ELBO 33 (3) 10 (17) 16 (27) Link Link
4. DMVAE ELBO 33 (4) 4 (5) 4 (6) Link Link

Level 2

Pos. Model Obj. Accuracy (Txt→Img) [%] Accuracy (Img→Txt) [%] Joint Accuracy [%] Weights Config
1. MVAE ELBO 16 (1) 55 (27) 1 (1) Link Link
2. MMVAE ELBO 18 (4) 41 (20) 3 (3) Link Link
3. MoPoE ELBO 10 (3) 8 (7) 1 (1) Link Link
4. DMVAE ELBO 15 (2) 4 (1) 0 (0) Link Link

Level 3

Pos. Model Obj. Accuracy (Txt→Img) [%] Accuracy (Img→Txt) [%] Joint Accuracy [%] Weights Config
1. MVAE ELBO 10 (1) 30 (10) 1 (1) Link Link
2. MMVAE ELBO 12 (2) 25 (10) 2 (2) Link Link
3. MoPoE ELBO 8 (2) 5 (5) 1 (1) Link Link
4. DMVAE ELBO 9 (1) 3 (1) 0 (0) Link Link
搜集汇总
数据集介绍
CdSprites+ 数据集图片
构建方式
CdSprites+数据集是在单模态dSprites数据集基础上扩展而来的双模态图像-文本数据集。其构建过程首先定义了三种几何形状(心形、方形、椭圆)、两种尺寸、五种纹理颜色、四个象限位置及两种背景色调,形成240种独特的特征组合。数据集包含五个难度等级,从仅变化形状的Level 1逐步增加到同时变化形状、尺寸、颜色、位置和背景的Level 5。图像以64x64像素的RGB格式呈现,文本描述则采用字符级编码,每个描述包含1至8个单词,按固定顺序排列(尺寸、颜色、形状、位置、背景颜色),最长句子包含45个字符。数据集的默认版本包含75k至960k个样本,其中10%用于验证。
特点
该数据集的核心特点在于其可扩展的复杂度和自动化评估能力。通过五个难度等级,研究者可以逐步增加模型需要区分的语义域数量,从而精准定位每个模型的性能边界。数据集的刚性结构使得生成的文本可被分词并依据句子位置查找词汇,生成的图像则通过预训练分类器自动评估视觉属性。这种设计支持严格的连贯性评估,包括完全正确样本的百分比(Strict指标)、每样本正确特征的比例(Features指标)以及文本中正确字符的平均百分比(Letters指标)。此外,数据集的合成性质确保了可控的噪声来源(如随机位置、旋转和纹理),避免了真实世界数据中的偏差和主观性。
使用方法
该数据集专为多模态变分自编码器的系统评估而设计,可与配套的工具包协同使用。用户可通过YAML配置文件指定数据集、编码器-解码器架构、多模态融合策略及训练超参数。数据集支持跨模态生成和联合生成任务的自动化评估,其中跨模态生成使用10,000个测试样本,联合生成则通过遍历潜在空间生成32,000个样本。评估结果以Strict、Features和Letters三个层次的准确率呈现,便于对不同模型进行公平比较。用户也可通过工具包中的脚本自定义生成数据,选择难度等级、每类样本数量及具体特征,生成过程仅需标准计算机视觉库,可在CPU上数分钟内完成。
背景与挑战
背景概述
多模态变分自编码器(Multimodal VAEs)近年来成为机器学习领域的研究热点,因其能够将多种模态的数据融合至一个联合潜在表示中,从而在数据分类与生成任务中展现出广阔的应用前景。然而,现有评估体系存在显著不足:常用基准数据集如MNIST、CelebA或CUB并非专为多模态生成模型设计,导致评估标准不一、结论分歧。为应对这一困境,捷克技术大学信息学、机器人学与控制论研究所的Gabriela Sejnova及其团队于2023年提出了CdSprites+数据集。该数据集以dSprites为基础,扩展出包含自然语言描述的双模态结构,并设计了五个递进难度级别,旨在系统性地评估多模态VAE在联合生成与交叉生成方面的能力,为领域内模型比较提供了标准化工具。
当前挑战
CdSprites+数据集所面临的挑战主要体现在两个方面。首先,在领域问题层面,多模态VAE需同时应对联合生成与交叉生成任务的语义一致性难题,现有模型在复杂多特征场景下(如Level 5包含形状、大小、颜色、位置、背景五类属性)生成样本的准确率急剧下降,严格指标下完全正确样本比例趋近于零,暴露出模型在高维解耦表示学习上的瓶颈。其次,在构建过程中,如何平衡数据集的复杂度与可评估性是一大挑战:既要通过递进难度实现模型能力的精细诊断,又要保持合成数据的刚性结构以支持自动化评估,同时避免真实数据中的噪声与偏差干扰。此外,文本模态采用字符级编码而非词级嵌入,虽增强了难度,却对模型的长序列建模能力提出了更高要求。
常用场景
经典使用场景
在多模态变分自编码器(VAE)的研究领域中,CdSprites+数据集被广泛用作评估模型联合生成与跨模态生成能力的基准。该数据集通过精心设计的5个难度层级,逐步增加图像与文本模态间的语义复杂度,从而系统性地检验模型在简单到复杂场景下的表现。研究者常利用其刚性结构,即图像属性与文本描述之间存在一一对应的映射关系,来量化生成样本的语义一致性。例如,通过预训练分类器检测生成图像中的形状、颜色、大小等特征,并与文本中的词汇进行比对,从而精确计算跨模态生成的准确率。这种设计使得CdSprites+成为多模态VAE性能诊断与比较的理想工具,尤其适用于分析模型在解耦表示学习上的优劣。
衍生相关工作
CdSprites+数据集的提出催生了一系列相关研究工作。首先,它被用于系统性地比较MVAE、MMVAE、MoPoE和DMVAE等主流多模态VAE模型,揭示了不同专家融合策略在语义一致性上的差异,其中MVAE在低复杂度层级上表现优异,而所有模型在高复杂度层级上均面临挑战。其次,该数据集促进了自动化评估方法的发展,例如基于预训练分类器的特征级准确率计算和字符级文本重构精度度量。此外,CdSprites+还被整合进多模态VAE基准测试工具包中,支持新模型和新数据集的快速扩展,从而推动了可复现研究文化的建立。这些衍生工作共同强化了多模态生成模型领域的实验规范化进程。
数据集最近研究
最新研究方向
在多模态变分自编码器(VAE)研究领域,模型评估的一致性与标准化问题日益凸显。CdSprites+数据集的提出正是为了应对这一挑战,它通过合成图像与文本的配对设计,提供了五个渐进的难度层级,使研究者能够系统性地评估模型在联合生成与交叉生成任务中的表现。该数据集源自经典的dSprites,但扩展了颜色、纹理、位置和背景等属性,并支持自动化的语义一致性评估,从而避免了真实世界数据中的噪声与偏差。这一前沿方向紧密关联到当前对多模态生成模型可解释性与鲁棒性的追求,其意义在于为模型比较提供了可重复、可量化的基准,推动了MVAE、MMVAE、MoPoE等架构的公平对比,并为未来模型在复杂场景下的泛化能力诊断奠定了基础。
相关研究论文
  • 1
    Benchmarking Multimodal Variational Autoencoders: CdSprites+ Dataset and Toolkit捷克理工大学布拉格信息、机器人与控制论研究所 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务