MMIS
收藏资源简介:
MMIS数据集由MSA大学创建,专注于多模态室内场景的视觉生成和识别。该数据集包含近160,000张图像,每张图像附有对应的文本描述和音频记录,涵盖多种室内风格和布局。数据集的创建过程包括图像收集、文本描述生成和语音注释,旨在支持图像生成、检索、标注和分类等多模态表示学习任务。MMIS数据集的应用领域广泛,特别是在室内设计图像的分析和生成方面,旨在通过多模态信息融合解决实际问题。
The MMIS dataset was developed by MSA University, focusing on visual generation and recognition of multimodal indoor scenes. This dataset contains nearly 160,000 images, each paired with corresponding textual descriptions and audio recordings, covering diverse indoor styles and layouts. The dataset construction workflow includes image collection, textual description generation and speech annotation, which is designed to support multimodal representation learning tasks such as image generation, retrieval, annotation and classification. The MMIS dataset has broad application prospects, particularly in the analysis and generation of interior design images, aiming to address practical problems through multimodal information fusion.
Interior-Scene 数据集概述
摘要
MMIS 是一个新颖的多模态数据集,旨在推动场景生成和识别的研究。该数据集包含图像、文本和语音三种不同的模态。每个图像都附有相应的文本描述和该描述的音频录音,为场景生成和识别提供了丰富多样的信息源。数据集涵盖了广泛的室内空间,捕捉了各种风格、布局和家具。为了构建这个数据集,我们采用了精心设计的流程,包括图像收集、文本描述生成和相应的语音注释。该数据集有助于多模态表示学习任务的研究,如图像生成、检索、描述和分类。
数据集分类
数据集包含一个广泛的分类体系,涵盖超过30个类别,每个类别进一步细分为特定的子类别,如客厅、卧室、浴室、餐厅和厨房。
每个类别包含的内容
- 图像:捕捉场景本质的视觉表现。
- 文本描述:提供关于所描绘环境的详细见解和叙述。
- 音频叙述:伴随文本描述的音频录音,提供多达六种不同声音的多种解释。
这种全面的结构使得可以深入探索各种室内场景,促进跨多个领域的研究和应用,如场景生成、识别和多模态表示学习。

- 1MMIS: Multimodal Dataset for Interior Scene Visual Generation and RecognitionMSA大学 · 2024年



