遇见数据集

JefferyZhan/Language-prompted-Localization-Dataset

收藏
Hugging Face2024-07-11 更新2024-03-04 收录
官方服务:

资源简介:

Griffon Language-prompted Localization数据集是一个用于视觉问答和对象检测任务的数据集,主要语言为英语。数据集的规模在100M到1B之间。数据集包含预训练数据和指令数据,预训练数据包括Visual Genome、MSCOCO和Objects365-2023的图像和注释,指令数据包括flickr30K Entities的图像。数据集的许可证为Attribution-NonCommercial 4.0 International,并需遵守OpenAI的政策。

The Griffon Language-prompted Localization dataset is designed for visual question answering and object detection tasks, primarily in English. The dataset size ranges between 100M and 1B. It includes pre-training data and instruction data. The pre-training data consists of images and annotations from Visual Genome, MSCOCO, and Objects365-2023, while the instruction data includes images from flickr30K Entities. The dataset is licensed under Attribution-NonCommercial 4.0 International and must comply with OpenAIs policies.

提供机构:
JefferyZhan
原始信息汇总

数据集许可证

  • 许可证类型: CC BY-NC 4.0
搜集汇总
数据集介绍
JefferyZhan/Language-prompted-Localization-Dataset 数据集图片
构建方式
Language-prompted Localization Dataset 由 Griffon 团队在 ECCV2024 上提出,旨在支持基于语言提示的视觉定位任务。其构建融合了多个公开数据集:预训练阶段采用 Visual Genome、MSCOCO(train2014 与 train2017)以及 Objects365-2023 的图像与注释,其中 Visual Genome 和 RefCOCO 系列的注释参考 Shikra 进行了格式转换,Objects365 的注释则经过筛选优化;MSCOCO train2017 的原始注释直接使用。指令数据阶段额外引入 flickr30K Entities 图像以构建 1vN 场景。此外,数据集还包含由 ChatGPT(基于 GPT-4V)生成的指令提示模板,如 1v1.json 用于 Referring Expression Comprehension(REC),NvN.json 用于目标检测,从而形成多粒度、多任务的定位数据体系。
特点
该数据集的核心特点在于其语言驱动的多粒度定位能力与大规模覆盖。总规模介于 100M 至 1B 之间,涵盖从单一对象到复杂场景的多样化定位需求,支持 Referring Expression Comprehension 和目标检测两大任务。通过集成 Visual Genome、MSCOCO、Objects365 和 flickr30K Entities 等广泛使用的基准数据集,确保了数据来源的丰富性与标准化。指令提示模板由 GPT-4V 生成,增强了语言指令的多样性与自然度,使得模型能够根据任意粒度的语言描述定位所有对象位置。数据集采用 cc-by-nc-4.0 许可,适用于非商业研究场景。
使用方法
使用该数据集时,首先需从官方渠道下载 Visual Genome、MSCOCO、Objects365 和 flickr30K Entities 的原始图像。预训练阶段可直接使用提供的转换注释(Visual Genome、RefCOCO 系列)以及 MSCOCO train2017 的原始注释,并搭配 template 文件夹中的指令模板(1v1.json 用于 REC,NvN.json 用于目标检测)。指令数据阶段需额外加载 flickr30K Entities 图像以处理 1vN 定位任务。所有注释与模板文件均需与对应图像配对,通过标准的数据加载管线输入模型。具体实现可参考 Griffon 的官方代码仓库(GitHub),其中包含数据预处理与训练流程的详细说明。
背景与挑战
背景概述
在计算机视觉与自然语言处理交叉领域,基于语言提示的视觉定位任务要求模型能够精准理解自然语言描述并定位图像中对应目标,这对多模态大语言模型的发展提出了更高要求。JefferyZhan/Language-prompted-Localization-Dataset(简称LLD)由中国科学院自动化研究所的Zhan Yufei、Zhu Yousong等研究人员于2023年提出,其核心研究问题是构建一个大规模、多粒度的语言提示定位数据集,以支持模型从短语级引用表达理解(REC)到目标检测的泛化能力。该数据集作为Griffon模型(ECCV 2024录用)的官方数据支撑,融合了Visual Genome、MSCOCO、Objects365和flickr30K Entities等经典数据集的标注,并通过ChatGPT(GPT-4V驱动)生成指令模板,显著推动了视觉定位领域从单一任务向统一多任务框架的演进,对多模态大模型在细粒度视觉理解方面的研究具有深远影响。
当前挑战
当前LLD数据集面临的核心挑战涵盖领域问题与构建过程两方面。在领域问题层面,语言提示定位任务需解决自然语言歧义性与视觉目标多样性之间的映射鸿沟,例如同一描述可能对应不同粒度目标(如“红色汽车”与“左侧的红色汽车”),而现有标注体系难以覆盖所有复杂场景的语义边界。在构建过程中,数据集整合了来自多个异构源的数据(如Visual Genome的密集区域标注、MSCOCO的实例分割掩码、Objects365的类别级框标注),其格式转换与标注一致性(如边界框坐标系统、类别映射关系)需要复杂的后处理流程,且依赖GPT-4V生成的指令模板可能存在语言偏差或覆盖不足的问题。此外,数据规模超过1亿样本,对存储、加载和模型训练效率构成了显著挑战,而cc-by-nc-4.0许可证也限制了其在商业场景中的进一步应用与扩展。
常用场景
经典使用场景
Language-prompted Localization Dataset(简称LPLD)是专为语言引导的视觉定位任务设计的大规模多模态数据集,其经典使用场景聚焦于结合自然语言描述与目标检测的交叉领域。该数据集通过构建指令提示模板(如1v1.json用于指代表达理解REC,NvN.json用于目标检测),实现了从粗粒度物体识别到细粒度空间定位的跨越。研究者可借助LPLD训练模型,使其能够根据任意自然语言描述(如“红色汽车右侧的蓝色水杯”)精准输出目标边界框,这一能力在视觉问答、人机交互和自动驾驶等场景中具有基石性作用。
衍生相关工作
LPLD作为Griffon模型(ECCV 2024)的核心数据集,衍生了一系列经典工作:Griffon本身首次在大语言模型中实现了任意粒度、多目标的语言引导定位,其提出的“语言提示定位”范式被后续研究广泛沿用。基于该数据集,研究者进一步开发了区域级视觉语言预训练方法(如RegionCLIP的改进版)、开放词汇检测的指令微调策略(如GLIP的扩展),以及多模态对话系统中的空间推理模块。此外,LPLD的指令模板生成方法(利用GPT-4V自动化构建细粒度定位指令)启发了后续多个指令微调数据集的构建范式,如LLaVA的定位版本和Shikra的升级版。
数据集最近研究
最新研究方向
在视觉与语言交叉领域,精准定位与细粒度理解成为前沿热点。JefferyZhan/Language-prompted-Localization-Dataset作为ECCV 2024收录的Griffon项目核心数据资源,聚焦于通过语言提示驱动任意粒度下的目标定位任务。该数据集整合了Visual Genome、MSCOCO、Objects365及flickr30K Entities等大规模标注数据,并创新性地引入ChatGPT生成的指令模板,以支持指代表达理解(REC)与目标检测(OD)的联合训练。这一方向呼应了多模态大模型在开放世界场景中实现“所见即所得”的迫切需求,尤其为具身智能、自动驾驶等需要精准空间推理的应用提供了关键训练基础。其提出的语言提示范式不仅推动了视觉定位的泛化能力,更在细粒度交互理解上树立了新标杆,对促进人机协同的智能系统发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务