遇见数据集

qijimrc/CoMDataset

收藏
Hugging Face2024-06-15 更新2024-06-22 收录
官方服务:

资源简介:

我们开源了**自动合成的CoM数据**和**手动注释的CoM-Math数据**,以促进潜在的研究。自动合成的CoM数据(即`com.jsonl`)包含84K个正向推理链,这些数据是通过一个自动化数据生成管道生成的,该管道使用了基于GPT-4的语言模型生成语言解决步骤,并基于VFMs(如GroundingDINO和PaddleOCR)进行视觉证据补偿。我们在TextVQA的验证集上运行了相同的管道,构建了一个包含8K推理链的证据推理基准(即`com_test.jsonl`),以验证推理路径的正确性。我们进一步手动注释了7K个高质量的几何问题样本(即`com_math.jsonl`),并提供了证据推理过程,以推动视觉语言模型在解决复杂数学问题方面的研究。这些数据集的parquet格式副本已放置在*data/*文件夹中,便于使用HuggingFace的*load_dataset()*函数加载。

我们开源了**自动合成的CoM数据**和**手动注释的CoM-Math数据**,以促进潜在的研究。自动合成的CoM数据(即`com.jsonl`)包含84K个正向推理链,这些数据是通过一个自动化数据生成管道生成的,该管道使用了基于GPT-4的语言模型生成语言解决步骤,并基于VFMs(如GroundingDINO和PaddleOCR)进行视觉证据补偿。我们在TextVQA的验证集上运行了相同的管道,构建了一个包含8K推理链的证据推理基准(即`com_test.jsonl`),以验证推理路径的正确性。我们进一步手动注释了7K个高质量的几何问题样本(即`com_math.jsonl`),并提供了证据推理过程,以推动视觉语言模型在解决复杂数学问题方面的研究。这些数据集的parquet格式副本已放置在*data/*文件夹中,便于使用HuggingFace的*load_dataset()*函数加载。

提供机构:
qijimrc
原始信息汇总

数据集概述

基本信息

  • 数据集名称: CoM
  • 语言: 英语
  • 许可证: CC BY-SA 4.0
  • 多语言性: 单语种
  • 数据集大小: 7K<n<100K
  • 源数据集: 原始数据
  • 任务类别: 视觉问答 (Visual Question Answering)
  • 任务ID: 视觉问答 (Visual Question Answering)
  • 标签: 视觉推理, 操作链, 视觉问答, 多模态问答, 几何推理, 科学, 合成视觉问答数据

数据集配置

  • 默认配置:
    • 数据文件:
      • com: data/com.parquet
      • com_test: data/com_test.parquet
      • com_math: data/com_math.parquet

数据集信息

  • 特征:
    • pid: 问题ID (int64)
    • image_path: 图像路径 (string)
    • decoded_image: 解码图像 (image)
    • question: 问题 (string序列)
    • answer: 答案 (string)
    • com_founds: 找到的金答案的树节点 (string序列)
    • final_com: 最终的操作链 (string)
  • 分割:
    • com: 15207834 字节, 80827 样本
    • com_test: 1304599 字节, 4518 样本
    • com_math: 268245404 字节, 6998 样本
  • 下载大小: 9646018515 字节
  • 数据集大小: 284757837 字节

数据集描述

  • 自动合成CoM数据: 包含84K正向推理链,由自动化数据生成管道产生,基于LLM(GPT-4)的语言解决步骤生成和VFMs(GroundingDINO, PaddleOCR)的视觉证据补偿。
  • 手动注释CoM-Math数据: 包含7K高质量几何问题样本,带有证据推理过程。

数据示例

  • 自动合成数据: 包含80827个问题,产生84K推理链。
  • 自动合成测试数据: 包含4518个问题,产生8K推理链。
  • 手动注释数学数据: 包含6998个问题,产生7K推理链。

数据格式

  • 每个样本包含:
    • pid: 问题ID
    • image_path: 图像路径
    • question: 问题文本
    • answer: 正确答案
    • com_founds: 找到金答案的树节点
    • final_com: 当前操作链的详细信息
    • cropped: 是否使用CropZoomIn操作

数据来源

  • CoM和CoM-test: 源自ST-VQA, TextVQA, TDIUC数据集。
  • CoM-Math: 源自MathVista数据集,并进一步手动注释。

许可证

  • 新贡献: 遵循CC BY-SA 4.0许可证。
  • 版权: 图像、问题和答案的版权归原作者所有。
  • 用途: 主要用于训练集和测试集。
  • 商业用途: 可用于商业目的的训练集和测试集。

引用

  • BibTeX:

    @article{qi2024cogcom, title={CogCoM: Train Large Vision-Language Models Diving into Details through Chain of Manipulations}, author={Qi, Ji and Ding, Ming and Wang, Weihan and Bai, Yushi and Lv, Qingsong and Hong, Wenyi and Xu, Bin and Hou, Lei and Li, Juanzi and Dong, Yuxiao and Tang, Jie}, journal={arXiv preprint arXiv:2402.04236}, year={2024} }

搜集汇总
数据集介绍
qijimrc/CoMDataset 数据集图片
构建方式
在视觉与语言交叉研究的广阔领域中,推理链条的构建一直是提升模型可解释性的关键挑战。CoMDataset的构建融合了自动化合成与人工精细标注两种互补策略。自动化合成部分依托于大规模公开VQA样本,通过GPT-4生成语言层面的解题步骤,再借助GroundingDINO与PaddleOCR等视觉基础模型进行视觉证据补偿,最终产出包含84K正向推理链的CoM数据集。针对几何数学这一高难度领域,研究团队进一步对MathVista数据集进行人工标注,精心打造了包含7K高质量样本的CoM-Math数据集,以确保推理过程的准确性与严谨性。
特点
该数据集最显著的特征在于其层次化的操作链条结构,每条样本均记录了从问题到答案的完整推理路径,包含操作函数、参数、边界框及文本描述等细粒度信息。数据集包含三个子集:CoM、CoM-test与CoM-Math,分别服务于训练、评估与数学推理研究。其数据来源横跨ST-VQA、TextVQA、TDIUC及MathVista等多个公开基准,确保了视觉场景的多样性。此外,每个推理节点均标注了“found”字段以指示答案是否被发现,为模型的可解释性评估提供了坚实基础。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,仅需调用`load_dataset("qijimrc/CoMDataset")`即可获得包含com、com_test与com_math三个分区的Dataset对象。数据以parquet格式存储,支持高效读取。每条样本以JSON格式呈现,包含pid、image_path、question、answer等核心字段,以及描述推理链的final_com结构。研究者可利用可视化脚本`/cogcom/data/utils/visualize.ipynb`直观查看推理链条,便于定性分析。数据遵循CC BY-SA 4.0许可协议,允许商业用途,但需尊重原图、问题与答案的版权归属。
背景与挑战
背景概述
在视觉语言模型(VLM)领域,如何使模型具备细粒度、可解释的推理能力一直是研究的核心难题。由清华大学研究团队于2024年提出的CoMDataset(Chain-of-Manipulations Dataset),旨在通过构建结构化的操作链推理路径,推动VLM从简单的视觉问答迈向深层的视觉推理。该数据集由自动合成与人工标注两部分构成:自动合成部分基于GPT-4生成语言推理步骤,并借助GroundingDINO、PaddleOCR等视觉基础模型补偿视觉证据,从ST-VQA、TextVQA、TDIUC等公开数据集中提炼出约8.4万条正向推理链;人工标注部分则聚焦于几何数学问题,从MathVista中精选约7000个样本并逐条标注推理过程。CoMDataset的提出,为评估和训练VLM在复杂视觉场景中的多步推理能力提供了标准化基准,对推动可解释、可追溯的视觉推理研究具有里程碑意义。
当前挑战
CoMDataset所应对的核心挑战在于,现有视觉语言模型在处理需要多步逻辑推演与视觉证据定位的复杂任务时,往往仅依赖表面特征匹配,缺乏对操作序列与因果关系的建模能力。该数据集通过引入操作链(Chain-of-Manipulations)机制,要求模型在回答问题时显式地生成一系列视觉操作步骤(如裁剪、缩放、定位、识别等),从而将推理过程透明化。在构建过程中,自动合成面临两大技术难点:一是如何确保LLM生成的推理步骤与视觉证据高度一致,避免语言与视觉的断裂;二是如何从海量公开VQA数据中高效筛选出适合构建操作链的样本,并保证推理链的完备性与无冗余性。人工标注的几何数学部分则受限于专业知识的稀缺性,标注者需同时具备几何推理能力与数据标注经验,使得大规模高质量标注的成本极高。此外,数据集在跨领域泛化性上仍存在局限,当前样本主要集中于文本丰富的场景与几何图形,对于纯自然场景的复杂推理覆盖不足。
常用场景
经典使用场景
在视觉语言模型(VLM)的研究中,CoMDataset被经典地用于训练和评估模型在多模态推理任务中的表现,特别是在需要精细视觉操作与逻辑链构建的场景中。该数据集通过自动化管道合成84K条正向推理链(CoM),并结合手动标注的7K几何数学问题(CoM-Math),为模型提供了从视觉证据提取到因果推理的完整训练材料。研究者常利用其结构化推理链(如“操作-参数-边界框-描述”的节点序列)来训练模型执行诸如局部放大、文本识别、空间关系推断等细粒度视觉操作,从而验证模型在复杂多步推理中的准确性。此外,CoM-test子集(8K链)被用作基准测试,以评估推理路径的正确性,成为衡量VLM逻辑连贯性的关键指标。
衍生相关工作
CoMDataset衍生了一系列关于多模态推理链建模的经典工作。其核心论文《CogCoM: Train Large Vision-Language Models Diving into Details through Chain of Manipulations》首次系统定义了“操作链”概念,并提出了基于LLM和VFM的自动化数据合成框架,启发了后续如“Visual Chain-of-Thought”与“Stepwise VQA”等研究方向。研究者基于该数据集进一步探索了推理链的树状结构优化(如动态节点剪枝)与跨模态对齐损失函数设计。此外,CoM-Math子集推动了数学视觉推理专项数据集的构建热潮,例如后续出现的“GeoQA+”、“MathVista”等基准均借鉴了其多步推理标注范式。在模型层面,CogCoM的架构设计(如可微分操作模块)也被扩展至多轮对话与具身智能任务中,成为连接视觉感知与符号推理的桥梁性工作。
数据集最近研究
最新研究方向
在当前视觉语言模型(VLM)领域,复杂多步推理与几何数学问题的可解释性成为前沿热点。CoMDataset通过引入“操作链”(Chain of Manipulations, CoM)机制,开创性地将视觉证据补偿与语言推理步骤相结合,为多模态问答提供了结构化、可溯源的推理路径。该数据集不仅包含基于GPT-4与视觉基础模型自动合成的84K正向推理链,还针对几何数学难题人工标注了7K高质量样本,显著推动了VLM在科学推理与数学问题求解中的能力边界。其与TextVQA等基准的衔接,为评估模型在细粒度视觉定位与逻辑推导上的表现树立了新标杆,对推动可解释、高精度多模态智能系统的发展具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务