Diagram Image-Caption Dataset
收藏资源简介:
本研究构建了一个名为“Diagram Image-Caption Dataset”的人工合成数据集,包含10万对图像和文本描述。数据集旨在消除文本和位置偏置,以便视觉模型能够学习到图像中的边缘特征。该数据集是通过从随机生成的有向图中生成图像和Mermaid风格的文本描述来构建的。每个样本都配有一张图像和一个文本描述,描述一个包含不同数量字母标签节点的有向图。该数据集用于通过对比学习对CLIP模型进行微调,并在三个任务上进行评估:线性探测、图像检索和图表描述。研究结果证实,消除文本和位置偏置可以促进视觉模型准确识别边缘特征,为提高图表理解能力提供了有希望的道路。
This study constructed a synthetic dataset named "Diagram Image-Caption Dataset", which contains 100,000 pairs of images and text captions. The dataset aims to eliminate text and positional biases, enabling visual models to learn edge features from images. It is constructed by generating images and Mermaid-style text descriptions from randomly generated directed graphs. Each sample consists of an image and a text caption describing a directed graph with nodes labeled with letters of varying quantities. This dataset is used for fine-tuning the CLIP model via contrastive learning, and is evaluated on three tasks: linear probing, image retrieval, and diagram captioning. The research results confirm that eliminating text and positional biases can help visual models accurately identify edge features, paving a promising path for improving diagram understanding capabilities.

- 1Can Visual Encoder Learn to See Arrows?株式会社日立制作所, 京都产业大学, 岐阜大学 · 2025年



