遇见数据集

Mike33/PolyChartQA

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

PolyChartQA-Test是PolyChartQA的测试分割部分,这是一个用于图表问答的多语言多模态基准数据集。它旨在评估视觉语言模型是否能理解图表图像、阅读多语言图表文本、基于视觉证据回答问题,并在不同语言中执行数值推理。数据集包含10种语言(阿拉伯语、孟加拉语、英语、西班牙语、法语、印地语、日语、俄语、乌尔都语和中文)的图表图像、结构化图表注释、图表生成代码和问答注释,覆盖16种图表类型(如条形图、线图、饼图等)。数据集结构包括图像、JSON注释、代码和问答注释文件,总共有22,606张图表图像和26,151个问答对。数据集的创建过程包括从现有资源中选择种子示例、翻译和验证,并经过多步质量控制。

数据集名称:PolyChartQA-Test 语言:阿拉伯语、孟加拉语、英语、西班牙语、法语、印地语、日语、俄语、乌尔都语、中文 任务类别:视觉问答 任务子类型:视觉问答 规模类别:10000 < 样本数 < 100000 许可协议:其他 标签:图表问答、图表理解、多语言、多模态、视觉语言模型(vision-language models)、基准测试 # PolyChartQA-Test PolyChartQA-Test 是 PolyChartQA 的测试划分集,后者是一个面向图表问答的多语言多模态基准测试集。该基准旨在评估视觉语言模型(vision-language models)能否理解图表图像、读取多语言图表文本、基于视觉证据锚定问题,并在不同语言间开展数值推理。 本数据集包含10种语言的图表图像、结构化图表标注、图表生成代码以及问答标注。发布版本以原生文件格式存储于`PolyChartQA-Test/`目录下。 ## 关于 图表被广泛用于传递定量信息,但现有多数图表理解基准主要聚焦于英语场景。PolyChartQA-Test 旨在评估多语言环境下的图表问答性能,覆盖高资源与低资源语言、多种书写系统以及多样化的图表类型。 每个数据样本均关联以下内容: - 渲染后的图表图像 - 结构化JSON图表标注 - 用于渲染图表的Python代码 - 一个或多个自然语言问答对 该基准覆盖10种语言:阿拉伯语、孟加拉语、英语、西班牙语、法语、印地语、日语、俄语、乌尔都语及中文。涵盖16种图表类型:`3d-bar`(三维柱状图)、`area`(面积图)、`bar`(柱状图)、`box`(箱线图)、`bubble`(气泡图)、`candlestick`(K线图)、`funnel`(漏斗图)、`heatmap`(热图)、`histogram`(直方图)、`line`(折线图)、`multi-axes`(多轴图)、`pie`(饼图)、`radar`(雷达图)、`rings`(环形图)、`rose`(玫瑰图)及`treemap`(树状图)。 ## 数据集结构 针对每个语言子目录: | 路径 | 描述 | | --- | --- | | `image/` | PNG格式的渲染后图表图像 | | `json/` | 结构化图表标注与数据值 | | `code/` | 用于渲染或复现图表的Python脚本 | | `qa/annotations.jsonl` | 对应语言的标准问答标注 | 文件名前缀相同的文件通常对应同一张图表,例如: text PolyChartQA-Test/en/image/01499440003158.png PolyChartQA-Test/en/json/01499440003158.json PolyChartQA-Test/en/code/01499440003158.py ## 数据统计 PolyChartQA-Test 共包含22606张图表图像与26151组问答对。 ### 按语言分布 | 语言名称 | 语言代码 | 图表数量 | 问答对数量 | | --- | ---: | ---: | ---: | | 阿拉伯语 | `ar` | 2139 | 2496 | | 孟加拉语 | `bn` | 2297 | 2695 | | 英语 | `en` | 2917 | 3080 | | 西班牙语 | `es` | 2379 | 2802 | | 法语 | `fr` | 2304 | 2694 | | 印地语 | `hi` | 2452 | 2886 | | 日语 | `ja` | 1893 | 2195 | | 俄语 | `ru` | 2124 | 2519 | | 乌尔都语 | `ur` | 2284 | 2680 | | 中文 | `zh` | 1817 | 2104 | | **总计** | - | **22606** | **26151** | ### 按图表类型分布 | 图表类型 | 图表数量 | 问答对数量 | | --- | ---: | ---: | | 折线图(line) | 5065 | 6963 | | 柱状图(bar) | 4870 | 6362 | | 直方图(histogram) | 1733 | 1733 | | 漏斗图(funnel) | 1508 | 1508 | | 箱线图(box) | 1465 | 1465 | | 热图(heatmap) | 1459 | 1459 | | 饼图(pie) | 1420 | 1565 | | 环形图(rings) | 863 | 863 | | 面积图(area) | 766 | 776 | | 树状图(treemap) | 757 | 757 | | K线图(candlestick) | 644 | 644 | | 多轴图(multi-axes) | 537 | 537 | | 玫瑰图(rose) | 534 | 534 | | 气泡图(bubble) | 408 | 408 | | 三维柱状图(3d-bar) | 310 | 310 | | 雷达图(radar) | 267 | 267 | | **总计** | **22606** | **26151** | ## 数据实例 `qa/annotations.jsonl`中的每一行均为表示单个图表问答实例的JSON对象。一个典型的英语实例如下: json { "imgname": "01499440003158.png", "image_path": "image/01499440003158.png", "language": "en", "query": "What is the value of Slovenia in the graph?", "label": "1", "chart_type": "bar", "source_dataset": "chartqa", "split": "human", "qa_id": "01499440003158_en_001", "qa_level": "Retrieval" } 其中`image_path`字段为相对于对应语言子目录的相对路径。以上述示例为例,完整的图像路径为`PolyChartQA-Test/en/image/01499440003158.png`。 ## 数据字段 | 字段名 | 字段描述 | | --- | --- | | `imgname` | 图像文件名 | | `image_path` | 相对于语言子目录的图像路径 | | `language` | 语言代码 | | `query` | 目标语言的问题文本 | | `label` | 标准答案 | | `chart_type` | 图表类型标签 | | `source_dataset` | 作为种子样本的源基准数据集 | | `split` | 可用时的原始源划分 | | `qa_id` | 问答对唯一标识符 | | `qa_level` | 推理类别,例如检索、比较、算术或趋势分析 | | `matched_en_query` | 可用时的对齐英语问题 | | `matched_en_label` | 可用时的对齐英语答案 | | `matched_en_qa_id` | 可用时的对齐英语问答标识符 | ## 数据集构建 PolyChartQA-Test 通过多语言图表生成与验证流水线构建而成。 首先,从现有图表问答资源中选取英语种子样本,并通过答案验证、答案标准化以及人工审核完成数据清洗。随后,每个保留的图表均以结构化JSON格式与可执行的基于Plotly的Python代码进行表示,从而支持在渲染图像之外对图表进行检视。 接下来,将图表文本与问答对翻译为目标语言,同时保留数值、图表语义以及问答对的对齐关系。翻译后的结构化图表标注与可复用的渲染代码相结合,生成对应语言的图表图像。 本次发布版本经过了多轮质量控制流程,包括代码执行检查、视觉保真度检查、问答有效性检查、回译一致性检查、语义验证以及针对文本裁剪、重叠与错位等渲染问题的人工检视。 ## 评估方式 PolyChartQA-Test 专为图表问答任务设计。给定一张图表图像与对应目标语言的问题,模型应输出目标语言的简短答案或数字形式的结果。 推荐使用的评估指标为类型感知宽松准确率(type-aware relaxed accuracy)。数值预测若与标准答案的相对误差在5%以内,则判定为正确;非数值预测则通过归一化精确匹配进行评估。 代表性基准测试结果显示,顶尖的闭源与开源视觉语言模型仍存在显著的多语言图表理解差距。OCR错误、语言偏见以及算术推理错误是常见的失效模式,在非英语与非拉丁文字脚本的图表场景中尤为突出。 ## 预期用途 PolyChartQA-Test 可用于以下方向的研究: - 多语言图表问答 - 面向图表的视觉语言模型评估 - 多语言OCR与视觉文本锚定 - 图表相关的数值与符号推理 - 多模态系统的跨语言鲁棒性 ## 局限性 PolyChartQA-Test 覆盖10种语言与16种图表类型,但并未涵盖所有语言、书写系统、可视化风格或真实世界的图表领域。本数据集源自现有图表问答资源,可能继承了这些资源的主题或标注偏见。尽管已应用翻译与渲染验证流程,但仍可能存在细微的翻译偏差或图表定位误差。 ## 许可协议 本数据集的许可协议目前标记为`other`(其他)。用户在进行公开或商业使用前,应核实源衍生数据的最终再分发条款。 ## 引用方式 若您使用PolyChartQA-Test,请引用以下文献: bibtex @misc{xu2026polychartqa, title = {PolyChartQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering}, author = {Yichen Xu and Liangyu Chen and Liang Zhang and Zihao Yue and Jianzhe Ma and Wenxuan Wang and Qin Jin}, year = {2026} }

提供机构:
Mike33
搜集汇总
数据集介绍
Mike33/PolyChartQA 数据集图片
构建方式
PolyChartQA的构建源于一套精密的多语言图表生成与质量验证流程。首先,研究者从现有的图表问答资源中精选英文种子样本,经过答案校验、标准化处理及人工审查后,利用可执行的Plotly Python代码为每个图表构建结构化的JSON注解,从而使数据表示兼具可复现性与可检视性。随后,图表中的文本及问答对在保留数值准确性与语义一致性的前提下,被翻译至目标语言,并基于翻译后的结构化注解与复用代码重新生成了对应语言的图表图像。整个数据集经历了代码执行、视觉逼真度、问答有效性、反向翻译一致性、语义正确性及文本裁剪与重叠等渲染问题的多重质量控制,确保了数据的高可靠性。
特点
该数据集的核心特色在于其多语言、多类型及多维度标注的深度融合。PolyChartQA覆盖了阿拉伯语、孟加拉语、英语、汉语等10种语言,囊括了折线图、柱状图、饼图、热力图等16种图表类型,共计22,606张图表图像与26,151个问答对。每个数据实例不仅包含图表图像,还提供了结构化的JSON注解、生成图表的Python代码以及标注了推理类别(如检索、比较、算术、趋势)的问答对,从而为模型评估提供了丰富的语义与逻辑层次。其语言与图表类型的多样性,使得该数据集成为测度视觉语言模型在多语言环境下图表理解能力的理想基准。
使用方法
使用PolyChartQA进行评测时,研究者需向模型输入一张图表图像及一个同语言的自然语言问题,模型则应输出目标语言中的简短答案或数字。官方推荐采用类型感知的宽松准确率作为评估指标:对数值型预测,若相对误差在5%以内则视为正确;对非数值型预测,则采用标准化精确匹配。数据集以语言子目录形式组织,每个目录包含图像、JSON注解、代码及问答注释文件,便于按需加载。研究者可基于此基准系统性地评估模型在多语言OCR、视觉文本定位、数值推理及跨语言鲁棒性等方面的表现,从而揭示当前视觉语言模型在非英语及非拉丁文字图表上的性能短板。
背景与挑战
背景概述
图表作为量化信息传播的核心媒介,在金融、科研、教育等领域发挥着不可替代的作用。然而,现有图表理解基准大多局限於英语环境,忽视了全球多语言用户的实际需求。PolyChartQA数据集由Yichen Xu、Liangyu Chen等研究者于2026年提出,旨在填补多语言图表问答领域的评估空白。该基准涵盖阿拉伯语、孟加拉语、中文等10种语言与16种图表类型,包含22,606幅图表图像及26,151个问答对,通过结构化标注、可执行代码与严格的质量控制流程构建。PolyChartQA的发布为视觉语言模型在多语言、多脚本场景下的图表理解能力提供了标准化测试平台,显著推动了跨语言多模态研究的进展。
当前挑战
PolyChartQA所解决的核心领域问题在于,多语言图表理解要求模型同时具备视觉文本识别、空间关系推理与数值计算能力,而现有模型在非英语与异形文字图表上的表现普遍不佳,OCR错误、语言偏见与算术推理失误成为主要失败模式。构建过程中面临的挑战包括:如何从英语种子数据出发,通过翻译与渲染生成语言特定图表并确保数值与语义一致性;如何设计涵盖折线图、热力图等16种图表类型的多样化样本;以及如何实施代码执行、回译验证与人工检查等多重质量控制,以消除文本裁剪、重叠与错位等渲染缺陷。这些挑战的克服确保了基准的可靠性与跨语言可比性。
常用场景
经典使用场景
在视觉语言模型飞速发展的当下,图表理解作为多模态智能的重要一环,其跨语言能力日益成为关注的焦点。PolyChartQA作为首个覆盖10种语言、16种图表类型的多语言图表问答基准数据集,被广泛用于评测视觉语言模型在多语言情境下的图表理解能力。研究者在零样本或微调设置下,基于图表图像与对应自然语言问题,要求模型输出短文本或数值答案,从而评估其在多语种OCR、视觉文本锚定、数值推理等维度上的综合表现。这一评测范式为追踪模型在多语言场景下的实际推理瓶颈提供了标准化的实验平台。
衍生相关工作
围绕PolyChartQA,学术界已衍生出多项富有影响力的工作。研究者基于其结构化JSON标注和对应渲染代码,发展出针对图表数据的多语言可控生成技术;另有一部分工作利用该基准中的QA层级标签(检索、比较、算术、趋势),精细化剖析视觉语言模型在多步推理环节的语言特异性缺陷。此外,PolyChartQA也成为检验跨语言图表翻译一致性、回译鲁棒性等数据增强方法的权威评测集,有力催化了多语言图表理解与多模态大语言模型对齐领域的深入研究。
数据集最近研究
最新研究方向
当前的大语言模型和视觉-语言模型在处理多语言图表理解任务时面临显著挑战,尤其是非英语、非拉丁语系的文字识别、数值推理与文化语境理解的融合仍存在瓶颈。PolyChartQA作为首个覆盖10种语言、16种图表类型的多语种图表问答基准,精准定位了这一前沿研究方向。该数据集通过结构化的图表注释、可复现的生成代码及跨语言QA对,系统评估了模型在文本定位、多语OCR、数字运算与跨语言鲁棒性上的表现。其发布正值多模态模型在全球应用场景加速拓展的关键时期,对于推动多语言视觉理解技术的公平性、包容性与实际落地具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务