遇见数据集

Zhihan/Chart2NCode

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是ACL 2026主会议论文Aligned Multi-View Scripts for Universal Chart-to-Code Generation的官方数据集,专注于图像文本到文本的任务,特别是图表到代码的生成和多模态推理。数据集规模在10万到100万之间,主要语言为英语。

This repository is the official dataset for Aligned Multi-View Scripts for Universal Chart-to-Code Generation, accepted by ACL 2026 Main Conference. The dataset focuses on image-text-to-text tasks, particularly chart-to-code generation and multimodal reasoning. It is primarily in English and ranges in size between 100K and 1M.

提供机构:
Zhihan
搜集汇总
数据集介绍
Zhihan/Chart2NCode 数据集图片
构建方式
Chart2NCode是一个面向图表到代码生成任务的多语言数据集,其构建过程强调多视角脚本的对齐。数据集中每一张图表图像均配有三种编程语言的等价绘制脚本——Python(matplotlib)、R(ggplot2)和LaTeX(pgfplots),且确保这些脚本在视觉上生成完全一致的图表输出。这种对齐策略通过精细的后处理与校验流程实现,从而保证跨语言脚本之间的语义等价性与渲染一致性。数据集包含约176K个样本,其中训练集约175K条,测试集1K条,数据规模适中,适用于训练与评估各类视觉-语言模型。
使用方法
Chart2NCode的使用方式简洁高效,开发者可通过HuggingFace的datasets库直接加载。只需一行代码即可获取完整数据集,示例中展示了如何从训练集中提取样本,包括图像与对应的Python、R、LaTeX代码。该数据集适用于图表代码生成、跨语言代码翻译、多模态模型微调等下游任务。论文还开源了基于该数据集训练的CharLuMA系列模型(1.3B与6.7B参数),可作为基线或预训练模型直接使用,进一步降低了应用门槛。
背景与挑战
背景概述
Chart2NCode是由Zhihan Zhang与Lizi Liao等研究人员在2026年创建的大规模图表到代码生成数据集,随ACL 2026论文《Aligned Multi-View Scripts for Universal Chart-to-Code Generation》一同发布。该数据集填补了多语言图表代码对齐领域的空白,核心研究问题在于如何实现从同一张图表图像生成Python(matplotlib)、R(ggplot2)和LaTeX(pgfplots)三种等价的可视化脚本,从而促进图表理解的跨语言泛化。通过提供约17.5万训练样本与1000条测试样本,Chart2NCode不仅为多模态推理与代码生成提供了标准基准,更推动了视觉语言模型在图表到代码任务上的统一评估,在自然语言处理与可视化交叉领域产生了重要影响。
当前挑战
Chart2NCode所解决的领域挑战在于,现有图表到代码数据集通常仅支持单一编程语言,无法衡量模型在跨语言环境下生成语义一致代码的能力,限制了可视化代码生成的通用性与实用性。在构建过程中,确保Python、R和LaTeX三种脚本渲染出视觉上完全等价的图表是核心难点,这要求精确的坐标对齐、风格映射与语法转换,同时需要大规模人工校验和自动一致性检测。此外,不同脚本语言在图形元素(如图例、坐标轴标注)的默认设置上存在差异,标准化这一过程对数据质量与扩展性提出严峻挑战,也为后续模型在真实场景下的鲁棒应用设定了较高门槛。
常用场景
经典使用场景
在数据可视化和多模态理解交叉领域,Chart2NCode作为一项开创性资源,被广泛用于训练和评估跨语言图表到代码生成模型。其经典用法在于,给定一张渲染完成的图表图像,研究者期望模型能够同时生成功能对等的Python(Matplotlib)、R(ggplot2)和LaTeX(pgfplots)脚本。这种三视图对齐设计不仅消除了单一编程语言偏好的局限,更迫使模型深入理解图表的视觉语义——从坐标轴刻度的空间分布到图例颜色的语义映射——并将这些视觉线索转化为精确的语法结构。该数据集尤其适合构建统一的多语言图表编程助手,为学术探索提供了标准化的训练与测试基准。
解决学术问题
该数据集精准回应了图表理解领域长期存在的两大关键问题:一是不同编程语言生成的图表代码难以统一评估与对比,二是现有数据集大多只提供单一语言的图表-代码对,导致模型的语言泛化能力严重不足。Chart2NCode通过提供严格对齐的多语言脚本,使研究者能够首次在同一视觉输入下,系统比较不同语言在图表生成中的表现差异,并探索跨语言的代码迁移学习机制。其意义在于,推动图表生成任务从单一语言范式向通用语言理解迈进,为探索图表视觉与代码语法之间的深层映射关系奠定了数据基础,极大促进了多模态推理与代码生成两个研究方向的融合。
实际应用
在实际应用层面,Chart2NCode为众多依赖图表与代码交互的领域提供了强大支撑。它可以赋能智能办公系统,使非技术用户仅凭一张图表截图即可自动生成可编辑的源代码,实现图表的快速复现与定制化修改。在数据科学教育中,该数据集可作为教学辅助工具,帮助学生对比不同语言下的可视化实现方式,深化对数据表达逻辑的理解。同时,其多语言特性也使其成为跨平台开发环境中的理想组件,支持科研人员、工程师和数据分析师在Matplotlib、ggplot2和pgfplots之间无缝切换,显著提升图表编程效率与协作流畅度。
数据集最近研究
最新研究方向
Chart2NCode数据集聚焦于图表到代码生成的前沿方向,通过为每张图表图像对齐Python(matplotlib)、R(ggplot2)和LaTeX(pgfplots)三种主流绘图脚本,推动了多语言代码生成的统一研究。该数据集在ACL 2026发表,与大型视觉语言模型CharLuMA协同工作,显著提升了多模态推理中图表结构化到代码转换的准确性与跨语言一致性。当前研究热点在于利用此类对齐数据集减少编程语言间的语义鸿沟,服务于自动化数据可视化、教育与科研图表复现,其与多模态大模型的结合为智能体自主编写可视化代码开辟了新路径,对自然语言界面和计算文档生成具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务