遇见数据集

Dashboard-Integrity-Guard/test

收藏
Hugging Face2024-06-16 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: config_name: faithful-edits features: - name: image dtype: image - name: file_number dtype: int64 - name: id dtype: string - name: source_code dtype: string - name: number_of_charts_in_dashboard dtype: int64 - name: seed_data_name dtype: string - name: seed_data_stats dtype: string - name: provenance dtype: string - name: provenance_step_types dtype: string - name: provenance_step_costs dtype: string - name: cost dtype: int64 - name: revision_step dtype: string - name: revision_step_function dtype: string - name: parent_source_code dtype: string - name: parent_id dtype: string - name: is_consistent dtype: bool - name: CHANNEL_FIELD_SWAP dtype: bool - name: CHANNEL_FIELD_SHIFT dtype: bool - name: XY_SAME_QUANTITATIVE dtype: bool - name: XY_SAME_NOMINAL dtype: bool - name: XY_MEASURE_NAMES dtype: bool - name: COLOR_SAME_QUANTITATIVE dtype: bool - name: COLOR_DIFF_QUANTITATIVE dtype: bool - name: COLOR_SAME_NOMINAL dtype: bool - name: COLOR_DIFF_NOMINAL dtype: bool - name: COLOR_NOMINAL_VS_QUANTITATIVE dtype: bool - name: COLOR_CONSTANT_VS_NOMINAL dtype: bool - name: COLOR_CONSTANT_VS_QUANTITATIVE dtype: bool - name: SIZE_SAME_QUANTITATIVE dtype: bool - name: SIZE_NO_DIFF dtype: bool - name: SHAPE_SAME_NOMINAL dtype: bool - name: SHAPE_DIFF_NOMINAL dtype: bool - name: SHAPE_CONSTANT dtype: bool - name: source_code_vg dtype: string - name: train_val_test dtype: string splits: - name: train num_bytes: 7170953591.416 num_examples: 10932 download_size: 3015775358 dataset_size: 7170953591.416 configs: - config_name: faithful-edits data_files: - split: train path: faithful-edits/train-* --- # Dataset Card for "test" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

GoodDashboard_Data数据集包含一个名为GoodDashboard.json的文件,其中包含1369个双图表的仪表板,用于可视化汽车数据集。每个仪表板对象详细记录了文件编号、数据集分割信息(70%训练,10%验证,20%测试)、Vega-Lite和Vega格式的源代码、仪表板创建的来源描述和修订步骤,以及一系列规则测试结果和仪表板一致性标签。

原始信息汇总

数据集概述

数据集名称

  • GoodDashboard_Data

数据文件

  • 文件路径: GoodDashboard.json
  • 数据分割:
    • train: GoodDashboard.json

数据集内容

  • 文件: dashboards.zip
    • 格式: [file_number].png 和 [file_number].svg
  • 主要文件: GoodDashboard.json
    • 大小: 包含1369个双图表仪表盘
    • 数据结构: 每个对象包含以下字段:
      • file_number: 整数,零索引
      • train_val_test: 字符串,数据集随机分为70%训练,10%验证,20%测试
      • source_code: 字符串,vega-lite规范的JSON数组
      • source_code_vg: 字符串,vega规范的JSON数组
      • provenance: 字符串,从空白开始创建此仪表盘的模板化文本描述(逐步)
      • revision_step: 字符串,provenance中最新的步骤的模板化文本描述
      • CHANNEL_FIELD_SWAP: 布尔值,规则测试结果
      • CHANNEL_FIELD_SHIFT: 布尔值,规则测试结果
      • XY_SAME_QUANTITATIVE: 布尔值,规则测试结果
      • XY_SAME_NOMINAL: 布尔值,规则测试结果
      • XY_MEASURE_NAMES: 布尔值,规则测试结果
      • is_consistent: 布尔值,仪表盘一致性标签
      • parent_id: 字符串,当前仪表盘前一步的源代码
搜集汇总
数据集介绍
构建方式
该数据集名为Dashboard-Integrity-Guard/test,以'faithful-edits'为主要配置,旨在为数据可视化领域的仪表盘完整性提供评估基准。构建过程中,数据集通过系统化编辑操作生成,每一条样本均包含原始仪表盘图像及其对应的源代码,同时记录了编辑的类型与步骤,例如通道交换、颜色与坐标轴属性的变更等。数据来源涵盖多个种子数据集,并经过严格的一致性检查,确保编辑操作的可追溯性与语义保真度。最终形成包含10932个训练样本的集合,每个样本附带丰富的元数据字段,如父代码、修订步函数及编辑成本,从而支持对仪表盘编辑行为的多维度分析。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,指定配置名为'faithful-edits'以获取训练分片。使用时,图像字段可直接用于视觉模型输入,而源代码字段则适合文本或代码理解模型的训练与评估。数据集中的编辑属性布尔字段可作为多标签分类任务的目标,或用于生成编辑描述的自然语言任务。此外,通过'parent_source_code'与'parent_id'字段,用户可构建编辑序列或进行差异分析,探索仪表盘编辑的因果关系。建议结合'is_consistent'标志筛选高质量样本,以优化模型在真实场景中的鲁棒性。
背景与挑战
背景概述
在数据可视化领域,仪表盘作为信息传递与决策支持的核心载体,其构建质量直接关系到数据洞察的准确性与效率。然而,现有的仪表盘生成技术往往难以确保编辑操作后图表与数据源之间的一致性,导致视觉呈现与底层逻辑之间出现偏差。为应对这一挑战,Dashboard-Integrity-Guard/test数据集应运而生。该数据集由相关研究团队于近期创建,旨在系统性地评估与提升仪表盘编辑过程中数据完整性的保持能力。其核心研究问题聚焦于如何量化与检测图表属性(如颜色、坐标轴、尺寸等)在编辑后是否仍忠实反映原始数据语义。通过对超过一万个仪表盘样本的精细化标注,该数据集为自动化仪表盘验证与修复算法提供了宝贵的基准资源,对推动可视化领域的数据完整性研究具有重要影响力。
当前挑战
该数据集所解决的领域问题在于仪表盘编辑中的语义一致性维护,即确保图表在经历字段交换、属性移位等操作后,其视觉编码与数据映射关系不发生逻辑错误。构建过程中面临的核心挑战包括:第一,如何设计涵盖多种图表属性(如颜色、形状、坐标轴)的编辑操作类型,以模拟真实场景中的复杂编辑行为;第二,需要精确标注每次编辑前后的数据一致性状态,这对自动化标注流程的准确性与可扩展性提出了极高要求;第三,大规模仪表盘图像与源代码数据的收集、清洗与去重过程,需克服不同来源数据格式异构与质量参差不齐的难题。此外,数据集需平衡编辑操作的多样性与样本分布的均衡性,以避免模型训练中的偏差,这进一步增加了构建工作的复杂性。
常用场景
经典使用场景
该数据集聚焦于可视化仪表盘编辑中的语义一致性验证,经典使用场景是评估和训练模型以检测图表编辑是否保持了数据与视觉编码之间的忠实映射。研究者利用其中包含的图像、源代码及多种编辑类型标签(如通道字段交换、颜色属性偏移等),构建基准测试来度量自动化编辑工具在保持图表完整性方面的表现。这一场景尤其适用于数据可视化领域,为探索编辑操作对信息传达准确性的影响提供了标准化数据支撑。
解决学术问题
该数据集解决了可视化编辑中语义一致性评估缺乏标准化基准的学术难题。通过提供带有细致编辑类型标注(如颜色、形状、尺寸等通道的变更)和一致性标签的样本,它使研究者能够系统性地量化编辑操作对图表可读性和数据准确性的影响。这推动了数据可视化与自然语言处理交叉领域的研究,为开发更可靠的自动化仪表盘编辑算法奠定了实证基础,并促进了人机交互中可视化信息保真度的理论探索。
实际应用
在实际应用中,该数据集可被用于优化商业智能工具和数据分析平台的仪表盘编辑功能。例如,它支持训练模型以自动识别并纠正用户编辑中可能引入的误导性视觉编码,从而提升数据报告的可信度。此外,企业可借助该数据集开发智能辅助系统,在用户修改图表时实时提示潜在的一致性风险,降低因可视化错误导致的决策偏差,显著增强数据驱动工作流中的信息完整性。
数据集最近研究
最新研究方向
该数据集聚焦于数据可视化领域中的仪表盘完整性维护与语义编辑一致性研究,其前沿方向在于利用大规模合成编辑轨迹数据,探索可视化图表在编码通道(如颜色、大小、形状)修改后语义保真度的自动评估。结合当前数据叙事与自动化分析工具蓬勃发展的热点,该研究推动了对可视化编辑中潜在语义漂移的量化检测,尤其关注字段交换、度量类型变更等操作是否破坏原始数据意图。其意义在于为构建可信赖的自动化仪表盘优化系统奠定基准,促进可视化推荐与错误修复算法的鲁棒性提升,从而增强数据密集型决策的科学性与透明度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务