遇见数据集

him1411/problemathic

收藏
Hugging Face2024-06-27 更新2024-06-12 收录
官方服务:

资源简介:

ProbleMathic数据集是在研究论文《Investigating the Robustness of LLMs on Math Word Problems》中引入的。该数据集包含从现有数据集中精选的数学文字问题(MWPs),并根据解决方案的复杂性进行划分。数据集分为简单和复杂的问题集。简单问题集包含仅需单一数学操作即可完全解决的问题,而复杂问题集则需要多步推理和多个数学操作才能获得最终答案。此外,ProbleMathic还包括简单和复杂问题集中所有问题的对抗性变体。这些对抗性变体包含无关的数值信息,但保持原问题的完整性,即它们的解决方案和最终答案与非对抗性变体相同。这些样本用于评估模型在添加噪声情况下的推理能力的鲁棒性。

The ProbleMathic Dataset is designed to evaluate the robustness of Large Language Models (LLMs) on Math Word Problems (MWPs). The dataset is categorized into Simple and Complex problems based on the solution complexity. Simple problems require a single mathematical operation, while Complex problems involve multi-step reasoning and multiple operations. Additionally, the dataset includes adversarial variants of these problems, which contain irrelevant numerical information but maintain the same solution and final answer as their non-adversarial counterparts. This is intended to test the models ability to handle noise. The dataset is split into different configurations for training and testing, each with its own CSV files.

提供机构:
him1411
原始信息汇总

数据集概述

本数据集包含多个配置,每个配置对应不同的数据文件,具体如下:

配置一:Simple Adversarial

  • 训练数据simple_adversarial_train.csv
  • 测试数据simple_adversarial_test.csv

配置二:Simple Non Adversarial

  • 训练数据simple_non_adversarial_train.csv
  • 测试数据simple_non_adversarial_test.csv

配置三:Complex Adversarial

  • 训练数据complex_adversarial_train.csv
  • 测试数据complex_adversarial_test.csv

配置四:Complex Non Adversarial

  • 训练数据complex_non_adversarial_train.csv
  • 测试数据complex_non_adversarial_test.csv

配置五:GSM-8k-Adv

  • 测试数据gsm-8k-adv.csv

数据集大小

  • 数据量级:1K<n<10K

许可证

  • 许可证类型:MIT
搜集汇总
数据集介绍
构建方式
ProbleMathic数据集源自研究论文《Investigating the Robustness of LLMs on Math Word Problems》,旨在评估大语言模型在数学应用题上的鲁棒性。该数据集基于现有数学应用题资源,按照解题复杂度划分为简单和复杂两类:简单问题仅需单一数学运算即可求解,而复杂问题则需多步推理与多种运算。进一步地,每类问题均衍生出对抗性变体,这些变体通过嵌入无关数值信息来增加噪声,同时保持原问题的解答一致。数据集以CSV格式提供,包含GSM 8k、简单对抗、简单非对抗、复杂对抗和复杂非对抗等多个配置,每个配置下又细分为训练集和测试集,便于分场景使用。
特点
ProbleMathic数据集的核心特色在于其双维度结构:一是按解题复杂度区分简单与复杂问题,二是为每个问题创建对抗性与非对抗性版本。这种设计使得研究者能够系统性地考察模型在面临无关信息干扰时,其数学推理能力的稳健性。对抗性样本的引入尤为关键,它们在不改变问题本质答案的前提下,通过添加冗余数值来模拟现实世界中的信息噪声,从而揭示模型是否真正理解问题逻辑或仅依赖表面模式。数据集规模适中,介于1千至1万样本之间,兼顾了实验效率与统计可靠性。
使用方法
使用ProbleMathic数据集时,研究者可通过Hugging Face的`load_dataset`函数直接加载,例如指定配置名称为'GSM 8k'、'Simple Adversarial'等,以获取对应的训练和测试分割。每个配置下的CSV文件包含原始问题及其对抗性变体,便于进行对比实验。建议在评估模型时,分别测试非对抗性和对抗性版本,以量化模型对噪声的鲁棒性。此外,数据集采用MIT许可证,允许自由使用与修改,但需引用原始论文。研究者还可结合官方GitHub仓库中的代码和基线结果,进一步复现或扩展实验。
背景与挑战
背景概述
在自然语言处理领域,数学应用题(MWPs)的求解能力被视为评估大语言模型(LLMs)逻辑推理与数值计算能力的重要基准。然而,现有数据集多聚焦于问题本身的语义复杂性,而忽视了模型在面对无关数值信息扰动时的鲁棒性。ProbleMathic数据集由Ujjwala Anantheswaran、Himanshu Gupta等研究人员于2024年提出,旨在系统性地探究LLMs在数学推理任务中的脆弱性。该数据集基于GSM8K等经典资源构建,按求解步骤将问题划分为简单(单步运算)与复杂(多步推理)两类,并创新性地引入对抗性变体——在保持原题语义与答案不变的前提下,添加无关数值信息以模拟现实场景中的噪声干扰。这一设计不仅深化了对模型推理边界的理解,也为后续鲁棒性研究提供了标准化评估工具,对推动数学推理领域的安全性与可靠性具有重要价值。
当前挑战
ProbleMathic数据集所面临的挑战主要源于两方面。其一,在领域问题层面,现有LLMs对数学应用题的推理能力普遍表现出对无关信息的脆弱性,即模型易被表面语义干扰而忽略核心逻辑,导致在对抗性样本上性能显著下降。这一现象揭示了当前模型在噪声环境中维持稳定推理的深层短板,亟需更具鲁棒性的架构或训练策略。其二,在构建过程中,如何在不改变原题解决方案的前提下,自然且合理地嵌入无关数值信息成为关键难题。研究者需确保对抗性变体既不会引入额外歧义,也不会因过度设计而偏离真实应用场景,这对数据标注的精确性与领域知识的严谨性提出了极高要求。
常用场景
经典使用场景
ProbleMathic数据集专为评估大语言模型(LLMs)在数学应用题(MWPs)上的推理鲁棒性而设计。其核心特色在于将问题按解法复杂度划分为简单(单步运算)与复杂(多步推理)两类,并针对每一类精心构造了对抗性变体——在问题中植入无关数值信息,却保持原题的解法和最终答案不变。这一设计允许研究者系统性地考察模型在面临噪声干扰时,其数学推理能力是否依然稳健,从而为探究语言模型在结构化推理任务中的脆弱性与适应性提供了标准化的测试基准。
衍生相关工作
基于ProbleMathic,研究者已开展多项衍生工作,例如探索通过提示工程或对抗训练来提升模型鲁棒性的方法。其论文《Investigating the Robustness of LLMs on Math Word Problems》本身即为该领域的奠基性工作,后续研究进一步将其与GSM8K、SVAMP等经典数据集结合,构建更全面的评估体系。此外,该数据集催生了针对数学推理中“虚假相关性”与“捷径学习”现象的深入分析,推动了可解释性研究与鲁棒性基准的统一,成为连接数学推理与对抗性机器学习的重要桥梁。
数据集最近研究
最新研究方向
当前,大语言模型在数学推理任务中的鲁棒性成为前沿焦点,ProbleMathic数据集应运而生。该数据集通过构建简单与复杂两类数学应用题,并引入包含无关数值的对抗性样本,系统评估模型在噪声干扰下的推理稳定性。这一研究方向直击LLMs在现实应用中因信息冗余导致性能下降的痛点,为提升模型在复杂数学问题中的抗干扰能力提供了标准化测试基准。其意义在于推动从静态准确率向动态鲁棒性的评估范式转变,进而促进教育智能辅导、自动化推理等场景下更可靠的语言模型发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务