遇见数据集

joey234/mmlu-high_school_mathematics-original-neg-prepend

收藏
Hugging Face2023-05-09 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: question dtype: string - name: choices sequence: string - name: answer dtype: class_label: names: '0': A '1': B '2': C '3': D - name: neg_prompt dtype: string splits: - name: test num_bytes: 15849 num_examples: 29 download_size: 15984 dataset_size: 15849 --- # Dataset Card for "mmlu-high_school_mathematics-original-neg-prepend" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 字段名:问题(question),数据类型:字符串(string) - 字段名:选项列表(choices),数据类型:字符串序列 - 字段名:答案(answer),数据类型:分类标签(class_label),其标签映射规则为: '0': A '1': B '2': C '3': D - 字段名:否定提示词(neg_prompt),数据类型:字符串(string) 数据集划分: - 划分名称:测试集(test),字节占用量:15849,样本总数:29 下载大小:15984 数据集总存储大小:15849 --- # 「mmlu-high_school_mathematics-original-neg-prepend」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
joey234
原始信息汇总

数据集概述

数据集名称

mmlu-high_school_mathematics-original-neg-prepend

数据集特征

  • question: 字符串类型
  • choices: 字符串序列
  • answer: 分类标签,具体为:
    • 0: A
    • 1: B
    • 2: C
    • 3: D
  • neg_prompt: 字符串类型

数据集分割

  • test:
    • 数据大小: 15849 字节
    • 示例数量: 29

数据集大小

  • 下载大小: 15984 字节
  • 数据集大小: 15849 字节
搜集汇总
数据集介绍
joey234/mmlu-high_school_mathematics-original-neg-prepend 数据集图片
构建方式
该数据集源自MMLU基准测试中高中数学子集的原始数据,通过引入负向提示(neg_prompt)字段进行重构。每个样本包含一道数学选择题(question)、四个选项(choices)及正确答案(answer),并额外附加一个否定性前缀(neg_prompt),旨在模拟模型在对抗性干扰下的推理能力。数据集仅保留测试集,共29个示例,以轻量化设计聚焦于特定难度的数学问题评估。
特点
数据集的核心特色在于其负向提示机制,通过向标准问答对中添加具有误导性或否定性的前置文本,挑战语言模型在语义干扰下的逻辑一致性。高中数学选题覆盖代数、几何等核心领域,难度适中但需精确推理。仅29条样本的紧凑规模使其适合快速验证模型鲁棒性,而四选一的标准化格式便于自动化评估与对比。
使用方法
使用时,可将question与neg_prompt拼接作为模型输入,要求模型从choices中预测正确选项(A-D)。典型应用场景包括测试模型对否定性上下文的敏感度或作为对抗性样本的基准。建议结合原始MMLU数据集进行对比实验,以量化负向提示对推理准确率的影响。评估指标推荐采用准确率(accuracy),并记录模型在每道题上的输出分布以分析偏差模式。
背景与挑战
背景概述
大规模多任务语言理解(MMLU)基准测试是评估大型语言模型在广泛学科领域内知识掌握与推理能力的重要标杆,其涵盖从人文社科到自然科学等数十个领域。joey234/mmlu-high_school_mathematics-original-neg-prepend数据集聚焦于高中数学这一特定学科,旨在通过精心设计的负向提示(neg_prompt)策略,探究模型在面对具有误导性或反向引导的输入时,能否维持稳健的数学推理与答案选择能力。该数据集由研究人员于近期构建,核心研究问题在于揭示语言模型在复杂、对抗性语境下的逻辑脆弱性,从而推动模型鲁棒性与安全性的提升。尽管仅包含29个测试样本,但其对理解模型在数学领域受干扰时的表现具有独特价值,为后续优化提示工程与模型校准提供了关键参考。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:高中数学问题虽标准化但逻辑严密,模型需在对抗性提示下准确识别正确答案,这要求其不仅具备扎实的数学知识,还需避免被负向引导所误导,这对当前语言模型的语义理解与鲁棒性构成严峻考验。其次,构建过程中挑战显著:原始MMLU高中数学子集样本有限,而设计有效的负向提示需确保语义上合理且具有迷惑性,同时避免引入歧义或违背数学事实;此外,仅29个样本的测试集规模限制了统计显著性,难以全面评估模型在不同难度与题型下的表现,增加了泛化能力验证的难度。
常用场景
经典使用场景
在自然语言处理与认知科学交叉领域,该数据集聚焦于高中数学选择题的推理能力评估,其经典使用场景在于检验大语言模型在数学逻辑推理与否定提示干扰下的鲁棒性。通过将原始MMLU子集转化为带有否定前缀的文本形式,研究者可系统探究模型对否定语义的敏感性,为理解语言模型在数学语境中的错误模式提供标准化的测试基准。这一设计使得该数据集成为评估数学推理中语言干扰效应的关键工具。
实际应用
在实际应用中,该数据集可用于教育科技领域的智能辅导系统,帮助检测模型在复杂数学问题中的错误倾向,从而优化自适应学习算法的纠错机制。此外,它还能服务于人机对话系统的安全验证,确保在涉及数学计算的场景中,模型不会因语言修饰(如否定表达)而输出误导性答案。这种测试范式对金融、工程等依赖精确计算的行业尤为重要。
衍生相关工作
该数据集衍生了多项关于否定推理与数学语言理解的前沿工作,例如基于对比学习的否定感知训练方法,以及针对否定提示的注意力机制改进方案。相关研究还扩展至多语言数学推理场景,探索不同语言中否定结构对模型表现的差异化影响。这些工作共同推动了对抗性数据增强在数学推理领域的系统化应用,为后续构建更严谨的评估体系铺设了理论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务