遇见数据集

open-llm-leaderboard-old/details_athirdpath__NSFW_DPO_Noromaid-7b

收藏
Hugging Face2023-12-13 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在评估模型athirdpath/NSFW_DPO_Noromaid-7b时自动生成的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和展示在Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型athirdpath/NSFW_DPO_Noromaid-7b时自动生成的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和展示在Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

该数据集是在对模型 athirdpath/NSFW_DPO_Noromaid-7b 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。数据集包含 63 个配置,每个配置对应一个评估任务。

数据集结构

  • 创建来源:数据集从 1 次运行中创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • 训练分割:"train" 分割始终指向最新的结果。
  • 结果配置:一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_athirdpath__NSFW_DPO_Noromaid-7b", "harness_winogrande_5", split="train")

最新结果

以下是 2023-12-13T11:49:19.833498 运行的最新结果:

python { "all": { "acc": 0.6307501582947606, "acc_stderr": 0.03259733263931875, "acc_norm": 0.6368306168876743, "acc_norm_stderr": 0.03325789211362751, "mc1": 0.29008567931456547, "mc1_stderr": 0.01588623687420952, "mc2": 0.44993493459502887, "mc2_stderr": 0.014562901933937895 }, "harness|arc:challenge|25": { "acc": 0.5870307167235495, "acc_stderr": 0.014388344935398326, "acc_norm": 0.6262798634812287, "acc_norm_stderr": 0.014137708601759086 }, "harness|hellaswag|10": { "acc": 0.6461860187213703, "acc_stderr": 0.004771751187407022, "acc_norm": 0.8449512049392551, "acc_norm_stderr": 0.0036121146706989786 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.33, "acc_stderr": 0.04725815626252605, "acc_norm": 0.33, "acc_norm_stderr": 0.04725815626252605 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.5925925925925926, "acc_stderr": 0.04244633238353227, "acc_norm": 0.5925925925925926, "acc_norm_stderr": 0.04244633238353227 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6578947368421053, "acc_stderr": 0.03860731599316091, "acc_norm": 0.6578947368421053, "acc_norm_stderr": 0.03860731599316091 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.56, "acc_stderr": 0.04988876515698589, "acc_norm": 0.56, "acc_norm_stderr": 0.04988876515698589 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6754716981132075, "acc_stderr": 0.02881561571343211, "acc_norm": 0.6754716981132075, "acc_norm_stderr": 0.02881561571343211 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7430555555555556, "acc_stderr": 0.03653946969442099, "acc_norm": 0.7430555555555556, "acc_norm_stderr": 0.03653946969442099 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.47, "acc_stderr": 0.05016135580465919, "acc_norm": 0.47, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.53, "acc_stderr": 0.05016135580465919, "acc_norm": 0.53, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.4, "acc_stderr": 0.04923659639173309, "acc_norm": 0.4, "acc_norm_stderr": 0.04923659639173309 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6127167630057804, "acc_stderr": 0.03714325906302065, "acc_norm": 0.6127167630057804, "acc_norm_stderr": 0.03714325906302065 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.49019607843137253, "acc_stderr": 0.04974229460422817, "acc_norm": 0.49019607843137253, "acc_norm_stderr": 0.04974229460422817 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.74, "acc_stderr": 0.04408440022768078, "acc_norm": 0.74, "acc_norm_stderr": 0.04408440022768078 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5702127659574469, "acc_stderr": 0.03236214467715564, "acc_norm": 0.5702127659574469, "acc_norm_stderr": 0.03236214467715564 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.4824561403508772, "acc_stderr": 0.0470070803355104, "acc_norm": 0.4824561403508772, "acc_norm_stderr": 0.0470070803355104 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5586206896551724, "acc_stderr": 0.04137931034482757, "acc_norm": 0.5586206896551724, "acc_norm_stderr": 0.04137931034482757 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.4074074074074074, "acc_stderr": 0.025305906241590632, "acc_norm": 0.4074074074074074, "acc_norm_stderr": 0.025305906241590632 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4126984126984127, "acc_stderr": 0.04403438954768176, "acc_norm": 0.4126984126984127, "acc_norm_stderr": 0.04403438954768176 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.38, "acc_stderr": 0.04878317312145632, "acc_norm": 0.38, "acc_norm_stderr": 0.04878317312145632 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7451612903225806, "acc_stderr": 0.024790118459332208, "acc_norm": 0.7451612903225806, "acc_norm_stderr": 0.024790118459332208 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5123152709359606, "acc_stderr": 0.035169204442208966, "acc_norm": 0.5123152709359606, "acc_norm_stderr": 0.035169204442208966 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.67, "acc_stderr": 0.04725815626252607, "acc_norm": 0.67, "acc_norm_stderr": 0.04725815626252607 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7575757575757576, "acc_stderr": 0.03346409881055953, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.03346409881055953 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7626262626262627, "acc_stderr": 0.0303137105381989, "acc_norm": 0.7626262626262627, "acc_norm_stderr": 0.0303137105381989 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8652849740932642, "acc_stderr": 0.02463978909770944, "acc_norm": 0.8652849740932642, "acc_norm_stderr": 0.02463978909770944 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6307692307692307, "acc_stderr": 0.02446861524147892, "acc_norm": 0.6307692307692307, "acc_norm_stderr": 0.02446861524147892 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.34444444444444444, "acc_stderr": 0.02897264888484427, "acc_norm": 0.34444444444444444, "acc_norm_stderr": 0.0289726488848442

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_athirdpath__NSFW_DPO_Noromaid-7b 数据集图片
构建方式
该数据集是在Open LLM Leaderboard评估框架下,对athirdpath/NSFW_DPO_Noromaid-7b模型进行自动化评测过程中生成的。数据集由63个配置构成,每个配置对应一个评估任务,涵盖ARC挑战、HellaSwag、GSM8K、WinoGrande、TruthfulQA以及涵盖57个学科的MMLU基准测试等。数据源自单次运行,每次运行的结果以时间戳命名的分割形式存储于各配置中,其中“train”分割始终指向最新结果。此外,数据集还包含一个名为“results”的额外配置,用于聚合所有运行结果,并计算Open LLM Leaderboard上展示的汇总指标。
使用方法
用户可通过HuggingFace的datasets库便捷地加载该数据集。例如,使用`load_dataset`函数指定数据集名称和具体任务配置(如“harness_winogrande_5”),并选择“train”分割以获取最新评估结果。每个配置内的时间戳分割允许回溯历史运行数据,满足不同分析需求。加载后的数据可直接用于复现模型评估、分析模型在特定任务上的表现短板,或作为基准对比其他模型的评测结果。
背景与挑战
背景概述
在大规模语言模型(LLM)能力评估领域,Open LLM Leaderboard 由 Hugging Face 团队于2023年创建,旨在为社区提供一个标准化、透明化的模型性能比较平台。该数据集源自对模型 athirdpath/NSFW_DPO_Noromaid-7b 的自动评估运行,记录了其在63个不同任务配置上的详细表现,涵盖推理、常识、数学及多学科知识等多个维度。其核心研究问题在于通过统一评测基准,揭示模型在多样化场景下的泛化能力与局限性,从而推动开源LLM的迭代优化。该数据集不仅为模型开发者提供了细粒度的性能反馈,也为领域内后续研究树立了可复现的评估范式,对理解模型行为与能力边界具有重要参考价值。
当前挑战
该数据集面临的核心挑战来自两方面。其一,在领域问题层面,评估任务覆盖了从基础推理(如ARC挑战)到专业学科(如医学、法学)的广泛范畴,但模型在数学推理(GSM8K准确率仅35.86%)和部分伦理判断任务(如道德场景准确率22.57%)上表现薄弱,凸显了LLM在复杂逻辑与价值观对齐方面的深层困境。其二,在构建过程中,由于评估结果依赖于单次运行,且不同任务间配置参数(如样本数量k值)存在差异,导致结果的可重复性与跨任务可比性面临潜在风险;同时,数据集仅记录最新运行结果,历史版本的管理机制尚未完善,为纵向追踪模型性能演化增添了难度。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard对模型athirdpath/NSFW_DPO_Noromaid-7b的评测记录,涵盖了63个配置项,每个配置对应一项标准评估任务,如ARC挑战、HellaSwag、GSM8K、MMLU及TruthfulQA等。研究者通过加载该数据集,可复现模型在自然语言推理、常识推理、数学问题求解及多学科知识问答等经典基准上的表现,从而系统性地衡量模型的语言理解与生成能力。
解决学术问题
该数据集解决了大语言模型性能标准化评估中结果可复现性与透明性不足的核心问题。通过结构化存储模型在多样化任务上的逐项得分与统计误差,为学术社区提供了可靠的基准参照。其意义在于推动模型间公平比较,揭示模型在不同认知维度(如逻辑推理、事实准确性、知识广度)上的优势与局限,进而指导后续模型优化方向。
实际应用
在实际应用中,该数据集为模型选型与部署决策提供了量化依据。开发者可依据该数据集中的细分任务表现,判断模型在特定场景(如教育问答、医疗咨询、法律文本分析)下的适用性。例如,高MMLU得分暗示模型具备广泛的世界知识,而GSM8K得分则反映其数学推理能力,这些指标直接指导模型在智能客服、教育辅助等产品中的落地选择。
数据集最近研究
最新研究方向
在大型语言模型(LLM)性能评估领域,Open LLM Leaderboard已成为衡量模型综合能力的重要基准平台。该数据集记录了NSFW_DPO_Noromaid-7b模型在63项任务上的详细评估结果,涵盖ARC挑战、HellaSwag、GSM8K、TruthfulQA以及涵盖57个学科的MMLU测试等前沿评估体系。当前研究热点聚焦于通过DPO(直接偏好优化)等对齐技术提升模型在推理、常识理解和事实准确性方面的表现,同时探索模型在敏感内容处理上的边界。该模型在HellaSwag上达到84.5%的标准化准确率,但在GSM8K数学推理任务中仅获35.9%,揭示了当前7B参数级别模型在复杂推理能力上的显著瓶颈。这一系统性评估为后续研究提供了关键参照,推动了模型安全性与实用性并重的发展方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务