遇见数据集

open-llm-leaderboard-old/details_ignos__Mistral-T5-7B-v1

收藏
Hugging Face2023-12-18 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型ignos/Mistral-T5-7B-v1进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在Open LLM Leaderboard上对模型ignos/Mistral-T5-7B-v1进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

该数据集是在对模型 ignos/Mistral-T5-7B-v1 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建。每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的 "results" 配置存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_ignos__Mistral-T5-7B-v1", "harness_winogrande_5", split="train")

最新结果

以下是 2023-12-18T22:23:12.216010 运行的最新结果

python { "all": { "acc": 0.6510340358627315, "acc_stderr": 0.03219580705899945, "acc_norm": 0.6505785757254527, "acc_norm_stderr": 0.03286597373126659, "mc1": 0.4749082007343941, "mc1_stderr": 0.017481446804104003, "mc2": 0.6186054727814434, "mc2_stderr": 0.015105933404370766 }, "harness|arc:challenge|25": { "acc": 0.6646757679180887, "acc_stderr": 0.013796182947785562, "acc_norm": 0.6860068259385665, "acc_norm_stderr": 0.013562691224726302 }, "harness|hellaswag|10": { "acc": 0.6789484166500697, "acc_stderr": 0.00465926395275662, "acc_norm": 0.862975502887871, "acc_norm_stderr": 0.003431704298641855 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.3, "acc_stderr": 0.046056618647183814, "acc_norm": 0.3, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6370370370370371, "acc_stderr": 0.04153948404742398, "acc_norm": 0.6370370370370371, "acc_norm_stderr": 0.04153948404742398 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6842105263157895, "acc_stderr": 0.0378272898086547, "acc_norm": 0.6842105263157895, "acc_norm_stderr": 0.0378272898086547 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.64, "acc_stderr": 0.04824181513244218, "acc_norm": 0.64, "acc_norm_stderr": 0.04824181513244218 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.7056603773584905, "acc_stderr": 0.02804918631569525, "acc_norm": 0.7056603773584905, "acc_norm_stderr": 0.02804918631569525 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7569444444444444, "acc_stderr": 0.03586879280080341, "acc_norm": 0.7569444444444444, "acc_norm_stderr": 0.03586879280080341 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.49, "acc_stderr": 0.05024183937956912, "acc_norm": 0.49, "acc_norm_stderr": 0.05024183937956912 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.55, "acc_stderr": 0.05, "acc_norm": 0.55, "acc_norm_stderr": 0.05 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.33, "acc_stderr": 0.047258156262526045, "acc_norm": 0.33, "acc_norm_stderr": 0.047258156262526045 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6705202312138728, "acc_stderr": 0.03583901754736412, "acc_norm": 0.6705202312138728, "acc_norm_stderr": 0.03583901754736412 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.45098039215686275, "acc_stderr": 0.049512182523962625, "acc_norm": 0.45098039215686275, "acc_norm_stderr": 0.049512182523962625 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.75, "acc_stderr": 0.04351941398892446, "acc_norm": 0.75, "acc_norm_stderr": 0.04351941398892446 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5914893617021276, "acc_stderr": 0.032134180267015755, "acc_norm": 0.5914893617021276, "acc_norm_stderr": 0.032134180267015755 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.5, "acc_stderr": 0.047036043419179864, "acc_norm": 0.5, "acc_norm_stderr": 0.047036043419179864 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5310344827586206, "acc_stderr": 0.04158632762097828, "acc_norm": 0.5310344827586206, "acc_norm_stderr": 0.04158632762097828 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.42592592592592593, "acc_stderr": 0.025467149045469557, "acc_norm": 0.42592592592592593, "acc_norm_stderr": 0.025467149045469557 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.42857142857142855, "acc_stderr": 0.0442626668137991, "acc_norm": 0.42857142857142855, "acc_norm_stderr": 0.0442626668137991 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.34, "acc_stderr": 0.04760952285695235, "acc_norm": 0.34, "acc_norm_stderr": 0.04760952285695235 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7709677419354839, "acc_stderr": 0.02390491431178265, "acc_norm": 0.7709677419354839, "acc_norm_stderr": 0.02390491431178265 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.49261083743842365, "acc_stderr": 0.035176035403610084, "acc_norm": 0.49261083743842365, "acc_norm_stderr": 0.035176035403610084 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.7, "acc_stderr": 0.046056618647183814, "acc_norm": 0.7, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7696969696969697, "acc_stderr": 0.0328766675860349, "acc_norm": 0.7696969696969697, "acc_norm_stderr": 0.0328766675860349 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.803030303030303, "acc_stderr": 0.028335609732463362, "acc_norm": 0.803030303030303, "acc_norm_stderr": 0.028335609732463362 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8860103626943006, "acc_stderr": 0.022935144053919443, "acc_norm": 0.8860103626943006, "acc_norm_stderr": 0.022935144053919443 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6666666666666666, "acc_stderr": 0.023901157979402534, "acc_norm": 0.6666666666666666, "acc_norm_stderr": 0.023901157979402534 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.34814814814814815, "acc_stderr": 0.029045600290616255, "acc_norm": 0.34814814814814815, "acc_norm_stderr": 0.029045600290616255 }, "harness|hendrycksTest-high_school_microeconomics|5": { "acc": 0.6932773109243697, "acc_stderr": 0.02

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_ignos__Mistral-T5-7B-v1 数据集图片
构建方式
该数据集是在Open LLM Leaderboard评估框架下,针对ignos/Mistral-T5-7B-v1模型自动生成的评测记录合集。数据集由63个配置组成,每个配置对应一个被评估的任务。整个数据集源自一次独立的运行,每次运行的结果以时间戳命名,作为每个配置中的一个特定分割。一个名为'train'的分割始终指向最新一次运行的评估结果。此外,一个名为'results'的额外配置存储了所有聚合后的运行结果,用于在Open LLM Leaderboard上计算和展示综合指标。
特点
数据集的核心特点在于其结构化的多任务评估体系,覆盖了从常识推理、数学问题到多学科知识问答的广泛领域。每个任务配置独立存储,便于细粒度分析。数据集通过时间戳分割管理历史版本,确保结果可追溯。'train'分割始终指向最新数据,简化了访问流程。'results'配置则提供了宏观视角,汇总了如准确率(acc)、标准化准确率(acc_norm)及多项选择指标(mc1、mc2)等关键性能指标,全面反映模型在各类基准测试中的表现。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据。例如,使用load_dataset函数指定数据集名称和目标任务配置(如'harness_winogrande_5'),并选择'train'分割即可获取最新评估详情。若需访问历史运行数据,可通过对应的时间戳分割名称进行加载。这种设计支持对模型性能进行时间序列分析,便于追踪模型优化过程中的能力变化。数据集以parquet格式存储,兼顾了高效读写与数据完整性。
背景与挑战
背景概述
大语言模型(LLM)的迅猛发展催生了对其性能进行系统化评估的迫切需求,Open LLM Leaderboard应运而生,成为衡量模型在多种自然语言理解与推理任务上表现的重要基准。该数据集由HuggingFace团队于2023年创建,核心研究人员包括Clémentine Fourrier等人,旨在为模型ignos/Mistral-T5-7B-v1在63个配置项下的评估结果提供结构化存储与可复现性支持。该模型融合了Mistral与T5架构的优势,其评估覆盖了ARC挑战赛、HellaSwag常识推理、GSM8K数学问题求解以及涵盖57个学科的MMLU基准等任务,全面检验了模型在知识推理、领域理解与数学计算方面的综合能力。通过自动记录每次运行的详细结果,该数据集不仅为模型性能的横向对比提供了标准化接口,还推动了LLM评估流程的透明化与可复现性,对后续研究在模型选型与性能分析上具有重要参考价值。
当前挑战
当前数据集面临的核心挑战在于评估体系的全面性与公平性。首先,LLM在真实世界应用中的表现往往受限于基准测试的覆盖度,例如该数据集虽涵盖57个学科,但对于跨学科推理、长文本理解及多模态任务等新兴领域仍存在空白,导致模型能力评估存在偏差。其次,构建过程中面临数据标准化与结果一致性的难题,不同运行批次间因模型权重更新、硬件环境差异或采样策略变化可能导致结果波动,如何确保各次评估间的可比较性成为关键。此外,基准测试本身可能遭受数据污染风险,即模型在预训练阶段已接触过测试样本,从而夸大真实性能,这需要更严格的去重机制与动态题库设计来缓解。最后,随着模型规模持续增长,评估的计算成本与时间开销呈指数级上升,如何在资源约束下维持评估的全面性与时效性,成为制约该领域发展的瓶颈。
常用场景
经典使用场景
在自然语言处理与大规模语言模型评估的学术疆域中,Open LLM Leaderboard评测数据集为模型性能的横向对比提供了标准化基准。该数据集的核心使用场景聚焦于对Mistral-T5-7B-v1等生成式语言模型进行多维度能力剖析,涵盖常识推理(如HellaSwag、ARC-Challenge)、数学求解(GSM8K)、知识问答(MMLU涵盖57个学科)以及对抗性真实性检测(TruthfulQA)等经典任务。研究者通过加载该数据集中的特定配置,可精确复现模型在63个评测子任务上的细粒度表现,从而验证模型在零样本或少样本设定下的泛化能力与鲁棒性。
解决学术问题
该数据集系统性地解决了大语言模型评估中缺乏统一、可复现评测范式的学术困境。传统上,不同研究机构采用各异的数据集与评估协议,导致模型性能难以直接对比。Open LLM Leaderboard通过标准化评测流程,将ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等公认基准整合为统一框架,使得研究者能够量化模型在复杂推理、知识广度、数学逻辑及事实一致性等维度的真实水平。这一举措促进了模型间公平竞争,为识别现有架构的瓶颈与优化方向提供了实证依据。
衍生相关工作
该数据集衍生了一系列具有学术影响力的经典工作,其中最具代表性的是基于其评测结果进行的模型架构分析与改进研究。例如,研究者利用该数据集揭示的Mistral-T5-7B-v1在TruthfulQA上的较低得分,深入探讨了混合专家模型在事实一致性方面的局限性,并提出了对比解码增强方案。此外,该数据集催生了多个模型排名榜单与性能预测工具,如基于评测分数训练回归模型以预估新架构的潜在表现,以及开发可视化仪表盘用于追踪不同时期模型能力的演进轨迹。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务