遇见数据集

open-llm-leaderboard-old/details_dillfrescott__amadeus-v0.1

收藏
Hugging Face2024-01-06 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型dillfrescott/amadeus-v0.1的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,"results"配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在模型dillfrescott/amadeus-v0.1的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,"results"配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

该数据集是在对模型dillfrescott/amadeus-v0.1进行评估运行期间自动创建的,用于Open LLM Leaderboard。

数据集组成

  • 数据集由63个配置组成,每个配置对应一个评估任务。
  • 数据集从1次运行中创建,每次运行的详细结果可以在每个配置中找到,以运行的时间戳命名的特定分割形式存储。
  • "train"分割始终指向最新的结果。
  • 一个额外的配置"results"存储所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_dillfrescott__amadeus-v0.1", "harness_winogrande_5", split="train")

最新结果

以下是2024-01-06T01:28:19.231223运行的最新结果: python { "all": { "acc": 0.6503116864878898, "acc_stderr": 0.03211845742165151, "acc_norm": 0.6514191578913137, "acc_norm_stderr": 0.032765902396781794, "mc1": 0.46266829865361075, "mc1_stderr": 0.017454645150970588, "mc2": 0.6382334765973684, "mc2_stderr": 0.01550846970253108 }, "harness|arc:challenge|25": { "acc": 0.6578498293515358, "acc_stderr": 0.013864152159177278, "acc_norm": 0.689419795221843, "acc_norm_stderr": 0.013522292098053069 }, "harness|hellaswag|10": { "acc": 0.6957777335192192, "acc_stderr": 0.004591369853276529, "acc_norm": 0.8698466440948018, "acc_norm_stderr": 0.0033578442491239546 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.35, "acc_stderr": 0.0479372485441102, "acc_norm": 0.35, "acc_norm_stderr": 0.0479372485441102 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6296296296296297, "acc_stderr": 0.041716541613545426, "acc_norm": 0.6296296296296297, "acc_norm_stderr": 0.041716541613545426 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6907894736842105, "acc_stderr": 0.037610708698674805, "acc_norm": 0.6907894736842105, "acc_norm_stderr": 0.037610708698674805 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.59, "acc_stderr": 0.049431107042371025, "acc_norm": 0.59, "acc_norm_stderr": 0.049431107042371025 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.7018867924528301, "acc_stderr": 0.02815283794249386, "acc_norm": 0.7018867924528301, "acc_norm_stderr": 0.02815283794249386 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7638888888888888, "acc_stderr": 0.03551446610810826, "acc_norm": 0.7638888888888888, "acc_norm_stderr": 0.03551446610810826 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.47, "acc_stderr": 0.050161355804659205, "acc_norm": 0.47, "acc_norm_stderr": 0.050161355804659205 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.5, "acc_stderr": 0.050251890762960605, "acc_norm": 0.5, "acc_norm_stderr": 0.050251890762960605 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.34, "acc_stderr": 0.047609522856952344, "acc_norm": 0.34, "acc_norm_stderr": 0.047609522856952344 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6705202312138728, "acc_stderr": 0.03583901754736412, "acc_norm": 0.6705202312138728, "acc_norm_stderr": 0.03583901754736412 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.43137254901960786, "acc_stderr": 0.04928099597287534, "acc_norm": 0.43137254901960786, "acc_norm_stderr": 0.04928099597287534 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.79, "acc_stderr": 0.04093601807403326, "acc_norm": 0.79, "acc_norm_stderr": 0.04093601807403326 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5957446808510638, "acc_stderr": 0.03208115750788684, "acc_norm": 0.5957446808510638, "acc_norm_stderr": 0.03208115750788684 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.5, "acc_stderr": 0.047036043419179864, "acc_norm": 0.5, "acc_norm_stderr": 0.047036043419179864 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5517241379310345, "acc_stderr": 0.04144311810878151, "acc_norm": 0.5517241379310345, "acc_norm_stderr": 0.04144311810878151 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.4021164021164021, "acc_stderr": 0.025253032554997695, "acc_norm": 0.4021164021164021, "acc_norm_stderr": 0.025253032554997695 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.48412698412698413, "acc_stderr": 0.04469881854072606, "acc_norm": 0.48412698412698413, "acc_norm_stderr": 0.04469881854072606 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.8, "acc_stderr": 0.022755204959542943, "acc_norm": 0.8, "acc_norm_stderr": 0.022755204959542943 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5123152709359606, "acc_stderr": 0.035169204442208966, "acc_norm": 0.5123152709359606, "acc_norm_stderr": 0.035169204442208966 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.72, "acc_stderr": 0.04512608598542127, "acc_norm": 0.72, "acc_norm_stderr": 0.04512608598542127 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7575757575757576, "acc_stderr": 0.03346409881055953, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.03346409881055953 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7828282828282829, "acc_stderr": 0.02937661648494563, "acc_norm": 0.7828282828282829, "acc_norm_stderr": 0.02937661648494563 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8911917098445595, "acc_stderr": 0.022473253332768766, "acc_norm": 0.8911917098445595, "acc_norm_stderr": 0.022473253332768766 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6743589743589744, "acc_stderr": 0.02375966576741229, "acc_norm": 0.6743589743589744, "acc_norm_stderr": 0.02375966576741229 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.3333333333333333, "acc_stderr": 0.02874204090394848, "acc_norm": 0.3333333333333333, "acc_norm_stderr": 0.02874204090394848 }, "harness|hendrycksTest-high_school_microeconomics|5": { "acc": 0.71008403

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_dillfrescott__amadeus-v0.1 数据集图片
构建方式
在大规模语言模型评估领域,对模型性能的精准度量是推动技术演进的关键一环。本数据集源自对模型dillfrescott/amadeus-v0.1在Open LLM Leaderboard平台上的自动化评估流程。其构建方式独特,由单一评估运行(run)生成,该运行的时间戳被用作数据集内各配置(configuration)的分裂(split)标识,而名为“train”的分裂则始终指向最新的评估结果。数据集共包含63个配置,每个配置对应一个被评估的任务,如ARC挑战、HellaSwag、GSM8K及涵盖多学科的Hendrycks测试等。此外,一个名为“results”的专属配置被用于存储所有评估任务的聚合结果,这些结果最终被用于计算并展示排行榜上的综合指标。
特点
该数据集最显著的特征在于其结构化的评估记录与动态更新机制。它并非静态的数据集合,而是通过时间戳分裂忠实复现了每一次评估运行的原始细节,使得研究者能够回溯模型在特定时刻的性能表现。每个任务配置均以Parquet格式存储详细评估数据,确保了数据的高效存取与可扩展性。数据集覆盖了从常识推理(如Winogrande)到数学问题求解(GSM8K)再到多领域知识问答(Hendrycks测试)的广泛任务谱系,为深入分析模型在不同能力维度上的优缺点提供了丰富素材。聚合结果配置的存在,则极大便利了整体性能的横向对比与趋势分析。
使用方法
研究人员可通过Hugging Face的datasets库便捷地加载本数据集。具体而言,使用load_dataset函数并指定数据集名称及目标任务配置(例如“harness_winogrande_5”),再通过split参数选取所需的分裂(如“train”以获取最新结果),即可获得对应任务的详细评估数据。对于希望获取全局视角的用户,可直接加载“results”配置以访问所有任务的聚合指标。数据集的这种设计使得用户能够灵活地聚焦于单一任务的微观分析,或进行跨任务的宏观比较,从而支撑从模型调试到能力图谱绘制的各类研究需求。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的时代,如何系统、公正地评估模型在多样化任务上的综合能力,成为推动领域进步的关键瓶颈。由Hugging Face团队于2024年创建的Open LLM Leaderboard,正是为应对这一需求而生的标准化评估平台。该数据集聚焦于对dillfrescott/amadeus-v0.1模型在2024年1月6日的一次完整评估运行,涵盖了从常识推理(如ARC Challenge)、知识问答(如MMLU的57个学科)到数学推理(如GSM8K)等63个细粒度任务配置。通过将模型在零样本或少样本设定下的表现以精确的准确率与标准误差进行量化,该数据集不仅为开发者提供了模型强项与弱项的微观洞察,更在宏观上推动了LLM评测从单一指标向多维度、高复现性的范式转变,成为社区内衡量模型进展的重要参考基准。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:LLM需同时应对知识记忆、逻辑推理、数学计算及常识判断等异构能力,而现有评估体系难以完全消除任务间难度差异与数据泄露带来的偏差。在构建过程中,评估框架需处理来自不同来源的57个MMLU子集与多个基准测试的异构格式,确保每个配置的加载、推理与评分逻辑严格一致,这对代码鲁棒性与数据处理流水线提出了极高要求。此外,单次评估运行可能因模型版本更新、超参数波动或随机性而产生结果偏移,如何通过多次运行与统计显著性检验来保障评测的稳定性,仍是持续存在的技术挑战。
常用场景
经典使用场景
该数据集专为大规模语言模型(LLM)的自动化评估而生,其核心应用场景在于系统性地衡量模型在多样化自然语言理解与推理任务上的表现。通过集成如ARC-Challenge、HellaSwag、GSM8K及涵盖57个学科的MMLU基准测试,它能够全面评估模型从常识推理、数学解题到专业领域知识掌握的多维能力。研究者可利用该数据集复现Open LLM Leaderboard上的标准化评测流程,从而客观比较不同模型在统一框架下的性能优劣。
解决学术问题
该数据集有效解决了LLM领域长期存在的评估标准碎片化与结果不可复现的学术难题。通过提供结构化的评测配置和细粒度的任务结果记录,它使得研究者能够精确量化模型在特定维度的能力边界,例如在Winogrande上的指代消解能力或TruthfulQA上的事实一致性。这种系统性的评估框架为理解模型在复杂推理、知识记忆及逻辑一致性等方面的内在缺陷提供了可靠的数据支撑,进而推动了模型可解释性与鲁棒性研究的深入发展。
衍生相关工作
该数据集衍生了多项具有深远影响的经典工作,其中最具代表性的是基于其评估框架催生的Open LLM Leaderboard社区,该平台已成为全球LLM性能排名的权威参考。后续研究如通过分析数据集中的错误案例来设计对抗性训练策略,以及利用其多任务结构构建模型能力图谱的工作,均显著提升了LLM的泛化能力。此外,该数据集还启发了跨语言与多模态评估基准的构建,为下一代通用人工智能的评测体系奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务