遇见数据集

open-llm-leaderboard-old/details_HuggingFaceH4__zephyr-7b-alpha_private

收藏
Hugging Face2023-10-10 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型HuggingFaceH4/zephyr-7b-alpha进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,一个名为results的配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在Open LLM Leaderboard上对模型HuggingFaceH4/zephyr-7b-alpha进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,一个名为results的配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

原始信息汇总

数据集概述

数据集摘要

该数据集是在对模型 HuggingFaceH4/zephyr-7b-alpha 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 61 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的 "results" 配置存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

最新结果

以下是 2023-10-10T14:11:13.991325 运行的最新结果

python { "all": { "acc": 0.6137978230566867, "acc_stderr": 0.03380754595328641, "acc_norm": 0.6176702382672306, "acc_norm_stderr": 0.03378555360789072, "mc1": 0.42717258261933905, "mc1_stderr": 0.017316834410963926, "mc2": 0.5790339154881958, "mc2_stderr": 0.015362629183533977 }, "harness|arc:challenge|25": { "acc": 0.5810580204778157, "acc_stderr": 0.014418106953639011, "acc_norm": 0.6100682593856656, "acc_norm_stderr": 0.01425295984889289 }, "harness|hellaswag|10": { "acc": 0.6409081856203943, "acc_stderr": 0.004787537385153006, "acc_norm": 0.8403704441346346, "acc_norm_stderr": 0.0036551361115537096 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, # 其他任务的结果省略... "harness|truthfulqa:mc|0": { "mc1": 0.42717258261933905, "mc1_stderr": 0.017316834410963926, "mc2": 0.5790339154881958, "mc2_stderr": 0.015362629183533977 } }

配置详情

  • config_name: harness_arc_challenge_25

    • split: 2023_10_10T14_11_13.991325
      • path: **/details_harness|arc:challenge|25_2023-10-10T14-11-13.991325.parquet
    • split: latest
      • path: **/details_harness|arc:challenge|25_2023-10-10T14-11-13.991325.parquet
  • config_name: harness_hellaswag_10

    • split: 2023_10_10T14_11_13.991325
      • path: **/details_harness|hellaswag|10_2023-10-10T14-11-13.991325.parquet
    • split: latest
      • path: **/details_harness|hellaswag|10_2023-10-10T14-11-13.991325.parquet
  • config_name: harness_hendrycksTest_5

    • split: 2023_10_10T14_11_13.991325
      • path:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-international_law|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-management|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-marketing|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-professional_accounting|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-professional_law|5_2023-10-10T14-11-13.991325.parquet
        • **/details_harness|hendrycksTest-professional_medicine|5_2023-10-10T14-11-13.991325.parquet
        • `**/details_harness|hendrycksTest-professional_psychology|5_2023-10
搜集汇总
数据集介绍
构建方式
在大型语言模型评测领域,对模型性能的量化评估是推动技术进步的关键环节。该数据集是围绕模型HuggingFaceH4/zephyr-7b-alpha在Open LLM Leaderboard上的评测过程自动生成的。其构建方式基于一次完整的评测运行,涵盖了61个不同的任务配置,每个配置对应一个独立的评估任务。每次运行的详细结果被存储为特定的数据分割,并以运行的时间戳进行命名,而“train”分割则始终指向最新一次运行的结果。此外,数据集还包含一个名为“results”的额外配置,用于汇总所有运行的聚合指标,为计算和展示排行榜上的综合得分提供支撑。
特点
该数据集最显著的特点在于其结构化的多任务组织与版本追踪能力。通过61个配置,它系统性地记录了模型在ARC、HellaSwag、TruthfulQA以及涵盖数十个学科的MMLU等多样化基准上的表现。每个配置下,不同时间戳的分割使得研究者能够追溯模型性能的历史变化,而“latest”分割则确保了最新评测结果的便捷获取。这种设计不仅提供了细粒度的任务级指标(如准确率及其标准误差),还整合了宏观的汇总结果,极大地便利了模型能力的横向比较与纵向分析。
使用方法
使用该数据集进行深入分析时,研究者可通过Hugging Face的datasets库便捷加载。具体而言,调用load_dataset函数并指定数据集名称及目标任务配置(如“harness_truthfulqa_mc_0”),再通过split参数选择“train”即可获取最新评测的详细记录。对于需要回溯历史性能的场景,可将split参数指定为对应运行的时间戳字符串(如“2023_10_10T14_11_13.991325”),从而加载特定时刻的完整评估数据。这一设计使得对模型能力演进的研究变得直观且高效。
背景与挑战
背景概述
随着大语言模型(LLM)的迅猛发展,如何系统性地评估模型在多样化任务上的综合能力成为学术界与工业界的核心关切。在此背景下,Hugging Face 团队于2023年发起了 Open LLM Leaderboard 项目,旨在通过标准化基准测试框架对开源大模型进行公平、透明的横向对比。该数据集源自对 HuggingFaceH4/zephyr-7b-alpha 模型的评估运行,由 Clementine 等研究人员主导,记录了模型在61个任务配置上的详细表现,涵盖常识推理、学术知识、伦理判断等多维度测评。zephyr-7b-alpha 作为一款7B参数量的对话模型,其评估结果不仅为该模型在社区中的定位提供了量化依据,更推动了开源模型评价体系的规范化,成为后续模型迭代与性能追踪的重要参考基准。
当前挑战
该数据集所解决的领域问题在于,大语言模型的评估面临任务多样性、指标一致性及结果可复现性等核心挑战。具体而言,不同模型在同一任务上的性能波动需通过标准化流程(如固定few-shot样例与评估参数)加以控制,而该数据集通过61个配置统一了评估接口。构建过程中,挑战集中于数据采集的自动化与时效性:每次评估运行需生成独立的时间戳分片,并将最新结果动态映射至训练集,以支持持续追踪;同时,多任务结果的聚合与存储(如JSON格式的汇总)需保证跨任务指标的可比性,避免因任务难度差异导致的偏差。此外,确保评估脚本(如LM Evaluation Harness)的版本兼容性及结果解析的鲁棒性,亦是构建过程中的关键难点。
常用场景
经典使用场景
在自然语言处理与大型语言模型评估的学术前沿,Open LLM Leaderboard 上的模型评估数据集为研究者提供了标准化的性能度量工具。该数据集专为 HuggingFaceH4/zephyr-7b-alpha 模型设计,涵盖了61个评测任务配置,包括 ARC-Challenge、HellaSwag、TruthfulQA 以及涵盖57个学科的 MMLU 测试集。研究者可通过加载特定任务配置(如 harness_truthfulqa_mc_0)来获取模型在选择题、推理与知识问答等场景下的细粒度表现,从而进行模型间横向对比与能力剖析。
解决学术问题
该数据集解决了大型语言模型评估中缺乏统一、可复现基准的核心难题。通过记录模型在多样化学术任务上的精确准确率与标准误差,它使研究者能够系统性地衡量模型在常识推理、事实准确性、多学科知识掌握等方面的能力边界。这一标准化评估框架促进了模型优劣的客观判别,推动了诸如指令微调、对齐优化等研究方向的进展,并成为衡量模型泛化能力与鲁棒性的重要参考。
衍生相关工作
该数据集衍生了一系列关于模型评估与能力分析的重要工作。其结构化评测结果被广泛用于训练后分析,如探索模型在 MMLU 不同学科中的表现差异,进而催生了针对知识密集型任务的微调策略研究。此外,基于该数据集的公开排行榜激励了社区提出更高效的评估协议,例如引入置信度校准或对抗性样本测试。这些工作不仅深化了对 zephyr-7b-alpha 等模型的理解,也为构建更透明、公平的评估体系奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务