遇见数据集

open-llm-leaderboard/details_MatthieuJ__Forbin_13B_M1_SLERP

收藏
Hugging Face2024-03-27 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在评估模型MatthieuJ/Forbin_13B_M1_SLERP时自动创建的,用于在Open LLM Leaderboard上进行评估。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型MatthieuJ/Forbin_13B_M1_SLERP时自动创建的,用于在Open LLM Leaderboard上进行评估。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在评估模型MatthieuJ/Forbin_13B_M1_SLERPOpen LLM Leaderboard上的运行过程中自动创建的。

数据集组成

  • 数据集包含63个配置,每个配置对应一个评估任务。
  • 数据集从1次运行中创建,每个运行可以在每个配置中找到特定的拆分,拆分名称使用运行的时间戳。
  • "train"拆分始终指向最新的结果。
  • 一个额外的配置"results"存储所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_MatthieuJ__Forbin_13B_M1_SLERP", "harness_winogrande_5", split="train")

最新结果

以下是2024-03-27T19:09:27.007204运行的最新结果:

python { "all": { "acc": 0.23196194129343728, "acc_stderr": 0.029934654752561563, "acc_norm": 0.2314240573187148, "acc_norm_stderr": 0.03071122006512167, "mc1": 1.0, "mc1_stderr": 0.0, "mc2": NaN, "mc2_stderr": NaN }, "harness|arc:challenge|25": { "acc": 0.22696245733788395, "acc_stderr": 0.012240491536132861, "acc_norm": 0.22696245733788395, "acc_norm_stderr": 0.012240491536132861 }, "harness|hellaswag|10": { "acc": 0.2504481179047998, "acc_stderr": 0.004323856300539177, "acc_norm": 0.2504481179047998, "acc_norm_stderr": 0.004323856300539177 }, ... }

配置详情

  • config_name: harness_arc_challenge_25

    • 数据文件:
      • 拆分: 2024_03_27T19_09_27.007204
        • 路径: **/details_harness|arc:challenge|25_2024-03-27T19-09-27.007204.parquet
      • 拆分: latest
        • 路径: **/details_harness|arc:challenge|25_2024-03-27T19-09-27.007204.parquet
  • config_name: harness_gsm8k_5

    • 数据文件:
      • 拆分: 2024_03_27T19_09_27.007204
        • 路径: **/details_harness|gsm8k|5_2024-03-27T19-09-27.007204.parquet
      • 拆分: latest
        • 路径: **/details_harness|gsm8k|5_2024-03-27T19-09-27.007204.parquet
  • config_name: harness_hellaswag_10

    • 数据文件:
      • 拆分: 2024_03_27T19_09_27.007204
        • 路径: **/details_harness|hellaswag|10_2024-03-27T19-09-27.007204.parquet
      • 拆分: latest
        • 路径: **/details_harness|hellaswag|10_2024-03-27T19-09-27.007204.parquet
  • config_name: harness_hendrycksTest_5

    • 数据文件:
      • 拆分: 2024_03_27T19_09_27.007204
        • 路径:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2024-03-27T19-09-27.007204.parquet
          • ...
      • 拆分: latest
        • 路径:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2024-03-27T19-09-27.007204.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2024-03-27T19-09-27.007204.parquet
          • ...
搜集汇总
数据集介绍
open-llm-leaderboard/details_MatthieuJ__Forbin_13B_M1_SLERP 数据集图片
构建方式
该数据集是在Open LLM Leaderboard框架下,对模型MatthieuJ/Forbin_13B_M1_SLERP进行自动化评估过程中生成的。其构建方式基于一次完整的评估运行,共涵盖63个任务配置,每个配置对应一项被评估的基准任务。每个运行实例均以时间戳作为独立分割(split)标识,而'train'分割则始终指向最新一次运行的结果。此外,数据集额外配置了一个名为'results'的聚合配置,用于存储所有任务的综合评估指标,这些数据最终被Open LLM Leaderboard用于计算和展示模型的整体性能。
特点
该数据集的一个显著特点在于其结构化的多任务覆盖能力,囊括了从常识推理(如ARC、HellaSwag)到数学推理(如GSM8K)、知识问答(如MMLU下的57个子领域)以及对抗性测试(如TruthfulQA、Winogrande)等多种类型的评估任务。每个任务配置均包含详细的准确率与标准差等统计指标,便于研究者进行细粒度分析。同时,数据集通过时间戳分割保留了评估历史的可追溯性,支持对模型性能随时间演变的过程进行回溯。
使用方法
用户可通过HuggingFace的datasets库便捷地加载该数据集。具体而言,调用load_dataset函数并指定数据集名称'open-llm-leaderboard/details_MatthieuJ__Forbin_13B_M1_SLERP',同时选择所需的任务配置(例如'harness_winogrande_5')以及分割名称(如'train'或具体的时间戳分割),即可获取对应任务的评估详情。这种设计使得研究者能够灵活地访问单个任务的细粒度结果或整体聚合指标,从而支持模型性能的深入分析与比较。
背景与挑战
背景概述
随着大语言模型(LLM)的迅猛发展,如何系统、公正地评估其多维能力成为学界与工业界共同关注的焦点。在此背景下,HuggingFace团队于2023年发起了Open LLM Leaderboard项目,旨在通过标准化基准测试为社区提供模型性能的透明化对比。该数据集正是针对模型MatthieuJ/Forbin_13B_M1_SLERP的自动化评测结果,由Clémentine Fourrier等人主导构建,于2024年3月完成评测运行。数据集涵盖了ARC-Challenge、HellaSwag、MMLU(涵盖57个学科)、TruthfulQA、Winogrande及GSM8K等63个细分任务配置,系统揭示了该13B参数模型在常识推理、知识理解、数学求解等核心维度的表现,为研究模型能力边界与改进方向提供了关键参考。
当前挑战
该数据集所反映的核心挑战首先在于大语言模型评测的标准化困境:不同评测任务(如GSM8K数学推理与TruthfulQA真实性判别)对模型能力的要求迥异,单一指标难以全面衡量模型综合性能,且任务间得分差异(如Forbin_13B在TruthfulQA的mc1得分为1.0,而GSM8K得分为0.0)暴露出模型在特定领域存在显著短板。其次,构建过程中面临评测流程自动化的技术挑战,需将63个异构任务统一为可复现的评测管线,并确保每次运行的时间戳与结果分片精确对应,同时处理如NaN值等异常数据记录。此外,如何避免评测集污染、保证结果可比性,以及应对模型迭代带来的版本管理问题,亦是该数据集持续演进中必须攻克的难关。
常用场景
经典使用场景
在开放大语言模型评测领域,该数据集作为Open LLM Leaderboard的评估结果记录,经典使用场景在于系统性地追踪模型MatthieuJ/Forbin_13B_M1_SLERP在63个配置任务上的表现。它通过存储ARC挑战、HellaSwag、MMLU多学科知识、TruthfulQA、Winogrande及GSM8K等基准测试的细粒度指标,为研究者提供了复现与对比模型性能的标准化数据源。研究人员可加载特定任务的配置与分割,深入分析模型在常识推理、数学求解、语言理解等维度的能力边界,从而推动大语言模型评测体系的透明化与可复现性。
解决学术问题
该数据集解决了大语言模型评估中结果碎片化与难以复现的学术难题。通过将单一模型的多次运行结果统一存储于结构化配置中,并设置‘latest’分割指向最新评估,它消解了传统评测中因版本迭代或参数差异导致的比较混乱。数据集涵盖从抽象代数到病毒学等57个MMLU子任务的细粒度得分,使研究者能够精准定位模型在特定知识领域的薄弱环节,例如GSM8K上零分的结果揭示了其数学推理能力的显著缺陷,为后续模型优化提供了量化依据。
衍生相关工作
该数据集衍生出一系列围绕大语言模型评测标准化与结果可视化的经典工作。其底层架构启发了Open LLM Leaderboard上其他模型评估数据集的构建模式,例如采用相同parquet格式与配置分裂的设计被广泛应用于后续模型结果记录。此外,基于该数据集的聚合结果,社区衍生出模型性能雷达图生成工具与跨模型对比分析平台,推动了如‘模型知识图谱’等方向的研究,使得研究者能够从多任务视角系统性地揭示不同架构模型的优劣分布。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务