遇见数据集

open-llm-leaderboard/details_MBZUAI__lamini-cerebras-256m

收藏
Hugging Face2023-10-18 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型MBZUAI/lamini-cerebras-256m进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

This dataset was automatically created when evaluating the model MBZUAI/lamini-cerebras-256m on the Open LLM Leaderboard. It consists of 64 configurations, each corresponding to one evaluation task. The dataset is generated from two runs, with the results of each run stored as a split under a specific configuration, where the split name uses the timestamp of the corresponding run. The train split always points to the most recent results. Additionally, there is a configuration named "results" that stores the aggregated results of all runs, which is used to compute and display aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在模型 MBZUAI/lamini-cerebras-256m 的评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集结构

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_MBZUAI__lamini-cerebras-256m", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-18T21:23:58.159302 运行的最新结果: python { "all": { "em": 0.004614093959731544, "em_stderr": 0.0006940305886353382, "f1": 0.0485601929530202, "f1_stderr": 0.001416776057030896, "acc": 0.2600631412786109, "acc_stderr": 0.007020548332172165 }, "harness|drop|3": { "em": 0.004614093959731544, "em_stderr": 0.0006940305886353382, "f1": 0.0485601929530202, "f1_stderr": 0.001416776057030896 }, "harness|gsm8k|5": { "acc": 0.0, "acc_stderr": 0.0 }, "harness|winogrande|5": { "acc": 0.5201262825572218, "acc_stderr": 0.01404109666434433 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|arc:challenge|25_2023-07-19T14:03:54.782051.parquet
  • harness_drop_3

    • 分割:2023_10_18T21_23_58.159302, latest
    • 路径:**/details_harness|drop|3_2023-10-18T21-23-58.159302.parquet
  • harness_gsm8k_5

    • 分割:2023_10_18T21_23_58.159302, latest
    • 路径:**/details_harness|gsm8k|5_2023-10-18T21-23-58.159302.parquet
  • harness_hellaswag_10

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hellaswag|10_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:多个路径,例如 **/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_abstract_algebra_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-electrical_engineering|5_2023-07-19T14:03:54.782051.parquet
  • harness_hendrycksTest_elementary_mathematics_5

    • 分割:2023_07_19T14_03_54.782051, latest
    • 路径:**/details_harness|hendrycksTest-elementary_mathematics|5_2023-07-19T14:03:54.782051.parquet
搜集汇总
数据集介绍
构建方式
该数据集是在Open LLM Leaderboard框架下,对MBZUAI/lamini-cerebras-256m模型进行自动化评估过程中生成的。数据集包含64个配置,每个配置对应一项评估任务,如ARC挑战、DROP、GSM8K、WinoGrande等。数据来源于两次独立的运行,每次运行的结果以时间戳命名的分割形式存储,其中'train'分割始终指向最新一次运行的结果。此外,'results'配置汇总了所有评估的聚合指标,用于在排行榜上展示模型的整体表现。
特点
数据集的核心特点在于其结构化的多任务评估体系,覆盖了从常识推理到数学解题的多样化基准。每个任务的评估结果以Parquet格式存储,包含精确匹配率、F1分数和准确率等细粒度指标。时间戳分割的设计使得用户可以追溯模型性能的历史演变,而'latest'分割则提供了对最新结果的便捷访问。这种设计不仅保证了数据的可复现性,还支持对模型在不同时间点表现的横向对比。
使用方法
用户可通过HuggingFace的datasets库加载该数据集。例如,使用load_dataset函数指定配置名称如'harness_winogrande_5'和分割如'train',即可获取特定任务的最新评估细节。对于需要历史数据的场景,可选择对应时间戳的分割。此外,通过访问'results'配置,可一键获取模型在所有任务上的聚合指标,便于快速评估整体性能。代码示例中展示了加载WinoGrande任务数据的标准流程。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的时代,如何系统、公平地评估模型性能成为学术界与工业界的核心关切。Open LLM Leaderboard由HuggingFace团队于2023年发起,旨在为开源LLM提供标准化评测基准,其背后凝聚了Clementine Fourrier等多位研究者的心血。该数据集记录了MBZUAI与Cerebras合作开发的256M参数模型lamini-cerebras-256m在多项任务上的表现,涵盖ARC挑战、DROP、GSM8K、HellaSwag、WinoGrande及涵盖57个学科的大规模多任务语言理解(MMLU)等。这些评测覆盖了常识推理、数学解题、文本理解与知识问答等关键维度,为研究者提供了洞察小规模模型能力边界的重要窗口,对推动高效、可复现的模型比较研究具有深远影响。
当前挑战
该数据集所反映的挑战具有双重性。从领域问题看,小规模LLM(如256M参数)在GSM8K数学推理任务上准确率趋近于零,揭示了当前模型在复杂逻辑与数值推理方面的结构性短板;同时,其在DROP阅读理解任务上的F1分数不足5%,凸显了细粒度信息抽取能力的严重不足。从构建过程看,数据集需整合来自不同时间戳的多次评估运行结果,确保各任务配置(如harness_arc_challenge_25、harness_hendrycksTest系列)的数据一致性,并处理跨任务、跨运行间的度量标准对齐问题。此外,自动生成评估数据的流程需应对评测框架(如EleutherAI Harness)版本迭代带来的兼容性挑战,确保结果的可复现性与横向可比性。
常用场景
经典使用场景
在大型语言模型蓬勃发展的时代背景下,该数据集作为Open LLM Leaderboard的评估运行记录,为模型性能的横向对比提供了标准化基准。其经典使用场景在于加载特定任务的细粒度评估结果,例如通过配置‘harness_winogrande_5’获取模型在常识推理任务上的准确率与置信区间,从而实现对模型在特定能力维度上的精准剖析。研究者可借助该数据集的64个任务配置,系统性地审视模型在ARC挑战、HellaSwag、MMLU等多样化基准上的表现,为模型迭代与优化提供数据驱动的决策支持。
实际应用
在实际应用层面,该数据集为模型选型与部署提供了实证依据。企业或研究团队可依据数据集中的跨任务性能对比,筛选出在目标场景(如问答、数学推理)中表现最优的模型,从而降低试错成本。例如,在构建智能客服系统时,可参考数据集在DROP(阅读理解)与GSM8K(数学推理)上的评分,选择兼具语义理解与计算能力的基座模型。同时,该数据集也为模型压缩、量化等工程优化提供了效果验证的标尺,确保优化后的模型在关键任务上不出现显著性能衰退。
衍生相关工作
该数据集衍生了一系列关于模型评估方法论与排行榜生态的重要工作。基于其多任务、多轮次的评估架构,后续研究提出了更细粒度的能力诊断框架,例如通过分析模型在MMLU不同学科子集上的得分差异,揭示其在领域知识掌握上的结构性偏差。此外,该数据集还催生了关于评估指标可靠性的探讨,如针对小样本设置下准确率方差过大的问题,推动了贝叶斯统计方法在模型排名中的应用。这些衍生工作不仅深化了对大模型能力边界的理解,也为构建更公平、更具信息量的评估体系奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务