遇见数据集

open-llm-leaderboard/details_wtang06__mpt-125m-c4

收藏
Hugging Face2024-03-05 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型wtang06/mpt-125m-c4的评估运行期间自动创建的,用于Open LLM Leaderboard的评估。数据集包含64个配置,每个配置对应一个评估任务。数据集由5次运行生成,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

This dataset was automatically created during the evaluation runs of the model wtang06/mpt-125m-c4, and is used for evaluations on the Open LLM Leaderboard. The dataset consists of 64 configurations, each corresponding to one evaluation task. This dataset is generated from 5 separate runs, where the results of each run serve as a dataset split under a specific configuration, with the split name being the timestamp of the corresponding run. The train split always points to the most recent results. In addition, the "results" configuration stores the aggregated results from all runs, which are used to calculate and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在评估模型 wtang06/mpt-125m-c4Open LLM Leaderboard 上的自动创建的。数据集包含 64 个配置,每个配置对应一个评估任务。

数据集结构

数据集由 5 次运行结果组成,每个运行结果作为一个特定的分割存在于每个配置中,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

额外配置

一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_wtang06__mpt-125m-c4", "harness_winogrande_5", split="train")

最新结果

以下是 2024-03-05T14:27:55.151065 运行的最新结果

python { "all": { "acc": 0.23196194129343728, "acc_stderr": 0.029934654752561563, "acc_norm": 0.2314240573187148, "acc_norm_stderr": 0.03071122006512167, "mc1": 1.0, "mc1_stderr": 0.0, "mc2": NaN, "mc2_stderr": NaN }, "harness|arc:challenge|25": { "acc": 0.22696245733788395, "acc_stderr": 0.012240491536132861, "acc_norm": 0.22696245733788395, "acc_norm_stderr": 0.012240491536132861 }, "harness|hellaswag|10": { "acc": 0.2504481179047998, "acc_stderr": 0.004323856300539177, "acc_norm": 0.2504481179047998, "acc_norm_stderr": 0.004323856300539177 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.22, "acc_stderr": 0.04163331998932268, "acc_norm": 0.22, "acc_norm_stderr": 0.04163331998932268 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.18518518518518517, "acc_stderr": 0.03355677216313142, "acc_norm": 0.18518518518518517, "acc_norm_stderr": 0.03355677216313142 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.17763157894736842, "acc_stderr": 0.031103182383123398, "acc_norm": 0.17763157894736842, "acc_norm_stderr": 0.031103182383123398 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.3, "acc_stderr": 0.046056618647183814, "acc_norm": 0.3, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.21509433962264152, "acc_stderr": 0.02528839450289137, "acc_norm": 0.21509433962264152, "acc_norm_stderr": 0.02528839450289137 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.2569444444444444, "acc_stderr": 0.03653946969442099, "acc_norm": 0.2569444444444444, "acc_norm_stderr": 0.03653946969442099 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.2, "acc_stderr": 0.04020151261036845, "acc_norm": 0.2, "acc_norm_stderr": 0.04020151261036845 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.26, "acc_stderr": 0.0440844002276808, "acc_norm": 0.26, "acc_norm_stderr": 0.0440844002276808 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.21, "acc_stderr": 0.040936018074033256, "acc_norm": 0.21, "acc_norm_stderr": 0.040936018074033256 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.20809248554913296, "acc_stderr": 0.030952890217749874, "acc_norm": 0.20809248554913296, "acc_norm_stderr": 0.030952890217749874 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.21568627450980393, "acc_stderr": 0.04092563958237654, "acc_norm": 0.21568627450980393, "acc_norm_stderr": 0.04092563958237654 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.28, "acc_stderr": 0.045126085985421276, "acc_norm": 0.28, "acc_norm_stderr": 0.045126085985421276 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.26382978723404255, "acc_stderr": 0.028809989854102973, "acc_norm": 0.26382978723404255, "acc_norm_stderr": 0.028809989854102973 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.23684210526315788, "acc_stderr": 0.039994238792813365, "acc_norm": 0.23684210526315788, "acc_norm_stderr": 0.039994238792813365 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.2413793103448276, "acc_stderr": 0.03565998174135302, "acc_norm": 0.2413793103448276, "acc_norm_stderr": 0.03565998174135302 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.20899470899470898, "acc_stderr": 0.02094048156533486, "acc_norm": 0.20899470899470898, "acc_norm_stderr": 0.02094048156533486 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.2857142857142857, "acc_stderr": 0.04040610178208841, "acc_norm": 0.2857142857142857, "acc_norm_stderr": 0.04040610178208841 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.18, "acc_stderr": 0.038612291966536934, "acc_norm": 0.18, "acc_norm_stderr": 0.038612291966536934 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.1774193548387097, "acc_stderr": 0.02173254068932927, "acc_norm": 0.1774193548387097, "acc_norm_stderr": 0.02173254068932927 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.15270935960591134, "acc_stderr": 0.02530890453938063, "acc_norm": 0.15270935960591134, "acc_norm_stderr": 0.02530890453938063 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.25, "acc_stderr": 0.04351941398892446, "acc_norm": 0.25, "acc_norm_stderr": 0.04351941398892446 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.21818181818181817, "acc_stderr": 0.03225078108306289, "acc_norm": 0.21818181818181817, "acc_norm_stderr": 0.03225078108306289 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.17676767676767677, "acc_stderr": 0.027178752639044915, "acc_norm": 0.17676767676767677, "acc_norm_stderr": 0.027178752639044915 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.19689119170984457, "acc_stderr": 0.028697873971860664, "acc_norm": 0.19689119170984457, "acc_norm_stderr": 0.028697873971860664 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.20256410256410257, "acc_stderr": 0.020377660970371372, "acc_norm": 0.20256410256410257, "acc_norm_stderr": 0.020377660970371372 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.2111111111111111, "acc_stderr": 0.024882116857655075, "acc_norm": 0.2111111111111111, "acc_norm_stderr": 0.024882116857655075 }, "harness|hendrycksTest-high_school_microeconomics|5

搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 提供了一个标准化的评测平台,而该数据集正是为记录模型 wtang06/mpt-125m-c4 在 Leaderboard 上的评估运行而生。数据集通过自动化流程,在每次模型评估运行时动态生成,共包含 64 个配置,每个配置对应一项被评估的任务。这些配置源自 5 次独立的运行,每次运行的结果被存储为特定的数据拆分,拆分名称以该运行的时间戳命名,而“train”拆分则始终指向最新一次运行的结果。此外,一个名为“results”的额外配置汇集了所有运行的聚合指标,用于计算和展示 Leaderboard 上的总体评分。
使用方法
使用该数据集时,研究者可通过 Hugging Face 的 datasets 库便捷加载。加载过程需指定具体任务配置和所需的时间拆分,例如通过 `load_dataset("open-llm-leaderboard/details_wtang06__mpt-125m-c4", "harness_winogrande_5", split="train")` 获取 Winogrande 任务的最新评估细节。若需访问历史结果,可将拆分名称替换为对应的时间戳字符串。此外,通过加载“results”配置,可一键获取所有任务的聚合指标,便于进行横向对比与综合性能评估。这种设计使得数据集既能满足细粒度的单任务分析,也支持宏观的模型表现概览。
背景与挑战
背景概述
在大型语言模型(LLM)能力评估领域,Open LLM Leaderboard 作为由 Hugging Face 团队于2023年发起的重要基准平台,致力于系统化、标准化地衡量各类开源模型的推理、常识与知识掌握水平。该数据集记录了模型 wtang06/mpt-125m-c4 在多个评测任务上的表现,涵盖 ARC-Challenge、HellaSwag、MMLU 多学科知识、TruthfulQA、Winogrande 及 GSM8K 等广泛维度。通过对这一轻量级模型(125M参数)的细致评估,研究者得以洞察小规模模型在复杂语言理解与数学推理任务中的能力边界,为模型压缩与高效部署提供了关键参照。该数据集的持续更新与开放性,使其成为社区追踪模型演进、比较不同架构性能的重要资源。
当前挑战
当前数据集面临的核心挑战集中于两大方面。其一,在领域问题层面,小参数模型如 mpt-125m-c4 在需要深度推理与广泛知识整合的任务(如 GSM8K 数学推理、MMLU 专业学科测试)中表现显著不足,准确率常低于随机水平,暴露出当前轻量级模型在复杂认知任务上的根本性局限。其二,在构建过程中,数据集需整合来自多次运行、多时间戳的评测结果,不同任务配置(如 few-shot 样本数差异)与评测版本演进带来了数据一致性与可比性的难题。此外,部分任务(如 TruthfulQA 的 mc2 指标)存在缺失值,反映出评测流程中标准化与完备性仍有待提升。
常用场景
经典使用场景
在大规模语言模型评估领域,该数据集作为Open LLM Leaderboard的标准化评测记录载体,被广泛用于复现和验证模型性能。研究者可通过加载特定任务配置(如harness_arc_challenge_25)获取模型在ARC挑战、HellaSwag、GSM8K等基准上的细粒度结果,从而横向对比不同模型在常识推理、数学求解、知识理解等维度的能力差异。其结构化存储方式支持按时间戳追溯多次评测历史,为模型迭代优化提供了可重复的实验基准。
解决学术问题
该数据集系统性地解决了语言模型评估中结果碎片化与不可复现的学术痛点。通过整合ARC挑战、HellaSwag、MMLU等57项子任务,它构建了涵盖推理、知识、伦理等多维度的评测矩阵。研究者得以精准定位模型在特定领域(如高中物理、医学遗传学)的薄弱环节,并利用标准化指标(acc_norm、mc1等)消除不同评测框架间的度量偏差,推动了模型能力评估的规范化进程。
实际应用
在工业界,该数据集支撑着模型选型与部署前的性能预判。企业可依据其在Winogrande(指代消解)和TruthfulQA(事实性)等任务上的表现,筛选出适合客服对话、知识问答等场景的基座模型。同时,评测记录的版本化存储使模型迭代效果可追溯,为产品升级提供量化决策依据。例如,GSM8K的零分结果直接揭示了模型在数学推理上的局限性,引导开发者针对性优化。
数据集最近研究
最新研究方向
该数据集记录了开源大语言模型mpt-125m-c4在Open LLM Leaderboard上的完整评测轨迹,涵盖ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等多项基准测试的细粒度性能指标。当前研究聚焦于利用此类标准化评测数据集系统评估小型语言模型在常识推理、知识理解与数学推理等多维度能力上的表现,其核心价值在于为模型迭代提供可复现的量化基准,并揭示模型在特定任务(如GSM8K数学推理中准确率为0)上的显著短板,从而指引参数高效微调与领域适配等优化方向。这一评测框架的普及正推动着开放语言模型生态向更透明、更具可比性的方向演进,为后续轻量级模型在资源受限场景下的部署可行性研究奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务