遇见数据集

open-llm-leaderboard-old/details_frankenmerger__cosmo-3b-test

收藏
Hugging Face2024-03-10 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型frankenmerger/cosmo-3b-test进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置的特定分割中找到,分割名称使用运行的时间戳命名。train分割始终指向最新结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在Open LLM Leaderboard上对模型frankenmerger/cosmo-3b-test进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置的特定分割中找到,分割名称使用运行的时间戳命名。train分割始终指向最新结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

该数据集是在对模型 frankenmerger/cosmo-3b-test 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建,每个运行可以在每个配置中作为一个特定的分片找到,分片名称使用运行的时间戳。
  • "train" 分片始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算并在 Open LLM Leaderboard 上显示聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_frankenmerger__cosmo-3b-test", "harness_winogrande_5", split="train")

最新结果

以下是 2024-03-10T11:35:15.251120 运行 的最新结果:

python { "all": { "acc": 0.2759591596623969, "acc_stderr": 0.03167318249653025, "acc_norm": 0.2781335496872269, "acc_norm_stderr": 0.03246050452019378, "mc1": 0.22399020807833536, "mc1_stderr": 0.014594964329474207, "mc2": 0.39020128384630975, "mc2_stderr": 0.014969681174597876 }, "harness|arc:challenge|25": { "acc": 0.3293515358361775, "acc_stderr": 0.013734057652635474, "acc_norm": 0.3532423208191126, "acc_norm_stderr": 0.013967822714840055 }, "harness|hellaswag|10": { "acc": 0.4144592710615415, "acc_stderr": 0.004916216503770342, "acc_norm": 0.5236008763194583, "acc_norm_stderr": 0.004984219681732656 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.31, "acc_stderr": 0.04648231987117316, "acc_norm": 0.31, "acc_norm_stderr": 0.04648231987117316 }, # 其他任务的结果省略... }

配置详情

  • harness_arc_challenge_25

    • 分片: 2024_03_10T11_35_15.251120, latest
    • 路径: **/details_harness|arc:challenge|25_2024-03-10T11-35-15.251120.parquet
  • harness_gsm8k_5

    • 分片: 2024_03_10T11_35_15.251120, latest
    • 路径: **/details_harness|gsm8k|5_2024-03-10T11-35-15.251120.parquet
  • harness_hellaswag_10

    • 分片: 2024_03_10T11_35_15.251120, latest
    • 路径: **/details_harness|hellaswag|10_2024-03-10T11-35-15.251120.parquet
  • harness_hendrycksTest_5

    • 分片: 2024_03_10T11_35_15.251120, latest
    • 路径: 多个路径,包括 **/details_harness|hendrycksTest-abstract_algebra|5_2024-03-10T11-35-15.251120.parquet 等。
搜集汇总
数据集介绍
open-llm-leaderboard-old/details_frankenmerger__cosmo-3b-test 数据集图片
构建方式
该数据集源自Open LLM Leaderboard对frankenmerger/cosmo-3b-test模型的自动化评估流程。构建过程中,系统依据模型在63个预设评测任务上的表现,逐一生成对应的配置项,每项配置均对应一个独立评测任务。数据集由单次运行产生,每次运行的结果以时间戳命名的分割形式存储,而'train'分割则始终指向最新一次运行的评测数据。此外,专门设立的'results'配置汇总了所有任务的聚合指标,用于在Leaderboard上计算并展示模型的综合性能。
特点
该数据集的核心特色在于其结构化的多任务评测体系,覆盖了从常识推理、数学运算到多学科知识问答等广泛领域,例如ARC-Challenge、HellaSwag、GSM8K以及涵盖57个学科的MMLU测试。每个任务配置均包含详细的准确率及标准误差等细粒度指标,便于研究者深入分析模型在各维度上的能力边界。数据集还通过时间戳分割保留了历史运行记录,支持对模型性能的纵向追踪与对比分析。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载该数据集。以加载winogrande任务的评测结果为例,使用load_dataset函数并指定配置名'harness_winogrande_5'及分割'train'即可获取最新数据。对于需要访问历史运行结果的情形,可依据具体时间戳选择对应分割。此外,加载'results'配置可获取所有任务的聚合指标,为模型整体性能评估提供一站式数据支持。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的浪潮中,如何系统、公正地评估各模型的综合能力成为学界与工业界共同关注的核心议题。Open LLM Leaderboard应运而生,由Hugging Face团队于2023年创建,旨在通过标准化基准测试集,为开源社区提供可复现的模型性能对比平台。该数据集记录了frankenmerger/cosmo-3b-test模型在2024年3月10日的全面评估结果,涵盖ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等63项子任务,横跨常识推理、数学求解、知识问答与伦理判断等多个维度。作为Open LLM Leaderboard生态的重要组成部分,该数据集不仅为模型开发者提供了细粒度的性能反馈,更推动了开源LLM评估体系的透明化与规范化,对理解中等规模模型(3B参数)的能力边界具有重要参考价值。
当前挑战
当前数据集面临的核心挑战聚焦于两大层面。在领域问题层面,GSM8K数学推理任务中模型仅取得1.36%的准确率,揭示了3B参数模型在复杂符号推理与多步计算上的显著短板;MMLU多项学科测试中,模型在人类衰老、形式逻辑等领域的准确率低于25%,暴露了其专业知识的覆盖深度不足。在构建过程层面,评估结果依赖单次运行(2024年3月10日),缺乏多次重复实验以消除随机性波动;63项任务各自独立存储为parquet文件,整合分析需频繁跨配置加载数据,增加了用户复现与横向比较的工程成本。此外,训练数据与评估基准间的潜在重叠可能引发数据泄露,影响评分的可信度,而模型在不同任务间的性能波动(如Winogrande达54.3%而GSM8K仅1.36%)也暗示了任务难度分布的不均衡性,亟需更精细的难度分层与鲁棒的评估协议。
常用场景
经典使用场景
在大型语言模型(LLM)评估领域,该数据集作为Open LLM Leaderboard的评测运行记录,为研究者提供了对模型‘frankenmerger/cosmo-3b-test’在63个任务配置下的细粒度性能追踪。其经典使用场景在于系统性地记录模型在ARC-Challenge、HellaSwag、GSM8K、TruthfulQA及涵盖57个学科领域的MMLU基准上的准确率与标准误差,从而支持对模型推理、常识理解及数学能力的横向比较与复现分析。
衍生相关工作
该数据集衍生了一系列关于LLM评估方法论与基准分析的开创性工作。例如,研究者利用其多任务结果验证了不同提示策略(如few-shot设置)对模型表现的影响,并推动了基于Leaderboard的模型排名系统与自动化评估管线的标准化。此外,其细粒度错误分析还催生了针对模型在数学推理与事实一致性方面缺陷的专项改进研究。
数据集最近研究
最新研究方向
当前,大语言模型评估领域正聚焦于构建标准化、可复现的评测基准,以系统性地衡量模型在多样化认知任务中的表现。open-llm-leaderboard-old/details_frankenmerger__cosmo-3b-test数据集正是这一趋势的典型产物,它记录了对frankenmerger/cosmo-3b-test模型在Open LLM Leaderboard上的完整评估结果,涵盖ARC挑战赛、HellaSwag、GSM8K及涵盖57个学科领域的MMLU等核心基准。该数据集的涌现与HuggingFace社区推动的开放评测运动紧密相关,其结构化存储了模型在常识推理、数学求解、专业知识问答等前沿方向上的细粒度性能指标,为研究者提供了分析模型能力边界与弱点的重要素材。通过公开评估细节,该数据集不仅促进了模型间的公平比较,更推动了评估流程的透明化与标准化,对引导大语言模型向更可靠、更通用方向演进具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务