遇见数据集

open-llm-leaderboard/details_Sao10K__Stheno-1.3-L2-13B

收藏
Hugging Face2023-10-23 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型Sao10K/Stheno-1.3-L2-13B进行评估时自动创建的。它由64个配置组成,每个配置对应一个评估任务。数据集由2次运行创建,每次运行作为每个配置中的一个特定分割,分割名称使用运行的时间戳。train分割始终指向最新结果。一个额外的配置results存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。README还提供了如何使用Python中的datasets库加载运行细节的示例。

This dataset was automatically created during the evaluation of the model Sao10K/Stheno-1.3-L2-13B on the Open LLM Leaderboard. It consists of 64 configurations, each corresponding to one evaluation task. The dataset is generated from two runs, where each run serves as a specific split for each configuration, with the split name being the timestamp of the run. The train split always points to the most recent results. An additional configuration named "results" stores the aggregated results from all runs, which are used to calculate and display the aggregate metrics on the Open LLM Leaderboard. The README also provides examples of how to load run details using the Datasets library in Python.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在对模型 Sao10K/Stheno-1.3-L2-13B 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。

数据集结构

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集由 2 次运行创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Sao10K__Stheno-1.3-L2-13B", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-23T21:32:22.649999 运行 的最新结果: python { "all": { "em": 0.2075293624161074, "em_stderr": 0.0041530868871623655, "f1": 0.3234186241610759, "f1_stderr": 0.004163889670714078, "acc": 0.35670155034816864, "acc_stderr": 0.00702519954294294 }, "harness|drop|3": { "em": 0.2075293624161074, "em_stderr": 0.0041530868871623655, "f1": 0.3234186241610759, "f1_stderr": 0.004163889670714078 }, "harness|gsm8k|5": { "acc": 0.002274450341167551, "acc_stderr": 0.0013121578148674326 }, "harness|winogrande|5": { "acc": 0.7111286503551697, "acc_stderr": 0.012738241271018446 } }

配置详情

以下是数据集的配置详情:

配置列表

  • harness_arc_challenge_25

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|arc:challenge|25_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2023-09-12T18-38-55.194574.parquet
  • harness_drop_3

    • 分割:2023_10_23T21_32_22.649999
    • 路径:**/details_harness|drop|3_2023-10-23T21-32-22.649999.parquet
    • 分割:latest
    • 路径:**/details_harness|drop|3_2023-10-23T21-32-22.649999.parquet
  • harness_gsm8k_5

    • 分割:2023_10_23T21_32_22.649999
    • 路径:**/details_harness|gsm8k|5_2023-10-23T21-32-22.649999.parquet
    • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2023-10-23T21-32-22.649999.parquet
  • harness_hellaswag_10

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hellaswag|10_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-12T18-38-55.194574.parquet 等 40 个文件
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-12T18-38-55.194574.parquet 等 40 个文件
  • harness_hendrycksTest_abstract_algebra_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-09-12T18-38-55.194574.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-09-12T18-38-55.194574.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割:2023_09_12T18_38_55.194574
    • 路径:`**/details_harness|hendrycksTest-electrical_engineering|5_2023-09-
搜集汇总
数据集介绍
open-llm-leaderboard/details_Sao10K__Stheno-1.3-L2-13B 数据集图片
构建方式
该数据集是在Open LLM Leaderboard框架下,针对Sao10K/Stheno-1.3-L2-13B模型进行自动化评估过程中生成的。数据集由64个配置组成,每个配置对应一个特定的评估任务,涵盖如ARC挑战、DROP、GSM8K、HellaSwag及涵盖57个学科领域的HendrycksTest等。评估共进行了两次运行,每次运行的结果作为独立的分割(split)存储,分割名称以运行的时间戳命名,而“train”分割始终指向最新一次的评估结果。此外,还设有“results”配置,用于汇总并存储所有运行的综合指标。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集。具体而言,调用load_dataset函数,指定数据集名称(如open-llm-leaderboard/details_Sao10K__Stheno-1.3-L2-13B)和目标任务的配置名称(如harness_winogrande_5),并选择所需的分割(如“train”以获取最新结果),即可获取指定任务的评估详情。数据以Parquet文件形式组织,支持高效的列式访问,便于进行深入的数据分析与模型性能对比。
背景与挑战
背景概述
大语言模型(LLM)的评估体系是推动模型能力发展的关键基石,Open LLM Leaderboard 作为 Hugging Face 社区中广受认可的模型评测平台,为研究者提供了标准化、可复现的模型性能对比框架。该数据集诞生于 2023 年,由 Hugging Face 团队(主要联系人 Clémentine Fourrier)创建,旨在记录模型 Sao10K/Stheno-1.3-L2-13B 在多个基准任务上的详细评测结果。通过整合涵盖推理、常识、数学及多学科知识的测试集(如 ARC、HellaSwag、GSM8K、MMLU 等),该数据集系统性地揭示了该 13B 参数模型的综合能力,为后续模型优化和社区对比提供了宝贵的实证依据。
当前挑战
该数据集所面对的挑战首先源自大语言模型评测本身的领域难题:如何设计全面且无偏的基准任务以衡量模型在推理、知识记忆与数学计算等维度的真实水平。例如,GSM8K 任务中模型准确率仅 0.227%,暴露出复杂数学推理能力的显著不足。其次,数据集构建过程中面临多轮评测结果的一致性与可追溯性挑战,需通过时间戳分片(如 2023-09-12 与 2023-10-23)管理不同运行版本,并确保 64 个配置(涵盖 57 个 MMLU 子任务)的 parquet 文件结构清晰、路径无歧义,从而支持用户精准加载特定任务的细粒度结果。
常用场景
经典使用场景
在大型语言模型的评估体系中,Open LLM Leaderboard 评测数据集常被用于对模型进行多维度的标准化能力测试。该数据集涵盖了诸如 ARC-Challenge、HellaSwag、MMLU、Winogrande、GSM8K 及 DROP 等经典基准任务,旨在系统性地衡量模型在常识推理、知识理解、数学求解与文本理解等方面的表现。研究者可借助该数据集,对模型在不同任务上的精确度、召回率及 F1 分数等关键指标进行横向对比,从而全面评估其综合性能。
解决学术问题
该数据集的核心学术价值在于解决了大语言模型性能评估缺乏统一标准与可复现性的难题。通过提供结构化的任务配置与标准化评测流程,它使得不同模型之间的能力比较变得透明且可信。研究者能够基于该数据集,深入探究模型在特定任务上的优劣所在,如推理能力欠缺、知识记忆偏差或数学逻辑薄弱等学术问题,从而为模型改进指明方向,推动大语言模型领域的理论发展与技术迭代。
实际应用
在实际应用中,该数据集为模型开发与选型提供了可靠的决策依据。工业界与学术界的团队可依据数据集中的评测结果,筛选出在特定场景下表现优异的基础模型,进而进行微调或部署。例如,客服系统中需要高常识推理能力的模型,可优先参考 Winogrande 得分;而教育辅导场景则更关注 GSM8K 与 MMLU 的数学与知识表现。这种数据驱动的模型选择方式,显著提升了应用落地的效率与可靠性。
数据集最近研究
最新研究方向
在大型语言模型评测领域,Open LLM Leaderboard 已成为衡量模型综合能力的关键基准。围绕 Sao10K/Stheno-1.3-L2-13B 这一模型,当前研究聚焦于其在不同难度任务上的泛化表现与鲁棒性分析。该评估数据集通过多维度配置(如 ARC、DROP、GSM8K、WinoGrande 及涵盖57个学科的 MMLU 测试)系统性地刻画了模型在常识推理、数学求解、文本理解与专业知识应答等方面的能力边界。最新结果显示,模型在 WinoGrande 上取得了71.1%的准确率,展现出较强的常识推理潜力,但在 GSM8K 数学任务上准确率仅0.2%,揭示了其在复杂符号推理上的显著短板。这一发现推动了领域内对模型推理能力分层评估与针对性优化的研究热潮,促使研究者重新审视预训练数据分布与任务难度匹配的重要性。该数据集作为标准化评测枢纽,不仅为模型迭代提供了可复现的量化依据,更成为揭示大模型能力演化规律与瓶颈的重要工具,对推动语言模型向更可靠、更通用的方向演进具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务