遇见数据集

open-llm-leaderboard-old/details_migtissera__Tess-10.7B-v1.5

收藏
Hugging Face2024-01-27 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型migtissera/Tess-10.7B-v1.5进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。它包含1次运行的结果,每次运行都作为每个配置中的一个特定分割存储。train分割始终指向最新的结果。此外,名为results的配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载数据集的示例。

该数据集是在Open LLM Leaderboard上对模型migtissera/Tess-10.7B-v1.5进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。它包含1次运行的结果,每次运行都作为每个配置中的一个特定分割存储。train分割始终指向最新的结果。此外,名为results的配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载数据集的示例。

原始信息汇总

数据集概述

数据集摘要

该数据集是在评估模型 migtissera/Tess-10.7B-v1.5 在 Open LLM Leaderboard 上的运行过程中自动创建的。数据集包含 63 个配置,每个配置对应一个评估任务。数据集从 1 次运行中创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

数据集结构

数据集包含多个配置,每个配置对应不同的评估任务。以下是部分配置的详细信息:

  • 配置名称: harness_arc_challenge_25

    • 数据文件:
      • 分割: 2024_01_27T08_16_07.104140
        • 路径: **/details_harness|arc:challenge|25_2024-01-27T08-16-07.104140.parquet
      • 分割: latest
        • 路径: **/details_harness|arc:challenge|25_2024-01-27T08-16-07.104140.parquet
  • 配置名称: harness_gsm8k_5

    • 数据文件:
      • 分割: 2024_01_27T08_16_07.104140
        • 路径: **/details_harness|gsm8k|5_2024-01-27T08-16-07.104140.parquet
      • 分割: latest
        • 路径: **/details_harness|gsm8k|5_2024-01-27T08-16-07.104140.parquet
  • 配置名称: harness_hellaswag_10

    • 数据文件:
      • 分割: 2024_01_27T08_16_07.104140
        • 路径: **/details_harness|hellaswag|10_2024-01-27T08-16-07.104140.parquet
      • 分割: latest
        • 路径: **/details_harness|hellaswag|10_2024-01-27T08-16-07.104140.parquet
  • 配置名称: harness_hendrycksTest_5

    • 数据文件:
      • 分割: 2024_01_27T08_16_07.104140
        • 路径:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_computer_science|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_european_history|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_geography|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_mathematics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_microeconomics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_physics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_psychology|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_statistics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_us_history|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-high_school_world_history|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-human_aging|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-human_sexuality|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-international_law|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-jurisprudence|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-logical_fallacies|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-machine_learning|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-management|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-marketing|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-medical_genetics|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-miscellaneous|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-moral_disputes|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-moral_scenarios|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-nutrition|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-philosophy|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-prehistory|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-professional_accounting|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-professional_law|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-professional_medicine|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-professional_psychology|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-public_relations|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-security_studies|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-sociology|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-us_foreign_policy|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-virology|5_2024-01-27T08-16-07.104140.parquet
          • **/details_harness|hendrycksTest-world_religions|5_2024-01-27T08-16-07.104140.parquet

最新结果

以下是 最新结果 的摘要:

python { "all": { "acc": 0.6513655424521041, "acc_stderr": 0.03165794538741113, "acc_norm": 0.6541051437423594, "acc_norm_stderr": 0.032296434557489546, "mc1": 0.32558139534883723, "mc1_stderr": 0.01640398946990783, "mc2": 0.47430080710659894, "mc2_stderr": 0.014677705750823734 }, "harness|arc:challenge|25": { "acc": 0.60580204778157, "acc_stderr": 0.01428052266746

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_migtissera__Tess-10.7B-v1.5 数据集图片
构建方式
在大型语言模型的评估体系中,Open LLM Leaderboard 扮演着至关重要的角色,为模型性能的横向比较提供了标准化平台。该数据集正是针对 migtissera/Tess-10.7B-v1.5 模型在 Leaderboard 上进行评估时自动生成的产物。其构建方式基于单一评估运行,涵盖了多达63个不同的任务配置,每个配置对应一项被评估的基准任务。每个评估运行的时间戳被用作数据集中的特定分割标识,而名为“train”的分割则始终指向最新一次的评估结果。此外,数据集还包含一个名为“results”的独立配置,专门存储所有任务的聚合结果,用于在 Leaderboard 上计算和展示综合性能指标。
特点
该数据集最显著的特征在于其结构化与层次分明的组织逻辑。它并非简单的数据堆砌,而是通过63个细粒度的配置,将模型在诸如 ARC-Challenge、HellaSwag、GSM8K 以及涵盖多学科知识的 MMLU 等广泛任务上的表现逐一归档。每个配置下的数据以 Parquet 格式存储,保证了高效的数据读取与处理能力。数据集的时间戳分割机制允许用户回溯历史评估记录,而“latest”分割则确保了数据始终代表模型的最新性能状态,为追踪模型迭代带来的变化提供了便利。
使用方法
研究人员与开发者可以通过 HuggingFace 的 datasets 库便捷地调用该数据集。具体而言,利用 load_dataset 函数,指定数据集名称与目标任务配置(例如“harness_winogrande_5”),并通过 split 参数选择“train”以获取最新结果,或选择对应的时间戳分割以访问历史数据。这种设计使得对模型在特定任务上的细粒度性能分析变得轻而易举,同时也支持对多次评估结果进行对比研究,从而深入理解模型的能力边界与演变趋势。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的时代背景下,如何公正、全面地评估模型性能成为推动领域进步的关键。Hugging Face团队与研究人员于2023年共同发起了Open LLM Leaderboard项目,旨在为开源大语言模型提供标准化、可复现的评测基准。该数据集正是为此而生,记录了模型migtissera/Tess-10.7B-v1.5在2024年1月27日的评测结果。作为评测体系的核心组件,该数据集涵盖了ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande、GSM8K等63项任务配置,全面检验模型在常识推理、知识理解、数学计算与事实一致性等多维度的能力。这一系统化的评估框架不仅为研究者提供了横向对比模型的可靠依据,更推动了开源社区对LLM能力的深入认知与优化方向的确立。
当前挑战
该数据集所面临的挑战主要源于两大层面。在领域问题层面,LLM评测的核心挑战在于如何设计能够真实反映模型泛化能力与鲁棒性的任务集合。现有基准虽覆盖广泛,但难以完全规避数据泄露风险,且模型在特定任务上的高分可能掩盖其在真实场景中的脆弱性。在构建过程中,挑战则体现为评测流程的标准化与可复现性——需确保每次运行的环境、提示格式与评分规则严格一致,以消除随机波动对结果的影响。此外,面对日益增长的模型规模与任务复杂度,如何在有限算力下高效完成全量评测,同时维护数据集的版本迭代与长期可用性,亦是持续存在的技术难题。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard的评测记录,经典使用场景在于系统性地评估大语言模型(如Tess-10.7B-v1.5)在多维度任务上的性能。它涵盖了从常识推理(如ARC-Challenge、HellaSwag)到数学问题求解(GSM8K)、从知识问答(MMLU的57个学科)到对抗性真实性检测(TruthfulQA)等多样化基准。研究者可通过加载不同配置(如harness_arc_challenge_25)的详细结果,深入分析模型在特定任务上的表现,从而为模型优化提供数据支撑。
衍生相关工作
该数据集衍生了一系列重要的基准测试工作,如Open LLM Leaderboard本身成为社区模型评测的权威参考。相关研究包括基于该数据集的模型能力对比分析、不同训练策略(如指令微调、强化学习)对评测结果的影响研究,以及针对特定任务(如MMLU子集)的难度加权评估方法。这些工作进一步深化了对大语言模型泛化能力的理解,并催生了更高效的评测工具与协议。
数据集最近研究
最新研究方向
当前,大语言模型(LLM)的评估体系正从单一基准向多维度、细粒度、可复现的标准化平台演进。在此背景下,Open LLM Leaderboard作为业界标杆,其评估运行数据集(如针对migtissera/Tess-10.7B-v1.5模型)的构建,代表了前沿研究方向:即通过自动化流程生成包含63个配置、覆盖ARC-Challenge、HellaSwag、GSM8K等核心推理与知识任务的异构评估数据,并采用规范化的时间戳分片与聚合结果存储机制。这一工作不仅实现了模型在常识推理、数学解题及多学科知识(如医学、法律、哲学)等57个细项上的性能量化,更通过公开的Parquet格式与可复现的加载接口,推动了评估透明化与协作标准化。其深远意义在于,为社区提供了动态追踪模型迭代效果、横向对比不同架构(如10.7B参数级)能力的可靠基准,从而加速了LLM在可信度、鲁棒性及领域泛化性上的优化进程,并间接促进了如Tess系列模型在复杂逻辑与专业问答场景中的实用化落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务