遇见数据集

open-llm-leaderboard/details_localfultonextractor__Erosumika-7B-v2

收藏
Hugging Face2024-03-24 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在模型 localfultonextractor/Erosumika-7B-v2 在 Open LLM Leaderboard 上的评估过程中自动创建的。数据集由 63 个配置组成,每个配置对应一个评估任务。数据集包含一次运行的结果,每次运行都存储为一个特定的拆分,并以运行的时间戳命名。train 拆分始终指向最新的结果。此外,results 配置存储了所有运行的聚合结果,用于在 Open LLM Leaderboard 上计算和显示聚合指标。可以使用 Hugging Face 的 datasets 库加载数据集,并提供了特定运行的最新结果的 JSON 格式。

该数据集是在模型 localfultonextractor/Erosumika-7B-v2 在 Open LLM Leaderboard 上的评估过程中自动创建的。数据集由 63 个配置组成,每个配置对应一个评估任务。数据集包含一次运行的结果,每次运行都存储为一个特定的拆分,并以运行的时间戳命名。train 拆分始终指向最新的结果。此外,results 配置存储了所有运行的聚合结果,用于在 Open LLM Leaderboard 上计算和显示聚合指标。可以使用 Hugging Face 的 datasets 库加载数据集,并提供了特定运行的最新结果的 JSON 格式。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称

  • pretty_name: Evaluation run of localfultonextractor/Erosumika-7B-v2

数据集描述

数据集组成

  • 包含63个配置,每个配置对应一个评估任务。
  • 数据集由1次运行创建,每次运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳命名。
  • “train”分割始终指向最新结果。
  • 额外配置“results”存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

数据集加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_localfultonextractor__Erosumika-7B-v2", "harness_winogrande_5", split="train")

最新结果

  • 最新结果来自2024-03-24T19:59:34.099586的运行,详细结果见此处。

数据集配置详情

配置列表

  • config_name: harness_arc_challenge_25

    • data_files:
      • split: 2024_03_24T19_59_34.099586
        • path: **/details_harness|arc:challenge|25_2024-03-24T19-59-34.099586.parquet
      • split: latest
        • path: **/details_harness|arc:challenge|25_2024-03-24T19-59-34.099586.parquet
  • config_name: harness_gsm8k_5

    • data_files:
      • split: 2024_03_24T19_59_34.099586
        • path: **/details_harness|gsm8k|5_2024-03-24T19-59-34.099586.parquet
      • split: latest
        • path: **/details_harness|gsm8k|5_2024-03-24T19-59-34.099586.parquet
  • config_name: harness_hellaswag_10

    • data_files:
      • split: 2024_03_24T19_59_34.099586
        • path: **/details_harness|hellaswag|10_2024-03-24T19-59-34.099586.parquet
      • split: latest
        • path: **/details_harness|hellaswag|10_2024-03-24T19-59-34.099586.parquet
  • config_name: harness_hendrycksTest_5

    • data_files:
      • split: 2024_03_24T19_59_34.099586
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2024-03-24T19-59-34.099586.parquet
      • split: latest
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2024-03-24T19-59-34.099586.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2024-03-24T19-59-34.099586.parquet
搜集汇总
数据集介绍
构建方式
该数据集源自Open LLM Leaderboard对模型localfultonextractor/Erosumika-7B-v2的自动化评估流程。在评估过程中,系统将模型在63个不同任务上的表现结果进行结构化存储,每个任务对应一个独立的配置项。数据集由单次运行产生,每次运行的结果以时间戳为标识被划分为特定分割,而“train”分割则始终指向最新一次的评估数据。此外,还专门设置了“results”配置,用于汇总并存储所有任务的聚合指标,以便在排行榜上展示模型的综合性能。
使用方法
使用该数据集时,研究者可通过HuggingFace的datasets库进行加载。例如,利用load_dataset函数并指定配置名称(如"harness_winogrande_5")及分割(如"train"),即可获取特定任务的评估详情。若需访问历史运行结果,可依据时间戳命名的分割进行加载。此外,通过读取"results"配置,能够直接获取模型在所有任务上的聚合性能数据,便于进行综合分析与报告生成。
背景与挑战
背景概述
随着大语言模型(LLM)在自然语言处理领域的迅猛发展,如何系统、公正地评估模型在多样任务上的综合能力已成为研究焦点。Open LLM Leaderboard由Hugging Face团队(主要联系人Clémentine Fourrier)于2023年发起,旨在通过标准化基准对开源LLM进行多维度评测。该数据集记录了模型localfultonextractor/Erosumika-7B-v2在2024年3月的一次完整评估运行,涵盖ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等63项任务,覆盖常识推理、知识问答、数学求解与语言理解等核心能力。作为开放评测生态的重要组件,该数据集不仅为模型开发者提供了透明可复现的性能快照,更推动了社区对LLM能力边界的量化认知,成为衡量开源模型进步的关键标尺。
当前挑战
当前LLM评估面临的核心挑战在于任务多样性与评测公平性的平衡。该数据集所解决的领域问题包括:1)多任务泛化能力的统一度量——需在常识推理(如HellaSwag)、科学知识(MMLU)及数学推理(GSM8K)等异构任务上设计合理指标,避免单一基准的片面性;2)构建过程中的技术挑战——需处理63个配置的自动化数据管道,确保每次运行的时间戳、结果文件与模型输出严格对应,并维护“latest”分片以动态更新。此外,评测结果受提示格式、采样参数(如few-shot数量)及随机种子影响,如何控制这些变量以保障跨模型可比性,仍是持续存在的工程与统计难题。
常用场景
经典使用场景
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard的评估运行记录,经典使用场景在于系统性地量化模型localfultonextractor/Erosumika-7B-v2在多样化任务上的表现。数据集涵盖63个配置,对应ARC挑战赛、HellaSwag、GSM8K、WinoGrande、TruthfulQA及涵盖57个学科的MMLU基准测试等核心评测任务,为研究者提供细粒度的准确率与标准误差指标。通过加载特定任务配置(如harness_winogrande_5),研究者可复现模型在常识推理、数学求解、知识理解等维度的能力评估,从而构建模型性能的完整画像。
解决学术问题
该数据集有效解决了大语言模型评估中缺乏标准化、可复现细粒度结果记录的问题。在学术研究中,模型性能对比常因评测流程差异而失真,此数据集通过固定评测框架(如语言模型评估工具)和统一指标(如acc与acc_norm),为跨模型比较提供了可信基准。其重要意义在于推动评估透明化——研究者可追溯每次运行的原始结果,分析模型在不同难度层级(如高中物理与大学数学)的表现差异,进而揭示模型在知识广度与推理深度上的局限性,为模型改进指明方向。
实际应用
在实际应用中,该数据集为模型选型与部署决策提供了数据驱动的依据。企业或开发者可依据Erosumika-7B-v2在GSM8K(数学推理)和TruthfulQA(事实一致性)上的得分,判断其是否适合集成到教育辅导、智能问答等产品中。此外,数据集记录的57个学科MMLU成绩,可指导领域特定应用的模型微调策略——例如,若模型在临床知识任务上表现优异,则优先考虑医疗场景部署,从而降低试错成本,提升AI系统的实用价值。
数据集最近研究
最新研究方向
当前,大语言模型(LLM)的性能评估已成为人工智能领域的热点议题,而Open LLM Leaderboard作为权威的竞技平台,正引领着模型能力的量化比较潮流。Erosumika-7B-v2模型在该榜单上的评测数据集,不仅涵盖了ARC、HellaSwag、GSM8K等经典基准,更深入触及了MMLU中从抽象代数到病毒学等57个专业学科的细粒度知识,其评估结果揭示了模型在推理、常识及多领域知识上的综合表现。这一研究方向聚焦于构建标准化、多维度的评测体系,旨在通过透明化的榜单机制,推动LLM在复杂任务上的持续进化,其影响力已辐射至模型选型、学术竞赛及工业部署,为理解模型能力边界与优化方向提供了关键的数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务