遇见数据集

open-llm-leaderboard/details__fsx_shared-falcon-180B_2100

收藏
Hugging Face2023-09-11 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型_fsx_shared-falcon-180B_2100进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由2次运行创建,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

This dataset was automatically generated during the evaluation of the model _fsx_shared-falcon-180B_2100 on the Open LLM Leaderboard. It contains 61 configurations, each corresponding to one evaluation task. The dataset is constructed from two runs, where the results of each run are stored as a split under a specific configuration, with the split name being the timestamp of the corresponding run. The train split always points to the most recent evaluation result. Additionally, there is a configuration named "results" that stores the aggregated results across all runs, which is utilized to calculate and display aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在对模型 _fsx_shared-falcon-180B_2100 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。

数据集组成

  • 数据集包含 61 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details__fsx_shared-falcon-180B_2100", "harness_truthfulqa_mc_0", split="train")

最新结果

以下是 2023-09-11T14:38:41.751680 运行的最新结果:

python { "all": { "acc": 0.7013964110418803, "acc_stderr": 0.030702382053756392, "acc_norm": 0.7050725401087311, "acc_norm_stderr": 0.030672281323978368, "mc1": 0.3157894736842105, "mc1_stderr": 0.016272287957916916, "mc2": 0.4692416686068408, "mc2_stderr": 0.014108890624515822 }, "harness|arc:challenge|25": { "acc": 0.6544368600682594, "acc_stderr": 0.013896938461145677, "acc_norm": 0.6860068259385665, "acc_norm_stderr": 0.013562691224726288 }, "harness|hellaswag|10": { "acc": 0.7061342362079267, "acc_stderr": 0.004546002255456772, "acc_norm": 0.8914558852818164, "acc_norm_stderr": 0.003104306434972476 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.23, "acc_stderr": 0.04229525846816506, "acc_norm": 0.23, "acc_norm_stderr": 0.04229525846816506 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6370370370370371, "acc_stderr": 0.04153948404742398, "acc_norm": 0.6370370370370371, "acc_norm_stderr": 0.04153948404742398 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.7763157894736842, "acc_stderr": 0.033911609343436046, "acc_norm": 0.7763157894736842, "acc_norm_stderr": 0.033911609343436046 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.74, "acc_stderr": 0.04408440022768081, "acc_norm": 0.74, "acc_norm_stderr": 0.04408440022768081 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.7471698113207547, "acc_stderr": 0.026749899771241214, "acc_norm": 0.7471698113207547, "acc_norm_stderr": 0.026749899771241214 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.8333333333333334, "acc_stderr": 0.031164899666948607, "acc_norm": 0.8333333333333334, "acc_norm_stderr": 0.031164899666948607 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.48, "acc_stderr": 0.050211673156867795, "acc_norm": 0.48, "acc_norm_stderr": 0.050211673156867795 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.59, "acc_stderr": 0.04943110704237102, "acc_norm": 0.59, "acc_norm_stderr": 0.04943110704237102 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.33, "acc_stderr": 0.047258156262526045, "acc_norm": 0.33, "acc_norm_stderr": 0.047258156262526045 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.7283236994219653, "acc_stderr": 0.03391750322321659, "acc_norm": 0.7283236994219653, "acc_norm_stderr": 0.03391750322321659 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.37254901960784315, "acc_stderr": 0.04810840148082635, "acc_norm": 0.37254901960784315, "acc_norm_stderr": 0.04810840148082635 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.83, "acc_stderr": 0.03775251680686371, "acc_norm": 0.83, "acc_norm_stderr": 0.03775251680686371 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.6595744680851063, "acc_stderr": 0.030976692998534446, "acc_norm": 0.6595744680851063, "acc_norm_stderr": 0.030976692998534446 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.4649122807017544, "acc_stderr": 0.04692008381368909, "acc_norm": 0.4649122807017544, "acc_norm_stderr": 0.04692008381368909 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.6344827586206897, "acc_stderr": 0.04013124195424386, "acc_norm": 0.6344827586206897, "acc_norm_stderr": 0.04013124195424386 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.4947089947089947, "acc_stderr": 0.02574986828855657, "acc_norm": 0.4947089947089947, "acc_norm_stderr": 0.02574986828855657 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4603174603174603, "acc_stderr": 0.04458029125470973, "acc_norm": 0.4603174603174603, "acc_norm_stderr": 0.04458029125470973 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.5, "acc_stderr": 0.050251890762960605, "acc_norm": 0.5, "acc_norm_stderr": 0.050251890762960605 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.8451612903225807, "acc_stderr": 0.020579287326583227, "acc_norm": 0.8451612903225807, "acc_norm_stderr": 0.020579287326583227 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5615763546798029, "acc_stderr": 0.03491207857486519, "acc_norm": 0.5615763546798029, "acc_norm_stderr": 0.03491207857486519 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.71, "acc_stderr": 0.045604802157206845, "acc_norm": 0.71, "acc_norm_stderr": 0.045604802157206845 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.8242424242424242, "acc_stderr": 0.02972094300622445, "acc_norm": 0.8242424242424242, "acc_norm_stderr": 0.02972094300622445 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.8787878787878788, "acc_stderr": 0.023253157951942084, "acc_norm": 0.8787878787878788, "acc_norm_stderr": 0.023253157951942084 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.9430051813471503, "acc_stderr": 0.016731085293607548, "acc_norm": 0.9430051813471503, "acc_norm_stderr": 0.016731085293607548 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.7333333333333333, "acc_stderr": 0.022421273612923714, "acc_norm": 0.7333333333333333, "acc_norm_stderr": 0.022421273612923714 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.35185185185185186, "acc_stderr": 0.029116617606083025, "acc_norm": 0

搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,对模型性能的量化追踪是推动技术进步的关键环节。该数据集是围绕_fsx_shared-falcon-180B_2100模型在Open LLM Leaderboard评估流程中自动生成的产物,其构建过程依托于两次独立的评估运行。数据集包含61个配置,每个配置对应于一项被评估的任务,而每次运行的结果则作为特定分割存储在对应配置中,分割名称以运行时间戳命名,其中“train”分割始终指向最新一次的评估结果。此外,还设有一个名为“results”的额外配置,用于汇聚并存储所有运行的聚合指标,这些指标最终被用于计算和展示排行榜上的综合得分。
特点
该数据集的核心特色在于其结构化的多任务评估框架与时间序列追踪能力。通过将61个评估任务分别封装为独立配置,研究者得以精细地审视模型在ARC挑战、HellaSwag、MMLU(涵盖抽象代数、解剖学、天文学等57个学科)以及TruthfulQA等多样化基准上的表现。每个配置内部按时间戳划分运行分割,使得模型性能的历史演变一目了然,而“latest”分割则确保了最新结果的便捷访问。这种设计不仅支持横向对比不同任务间的能力差异,还纵向记录了模型随迭代的进化轨迹,为深入分析模型优劣提供了丰富的数据维度。
使用方法
研究者可通过HuggingFace的datasets库便捷地加载该数据集以进行深度分析。例如,使用`load_dataset("open-llm-leaderboard/details__fsx_shared-falcon-180B_2100", "harness_truthfulqa_mc_0", split="train")`即可获取TruthfulQA多项选择任务的最新评估细节。若要回溯历史结果,只需将分割名称替换为对应的时间戳字符串,如"2023_09_11T14_38_41.751680"。此外,通过加载"results"配置并解析其中的JSON文件,可以一览模型在所有任务上的汇总指标,包括准确率及其标准误差,从而高效地评估模型的整体能力水平。
背景与挑战
背景概述
该数据集源于HuggingFace社区主导的Open LLM Leaderboard项目,由Clementine等人于2023年创建,旨在系统评估大型语言模型在多样化自然语言理解任务中的表现。数据集围绕Falcon-180B这一参数量高达1800亿的模型展开,通过61个配置覆盖了从常识推理到专业学科知识等广泛领域,如ARC Challenge、HellaSwag及MMLU等基准测试。其核心研究问题在于构建一个标准化、可复现的评估框架,以量化前沿模型的综合能力,并为社区提供透明化的性能对比平台。该数据集的出现显著推动了开源大模型的评测规范化,成为衡量模型进步的重要标尺。
当前挑战
当前数据集面临的主要挑战包括:一、领域问题层面,如何设计涵盖多维度认知能力的评测任务,避免模型在单一基准上过拟合,同时确保评估指标能真实反映模型在复杂推理与知识迁移上的瓶颈;二、构建过程中,需处理大规模模型(如180B参数)推理带来的高昂计算成本与时间开销,以及不同运行轮次间结果的可重复性问题。此外,数据集的配置管理、版本追踪与海量评估结果的存储优化,亦构成技术实现上的显著障碍。
常用场景
经典使用场景
在大型语言模型评估的学术语境中,该数据集被广泛用于系统性地衡量模型在多维度自然语言理解任务上的综合表现。其经典使用方式是通过加载预设的61个配置项,每个配置对应一项标准化测评任务,如ARC挑战集、HellaSwag常识推理以及涵盖57个学科的MMLU基准测试。研究者能够利用该数据集复现模型在特定时间戳下的推理结果,从而实现对模型性能的精准追踪与横向比较。
实际应用
在实际应用中,该数据集为模型选型与部署决策提供了关键参考。企业和研究机构可依据其中存储的详尽评估结果,判断如Falcon-180B等大规模语言模型在具体垂直领域(如医学、法律、物理)的适用性。其数据支持对模型进行准入测试,确保在投入生产环境前,模型在安全性、事实准确性及专业推理等方面达到预设标准,从而降低应用风险。
衍生相关工作
该数据集衍生了一系列关于模型评估与性能分析的重要工作。例如,基于其存储的多次运行结果,研究者开发了动态性能追踪工具,用于分析模型版本迭代间的能力变化。此外,该数据集还催生了针对评估任务难度与模型能力关系的统计研究,以及利用其细粒度结果进行模型集成与融合策略优化的探索,进一步拓展了大规模语言模型评测的理论与实践边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务