遇见数据集

open-llm-leaderboard-old/details_ajibawa-2023__Code-13B

收藏
Hugging Face2023-12-09 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型`ajibawa-2023/Code-13B`进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,并且以运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在Open LLM Leaderboard上对模型`ajibawa-2023/Code-13B`进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,并且以运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

原始信息汇总

数据集概述

数据集简介

该数据集是在对模型 ajibawa-2023/Code-13B 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。

数据集结构

  • 配置数量:63个配置,每个配置对应一个评估任务。
  • 运行次数:数据集由1次运行创建。每个运行在每个配置中都有一个特定的分割,分割名称使用运行的时间戳。
  • 分割:每个配置中的 "train" 分割始终指向最新的结果。
  • 结果配置:一个额外的 "results" 配置存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_ajibawa-2023__Code-13B", "harness_winogrande_5", split="train")

最新结果

以下是 2023-12-09T19:40:16.694610 运行的最新结果:

python { "all": { "acc": 0.5315302469691541, "acc_stderr": 0.0338171547995471, "acc_norm": 0.5374650243523146, "acc_norm_stderr": 0.034550805778528454, "mc1": 0.2962056303549572, "mc1_stderr": 0.01598359510181139, "mc2": 0.4246156253859874, "mc2_stderr": 0.01586771249517698 }, "harness|arc:challenge|25": { "acc": 0.5511945392491467, "acc_stderr": 0.014534599585097665, "acc_norm": 0.5733788395904437, "acc_norm_stderr": 0.014453185592920293 }, "harness|hellaswag|10": { "acc": 0.6420035849432384, "acc_stderr": 0.004784312972495391, "acc_norm": 0.8328022306313483, "acc_norm_stderr": 0.003723897305645496 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.28, "acc_stderr": 0.045126085985421296, "acc_norm": 0.28, "acc_norm_stderr": 0.045126085985421296 }, # 其他任务的结果... }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_12_09T19_40_16.694610, latest
    • 路径:**/details_harness|arc:challenge|25_2023-12-09T19-40-16.694610.parquet
  • harness_gsm8k_5

    • 分割:2023_12_09T19_40_16.694610, latest
    • 路径:**/details_harness|gsm8k|5_2023-12-09T19-40-16.694610.parquet
  • harness_hellaswag_10

    • 分割:2023_12_09T19_40_16.694610, latest
    • 路径:**/details_harness|hellaswag|10_2023-12-09T19-40-16.694610.parquet
  • harness_hendrycksTest_5

    • 分割:2023_12_09T19_40_16.694610, latest
    • 路径:
      • **/details_harness|hendrycksTest-abstract_algebra|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-anatomy|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-astronomy|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-business_ethics|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-college_biology|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-college_chemistry|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-college_computer_science|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-college_mathematics|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-college_medicine|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-college_physics|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-computer_security|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-conceptual_physics|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-econometrics|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-electrical_engineering|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-formal_logic|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-global_facts|5_2023-12-09T19-40-16.694610.parquet
      • **/details_harness|hendrycksTest-high_school_biology|5_2023-12-09T19-40-16.694610.parquet

      其他路径...

}

搜集汇总
数据集介绍
构建方式
在大型语言模型评测领域,Open LLM Leaderboard 为模型性能的标准化评估提供了重要平台。该数据集是针对模型 ajibawa-2023/Code-13B 在 Open LLM Leaderboard 上进行评测时自动生成的,源自一次完整的评测运行。数据集由 63 个配置组成,每个配置对应一个被评测的任务,涵盖 ARC-Challenge、HellaSwag、GSM8K、Winogrande、TruthfulQA 以及涵盖 57 个学科领域的 HendrycksTest 等。每个配置中均包含以运行时间戳命名的特定数据分割,而 'train' 分割则始终指向最新的评测结果。此外,还设有 'results' 配置,用于存储所有聚合后的评测指标,这些指标被用于计算和展示排行榜上的综合得分。
特点
该数据集的结构设计精巧且富有层次,其核心特色在于将每一次评测运行的详细结果以独立分割的形式永久保留,同时通过 'latest' 分割动态指向最新数据,实现了历史可追溯性与实时更新性的完美统一。数据集不仅记录了模型在各类基准任务上的原始得分与标准误差,还提供了归一化后的精度指标(如 acc_norm),为深入分析模型能力提供了多维度的量化视角。尤其值得一提的是,HendrycksTest 配置下囊括了从抽象代数到病毒学等 57 个细粒度学科的子任务,使得研究者能够细致洞察模型在特定知识领域的表现优劣,为模型改进提供了精准的导航。
使用方法
研究人员可通过 HuggingFace Datasets 库便捷地加载该数据集的任意配置与分割。例如,使用 `load_dataset("open-llm-leaderboard/details_ajibawa-2023__Code-13B", "harness_winogrande_5", split="train")` 即可获取 Winogrande 任务的最新评测细节。若需回溯历史评测数据,只需将分割参数指定为对应运行的时间戳字符串(如 '2023_12_09T19_40_16.694610')。对于需要全面分析的任务,可通过遍历 63 个配置并结合 'results' 配置中的聚合结果,系统性地评估模型在语言理解、推理、数学及多学科知识等多个维度上的综合能力,从而支持模型对比、性能归因及后续优化等研究工作。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的时代,如何系统性地评估模型在多样化任务上的表现成为关键议题。Open LLM Leaderboard由Hugging Face团队于2023年发起,旨在为开源社区提供一个标准化、透明化的模型评估平台。该数据集记录了模型ajibawa-2023/Code-13B在63个配置任务上的评测结果,涵盖ARC挑战、HellaSwag、MMLU多学科知识、GSM8K数学推理及TruthfulQA等基准测试,全面衡量模型在常识推理、科学知识、逻辑推理与真实性判断等方面的能力。Code-13B作为一款专注于代码生成的13B参数模型,其评测数据为理解代码大模型在通用智能领域的表现提供了宝贵参考,推动了LLM评估体系的完善与社区协作的深化。
当前挑战
该数据集面临的挑战主要体现在两大方面:一是领域问题层面,LLM评估需覆盖从简单常识到复杂学科推理的广泛任务,但现有基准如MMLU在学科深度与广度上仍存在盲区,且模型在数学推理(GSM8K准确率仅19%)和概率推理(TruthfulQA的MC1仅29.6%)等核心能力上表现薄弱,揭示了模型在抽象逻辑与知识可信度方面的根本性局限。二是构建过程中,数据集需管理跨63个配置、多时间戳运行的庞杂结果,确保数据一致性与版本可追溯性;同时,评测任务(如HendrycksTest的57个学科)的标准化与结果聚合(如acc_norm)的统计严谨性,对自动化流水线提出了高要求,任何偏差都可能影响模型排名的公正性。
常用场景
经典使用场景
在大型语言模型的评估体系中,open-llm-leaderboard-old/details_ajibawa-2023__Code-13B 数据集作为 Open LLM Leaderboard 的标准化评测记录而诞生,其核心用途在于系统性地量化 Code-13B 模型在多元自然语言理解任务上的表现。该数据集囊括了从常识推理(如 ARC-Challenge、HellaSwag)到数学问题求解(如 GSM8K)的 63 个评测配置,每一配置对应一项具体任务,并记录了模型在零样本或少样本设定下的精确度与标准误差。研究者可借助此数据集,以统一基准横向对比不同模型的推理能力,尤其适用于验证代码生成类大模型在通用知识、逻辑推理与学科理解上的综合素养。通过加载特定配置的评测结果,学术界得以深入剖析模型在细粒度任务上的优势与短板,为后续优化提供实证基础。
实际应用
在实际产业应用中,该数据集扮演着模型选型与质量门禁的关键角色。对于寻求部署代码生成或通用对话系统的企业,通过查阅 Code-13B 在 63 个任务上的细粒度得分,可以快速判断该模型是否适配特定业务场景——例如,其在 GSM8K 上 19% 的准确率提示数学推理能力有限,而 Winogrande 上 73.6% 的表现则表明代词消解能力相对可靠。数据集的标准化输出格式使得其能够无缝嵌入 MLOps 流水线,作为模型版本迭代的回归测试基准。此外,评测结果中的置信区间(如 acc_stderr)为风险敏感型应用(如医疗咨询、法律推理)提供了不确定性量化参考,辅助工程师在部署前权衡模型的可靠性,从而降低误判带来的业务风险。
衍生相关工作
该数据集作为 Open LLM Leaderboard 生态的关键组件,催生了多项具有影响力的衍生工作。其评测方法论直接启发了后续的 Open LLM Leaderboard v2 版本,后者引入了更丰富的多任务评估套件与动态难度调整机制。在学术层面,研究者基于该数据集发布的细粒度评测结果,系统分析了 Code-13B 等模型在学科知识分布上的长尾现象,进而提出了针对性的课程学习与知识蒸馏策略。此外,数据集中包含的 57 项 MMLU 子任务评测数据,被广泛用于训练能力预测模型,以估算模型在未见任务上的泛化表现。这些衍生工作共同构建了从模型评估到能力建模再到性能优化的完整研究链条,显著加速了开源大语言模型的迭代进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务