遇见数据集

open-llm-leaderboard/details_ehartford__CodeLlama-34b-Instruct-hf

收藏
Hugging Face2023-08-27 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型ehartford/CodeLlama-34b-Instruct-hf时自动创建的,包含61个配置,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示在Open LLM Leaderboard上的聚合指标。

This dataset was automatically generated during the evaluation of the model ehartford/CodeLlama-34b-Instruct-hf. It comprises 61 configurations, each corresponding to one evaluation task. The dataset is constructed from a single run, where each run is tied to a specific configuration, and the names of the dataset splits use the timestamp of the run. The train split always references the most recent results. Furthermore, the results configuration stores the aggregated results across all runs, and is utilized to calculate and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在对模型 ehartford/CodeLlama-34b-Instruct-hf 进行评估运行期间自动创建的。数据集包含 61 个配置,每个配置对应一个评估任务。数据集从 1 次运行中创建,每次运行的详细结果可以在每个配置中找到,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

数据集结构

配置列表

  1. config_name: harness_arc_challenge_25

    • data_files:
      • split: 2023_08_26T00_11_17.332215
        • path: **/details_harness|arc:challenge|25_2023-08-26T00:11:17.332215.parquet
      • split: latest
        • path: **/details_harness|arc:challenge|25_2023-08-26T00:11:17.332215.parquet
  2. config_name: harness_hellaswag_10

    • data_files:
      • split: 2023_08_26T00_11_17.332215
        • path: **/details_harness|hellaswag|10_2023-08-26T00:11:17.332215.parquet
      • split: latest
        • path: **/details_harness|hellaswag|10_2023-08-26T00:11:17.332215.parquet
  3. config_name: harness_hendrycksTest_5

    • data_files:
      • split: 2023_08_26T00_11_17.332215
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-high_school_european_history|5_2023-08-26T00:11:17.332215.parquet
          • **/details_harness|hendrycksTest-high_school_geography|5_2023-08-26T00:11:17.332215.parquet

最新结果

以下是来自 2023-08-26T00:11:17.332215 运行的最新结果:

python { "all": { "acc": 0.3954825543560614, "acc_stderr": 0.034996131407759465, "acc_norm": 0.39693969001192136, "acc_norm_stderr": 0.03500279971831286, "mc1": 0.29008567931456547, "mc1_stderr": 0.01588623687420952, "mc2": 0.4428923144531004, "mc2_stderr": 0.014810370517699043 }, "harness|arc:challenge|25": { "acc": 0.378839590443686, "acc_stderr": 0.01417591549000032, "acc_norm": 0.40784982935153585, "acc_norm_stderr": 0.014361097288449708 }, "harness|hellaswag|10": { "acc": 0.2998406691894045, "acc_stderr": 0.004572515919210699, "acc_norm": 0.35680143397729536, "acc_norm_stderr": 0.004780764443411313 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.36, "acc_stderr": 0.04824181513244218, "acc_norm": 0.36, "acc_norm_stderr": 0.04824181513244218 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.35555555555555557, "acc_stderr": 0.04135176749720386, "acc_norm": 0.35555555555555557, "acc_norm_stderr": 0.04135176749720386 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.3684210526315789, "acc_stderr": 0.03925523381052932, "acc_norm": 0.3684210526315789, "acc_norm_stderr": 0.03925523381052932 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.44, "acc_stderr": 0.04988876515698589, "acc_norm": 0.44, "acc_norm_stderr": 0.04988876515698589 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.4037735849056604, "acc_stderr": 0.030197611600197953, "acc_norm": 0.4037735849056604, "acc_norm_stderr": 0.030197611600197953 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.3680555555555556, "acc_stderr": 0.04032999053960718, "acc_norm": 0.3680555555555556, "acc_norm_stderr": 0.04032999053960718 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.29, "acc_stderr": 0.045604802157206845, "acc_norm": 0.29, "acc_norm_stderr": 0.045604802157206845 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.33, "acc_stderr": 0.047258156262526045, "acc_norm": 0.33, "acc_norm_stderr": 0.047258156262526045 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.41, "acc_stderr": 0.04943110704237102, "acc_norm": 0.41, "acc_norm_stderr": 0.04943110704237102 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.3583815028901734, "acc_stderr": 0.036563436533531585, "acc_norm": 0.3583815028901734, "acc_norm_stderr": 0.036563436533531585 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.22549019607843138, "acc_stderr": 0.041583075330832865, "acc_norm": 0.22549019607843138, "acc_norm_stderr": 0.041583075330832865 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.54, "acc_stderr": 0.05009082659620332, "acc_norm": 0.54, "acc_norm_stderr": 0.05009082659620332 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.3872340425531915, "acc_stderr": 0.03184389265339525, "acc_norm": 0.3872340425531915, "acc_norm_stderr": 0.03184389265339525 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.2543859649122807, "acc_stderr": 0.04096985139843672, "acc_norm": 0.2543859649122807, "acc_norm_stderr": 0.04096985139843672 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.3448275862068966, "acc_stderr": 0.03960933549451208, "acc_norm": 0.3448275862068966, "acc_norm_stderr": 0.03960933549451208 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.304232804

搜集汇总
数据集介绍
open-llm-leaderboard/details_ehartford__CodeLlama-34b-Instruct-hf 数据集图片
构建方式
在大型语言模型评估领域,准确衡量模型性能是推动技术进步的关键环节。该数据集源自对 ehartford/CodeLlama-34b-Instruct-hf 模型在 Open LLM Leaderboard 上的自动化评估流程。数据集构建过程涉及一次完整的评估运行,共包含 61 个配置,每个配置对应一项评估任务。每次运行的结果以时间戳为标识,作为独立的分割(split)保存于各配置中,而名为“train”的分割则始终指向最新一次的评估结果。此外,还特别设立了名为“results”的独立配置,用于汇总所有评估运行的聚合指标,这些指标直接服务于 Leaderboard 上综合得分的计算与展示。
特点
该数据集的核心特点在于其结构与组织方式的精巧设计。它通过多配置架构,将不同评估任务的细粒度结果清晰分离,每个配置均存储对应任务的详细性能数据,如准确率及其标准误差。数据集支持多版本运行结果的并存与追溯,每次评估的完整记录均以时间戳分割形式保留,便于研究者进行历史对比与趋势分析。同时,“results”配置提供了全局视角的聚合指标,涵盖了如 ARC、HellaSwag 及涵盖 57 个学科的 MMLU 等多样化基准测试的评估得分,全面反映了模型在推理、常识及专业知识等多个维度的能力表现。
使用方法
研究者可通过 Hugging Face 的 datasets 库便捷地加载与使用该数据集。具体而言,使用 load_dataset 函数,指定数据集名称及目标任务对应的配置名称(如“harness_truthfulqa_mc_0”),并选择所需的分割(例如“train”以获取最新结果),即可获取特定任务的评估详情。数据集以 Parquet 格式存储,支持高效的数据读取与处理。对于希望进行深入分析的用户,可通过遍历不同配置与分割,获取模型在各项任务上的原始评估数据,从而开展模型性能的比较研究、误差分析或评估结果的二次验证工作。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,如何系统性地评估模型在多样化任务上的表现,成为推动该领域进步的关键瓶颈。Open LLM Leaderboard应运而生,旨在为开源社区提供一个标准化、透明化的模型性能竞技平台。该数据集由HuggingFace团队于2023年创建,主要研究人员包括Clémentine Fourrier等人,其核心研究问题在于如何通过一套涵盖推理、知识、伦理等多维度的基准测试,客观衡量如CodeLlama-34b-Instruct-hf这类指令微调模型的综合能力。该数据集通过自动记录每次评估运行的详细结果,不仅为模型开发者提供了即时的性能反馈,更在社区内树立了可复现比较的标杆,对推动开源大模型的迭代优化产生了深远影响。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:单一模型需在ARC挑战、HellaSwag、MMLU等57个涵盖科学、人文、伦理等不同子任务上展现均衡能力,这对模型的知识广度与推理深度提出了极高要求。其次,在构建过程中,数据集需要应对评估任务的异构性,不同任务(如多项选择、生成式问答)的评分标准与格式差异巨大,如何统一解析并存储61个配置下的细粒度结果,同时确保每次运行的时间戳与最新结果准确关联,构成了技术实现上的显著挑战。此外,评估结果的可复现性依赖于运行环境的严格一致性,任何微小的环境差异都可能导致分数偏差,这为数据集的长期维护与版本管理带来了持续性考验。
常用场景
经典使用场景
在大型语言模型飞速演进的浪潮中,Open LLM Leaderboard 上的评估数据成为衡量模型能力的黄金标尺。该数据集专为 CodeLlama-34b-Instruct-hf 模型的自动化评测而生,囊括了 ARC-Challenge、HellaSwag、TruthfulQA 以及涵盖 57 个学科的 MMLU 等经典基准任务。研究者通过加载各任务的配置与分片,能够精准复现模型在零样本或少样本设定下的推理表现,尤其适用于对比不同代码指令微调策略对通用知识与常识推理能力的提升效果。
衍生相关工作
基于该评测数据集,衍生出多项推动领域发展的经典工作。例如,研究者利用其结构化结果分析指令微调对模型诚实性的影响,催生了 TruthfulQA 的对抗性评测扩展;MMLU 子任务得分被用作多任务学习与课程学习的损失权重设计依据。此外,该数据集的自动化评测流程启发了后续的持续评估框架,如将单次评测结果与模型版本迭代关联,形成性能退化预警机制,为开源社区构建了可复现的模型能力追踪体系。
数据集最近研究
最新研究方向
在大型语言模型评估领域,Open LLM Leaderboard通过标准化评测框架,为CodeLlama-34b-Instruct-hf等模型提供了多维度的性能度量。该数据集聚焦于代码指令微调模型在常识推理(如ARC Challenge、HellaSwag)与专业知识(涵盖57个学科的MMLU基准)上的泛化能力,其评测结果揭示了当前代码生成模型在数学推理、物理等硬科学任务上的局限性,以及在市场营销、世界宗教等软科学领域展现出的相对优势。这一研究动向不仅为模型迭代提供了精准的效能标尺,更推动了开源社区对代码大模型知识边界与推理鲁棒性的系统性探索,对构建更可靠、更全面的LLM评估体系具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务