遇见数据集

open-llm-leaderboard-old/details_migtissera__SynthIA-7B-v1.5

收藏
Hugging Face2023-11-09 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型migtissera/SynthIA-7B-v1.5在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。它由1次运行创建,每次运行作为每个配置中的特定分割,使用运行的时间戳命名。train分割始终指向最新结果。一个额外的配置results存储了运行的所有聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。文件还提供了如何使用Python代码加载运行中的详细信息的示例,并列出了特定运行的最新结果。

该数据集是在模型migtissera/SynthIA-7B-v1.5在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。它由1次运行创建,每次运行作为每个配置中的特定分割,使用运行的时间戳命名。train分割始终指向最新结果。一个额外的配置results存储了运行的所有聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。文件还提供了如何使用Python代码加载运行中的详细信息的示例,并列出了特定运行的最新结果。

原始信息汇总

数据集概述

数据集摘要

该数据集是在评估模型migtissera/SynthIA-7B-v1.5Open LLM Leaderboard上的运行过程中自动创建的。

数据集结构

  • 配置数量:64个配置,每个配置对应一个评估任务。
  • 创建来源:从1次运行中创建。每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。
  • 额外配置:一个名为"results"的额外配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_migtissera__SynthIA-7B-v1.5_public", "harness_winogrande_5", split="train")

最新结果

这些是最新的结果,来自2023-11-09T14:41:56.883085的运行: python { "all": { "acc": 0.6291968571108129, "acc_stderr": 0.03252538162461919, "acc_norm": 0.63804599014876, "acc_norm_stderr": 0.03323519542303871, "mc1": 0.35128518971848227, "mc1_stderr": 0.016711358163544403, "mc2": 0.5131996962275648, "mc2_stderr": 0.015337988977122931, "em": 0.1875, "em_stderr": 0.003997164044486006, "f1": 0.26010591442953035, "f1_stderr": 0.004042449995216609 }, "harness|arc:challenge|25": { "acc": 0.5870307167235495, "acc_stderr": 0.014388344935398324, "acc_norm": 0.6271331058020477, "acc_norm_stderr": 0.014131176760131172 }, "harness|hellaswag|10": { "acc": 0.6432981477793268, "acc_stderr": 0.0047804672709117705, "acc_norm": 0.833698466440948, "acc_norm_stderr": 0.0037159010850549967 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.34, "acc_stderr": 0.04760952285695236, "acc_norm": 0.34, "acc_norm_stderr": 0.04760952285695236 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6148148148148148, "acc_stderr": 0.04203921040156279, "acc_norm": 0.6148148148148148, "acc_norm_stderr": 0.04203921040156279 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6644736842105263, "acc_stderr": 0.038424985593952694, "acc_norm": 0.6644736842105263, "acc_norm_stderr": 0.038424985593952694 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.61, "acc_stderr": 0.04902071300001975, "acc_norm": 0.61, "acc_norm_stderr": 0.04902071300001975 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6981132075471698, "acc_stderr": 0.02825420034443866, "acc_norm": 0.6981132075471698, "acc_norm_stderr": 0.02825420034443866 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.6944444444444444, "acc_stderr": 0.03852084696008534, "acc_norm": 0.6944444444444444, "acc_norm_stderr": 0.03852084696008534 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.49, "acc_stderr": 0.05024183937956912, "acc_norm": 0.49, "acc_norm_stderr": 0.05024183937956912 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.52, "acc_stderr": 0.050211673156867795, "acc_norm": 0.52, "acc_norm_stderr": 0.050211673156867795 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.4, "acc_stderr": 0.04923659639173309, "acc_norm": 0.4, "acc_norm_stderr": 0.04923659639173309 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6473988439306358, "acc_stderr": 0.036430371689585475, "acc_norm": 0.6473988439306358, "acc_norm_stderr": 0.036430371689585475 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.38235294117647056, "acc_stderr": 0.04835503696107223, "acc_norm": 0.38235294117647056, "acc_norm_stderr": 0.04835503696107223 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.76, "acc_stderr": 0.042923469599092816, "acc_norm": 0.76, "acc_norm_stderr": 0.042923469599092816 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5957446808510638, "acc_stderr": 0.03208115750788684, "acc_norm": 0.5957446808510638, "acc_norm_stderr": 0.03208115750788684 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.43859649122807015, "acc_stderr": 0.04668000738510455, "acc_norm": 0.43859649122807015, "acc_norm_stderr": 0.04668000738510455 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5448275862068965, "acc_stderr": 0.04149886942192117, "acc_norm": 0.5448275862068965, "acc_norm_stderr": 0.04149886942192117 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.3941798941798942, "acc_stderr": 0.02516798233389414, "acc_norm": 0.3941798941798942, "acc_norm_stderr": 0.02516798233389414 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4126984126984127, "acc_stderr": 0.04403438954768176, "acc_norm": 0.4126984126984127, "acc_norm_stderr": 0.04403438954768176 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.39, "acc_stderr": 0.04902071300001975, "acc_norm": 0.39, "acc_norm_stderr": 0.04902071300001975 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7645161290322581, "acc_stderr": 0.02413763242933771, "acc_norm": 0.7645161290322581, "acc_norm_stderr": 0.02413763242933771 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.4975369458128079, "acc_stderr": 0.03517945038691063, "acc_norm": 0.4975369458128079, "acc_norm_stderr": 0.03517945038691063 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.68, "acc_stderr": 0.04688261722621505, "acc_norm": 0.68, "acc_norm_stderr": 0.04688261722621505 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7575757575757576, "acc_stderr": 0.03346409881055953, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.03346409881055953 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7878787878787878, "acc_stderr": 0.029126522834586818, "acc_norm": 0.7878787878787878, "acc_norm_stderr": 0.029126522834586818 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8652849740932642, "acc_stderr": 0.02463978909770944, "acc_norm": 0.8652849740932642, "acc_norm_stderr": 0.02463978909770944 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6641025641025641, "acc_stderr": 0.023946724741563973, "acc_norm": 0.6641025641025641, "acc_norm_stderr": 0.023946724741563973 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.3592592592592593, "acc_stderr": 0.029252905927251976, "acc

搜集汇总
数据集介绍
构建方式
该数据集是在Open LLM Leaderboard评估框架下,针对migtissera/SynthIA-7B-v1.5模型自动生成的评估记录。数据集由64个配置组成,每个配置对应一项被评估的任务。所有数据来源于单次运行,每次运行的结果以时间戳为标识存储在对应配置的拆分中,而'train'拆分始终指向最新一次运行的评估结果。此外,一个名为'results'的独立配置汇总了所有任务的聚合指标,用于在排行榜上展示模型的整体表现。
使用方法
研究者可通过HuggingFace的datasets库便捷加载数据,例如使用load_dataset函数指定配置名称(如'harness_winogrande_5')和拆分(如'train')即可获取对应任务的评估细节。对于需要分析历史运行结果的场景,可通过时间戳拆分(如'2023_11_09T14_41_56.883085')访问特定时刻的数据。'results'配置则适用于快速获取模型的整体性能概览,支持对聚合指标的直接解析与比较。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,如何系统性地评估模型的综合能力已成为学术界与工业界共同关注的核心议题。Open LLM Leaderboard作为由Hugging Face团队(主要研究人员包括Clémentine Fourrier等)于2023年发起的权威评测平台,旨在通过标准化基准为社区提供透明、可复现的模型性能对比。该数据集正是针对migtissera/SynthIA-7B-v1.5模型在2023年11月9日进行的单次评估运行而自动生成,涵盖了ARC-Challenge、HellaSwag、MMLU(涵盖57个学科)、TruthfulQA、Winogrande、DROP及GSM8K等多项经典任务。其核心研究问题在于量化该7B参数模型在常识推理、知识理解、数学运算及文本生成等维度的表现,为后续模型优化与社区选型提供了关键参考。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:LLM评估需同时覆盖多维度能力,例如ARC-Challenge考察科学推理、GSM8K检验数学逻辑、TruthfulQA评估事实一致性,而SynthIA-7B-v1.5在GSM8K上仅取得17.44%的准确率,暴露出模型在复杂数学推理中的显著短板。构建过程中的挑战则在于评测流程的标准化与可复现性:需为每个任务设计独立的配置与数据分片(共64个配置),并确保单次运行结果(如2023-11-09T14:41:56.883085)能通过Parquet格式精确存储;同时,结果聚合需处理不同任务间的指标差异(如DROP采用F1分数,而Winogrande仅报告准确率),这对数据管道的一致性提出了严苛要求。
常用场景
经典使用场景
在大型语言模型的评估生态中,open-llm-leaderboard-old/details_migtissera__SynthIA-7B-v1.5 数据集扮演着关键的角色。它并非用于模型训练,而是专门为模型性能的标准化评测而设计,其核心用途在于记录并复现 SynthIA-7B-v1.5 模型在 Open LLM Leaderboard 上的一系列基准测试结果。研究人员可通过加载该数据集中的特定配置(如 harness_winogrande_5)与时间戳划分,精准回溯模型在常识推理、知识问答、数学计算等多元任务上的细粒度表现,从而实现对模型能力的横向对比与纵向追踪。
解决学术问题
该数据集直面大模型评估中普遍存在的可复现性与透明度不足的学术难题。传统上,模型榜单的评测结果常以聚合指标形式呈现,缺乏对单次运行细节的完整记录,导致研究者难以核实或深入分析模型在特定任务上的行为。此数据集通过结构化存储每个评测任务的原始得分(如准确率、F1值)及其标准误差,并保留多次运行的时间戳分割,为学术界提供了一份可追溯的评估档案,使得模型能力的解构、评测方法的验证以及榜单排名的可靠性论证有了坚实的实证基础。
实际应用
在实际应用中,该数据集是推动大模型工程化落地的重要工具。对于开发者而言,它能够作为一个权威的参考基准,用于筛选和对比不同版本模型的性能优劣,尤其是在部署前进行模型选型时。例如,通过分析 SynthIA-7B-v1.5 在 HellaSwag 或 GSM8K 等任务上的表现,工程师可以判断模型在常识推理或数学推理方面的成熟度,进而决策其是否适合嵌入到教育辅导、智能客服等对推理能力有特定要求的工业级系统中。
数据集最近研究
最新研究方向
在大型语言模型(LLM)性能评估领域,Open LLM Leaderboard已成为衡量模型综合能力的权威基准平台。SynthIA-7B-v1.5作为参数量为70亿的轻量级模型,其在该排行榜上的评估数据揭示了当前研究的前沿动态:研究者正聚焦于构建覆盖多学科知识(如医学、法律、心理学)的细粒度评估体系,以全面检验模型在常识推理、数学计算及复杂文本理解等维度的表现。该数据集通过64个任务配置(涵盖ARC、HellaSwag、MMLU等经典基准)的标准化评测,不仅量化了模型在零样本场景下的泛化能力,更凸显了开源社区对模型可复现性与透明度的追求。这一研究方向推动了LLM从单一指标竞赛向多维度、跨领域能力图谱的转型,为后续模型优化提供了关键参考锚点,同时强化了学术与工业界对评估标准统一化的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务