遇见数据集

open-llm-leaderboard-old/details_abideen__Mistral-v2-orpo

收藏
Hugging Face2024-03-27 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型abideen/Mistral-v2-orpo进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。它包含1次运行的结果,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用Python中的datasets库加载数据集的示例。

该数据集是在Open LLM Leaderboard上对模型abideen/Mistral-v2-orpo进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。它包含1次运行的结果,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用Python中的datasets库加载数据集的示例。

原始信息汇总

数据集概述

该数据集是在对模型 abideen/Mistral-v2-orpo 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的 "results" 配置存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_abideen__Mistral-v2-orpo", "harness_winogrande_5", split="train")

最新结果

以下是 2024-03-27T19:23:42.254208 运行的最新结果:

python { "all": { "acc": 0.6340522794211865, "acc_stderr": 0.03231883241264782, "acc_norm": 0.6394762190919396, "acc_norm_stderr": 0.03296852124051156, "mc1": 0.2876376988984088, "mc1_stderr": 0.01584631510139481, "mc2": 0.4420725008156118, "mc2_stderr": 0.014346228413042025 }, "harness|arc:challenge|25": { "acc": 0.5810580204778157, "acc_stderr": 0.01441810695363901, "acc_norm": 0.6092150170648464, "acc_norm_stderr": 0.01425856388051378 }, "harness|hellaswag|10": { "acc": 0.6312487552280422, "acc_stderr": 0.004814803098436813, "acc_norm": 0.8344951204939255, "acc_norm_stderr": 0.003708760752685524 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.3, "acc_stderr": 0.046056618647183814, "acc_norm": 0.3, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6074074074074074, "acc_stderr": 0.0421850621536888, "acc_norm": 0.6074074074074074, "acc_norm_stderr": 0.0421850621536888 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6447368421052632, "acc_stderr": 0.038947344870133176, "acc_norm": 0.6447368421052632, "acc_norm_stderr": 0.038947344870133176 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.63, "acc_stderr": 0.048523658709391, "acc_norm": 0.63, "acc_norm_stderr": 0.048523658709391 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6754716981132075, "acc_stderr": 0.02881561571343211, "acc_norm": 0.6754716981132075, "acc_norm_stderr": 0.02881561571343211 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.6944444444444444, "acc_stderr": 0.03852084696008534, "acc_norm": 0.6944444444444444, "acc_norm_stderr": 0.03852084696008534 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.47, "acc_stderr": 0.050161355804659205, "acc_norm": 0.47, "acc_norm_stderr": 0.050161355804659205 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.51, "acc_stderr": 0.05024183937956912, "acc_norm": 0.51, "acc_norm_stderr": 0.05024183937956912 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.41, "acc_stderr": 0.04943110704237102, "acc_norm": 0.41, "acc_norm_stderr": 0.04943110704237102 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6589595375722543, "acc_stderr": 0.036146654241808254, "acc_norm": 0.6589595375722543, "acc_norm_stderr": 0.036146654241808254 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.3431372549019608, "acc_stderr": 0.047240073523838876, "acc_norm": 0.3431372549019608, "acc_norm_stderr": 0.047240073523838876 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.77, "acc_stderr": 0.04229525846816505, "acc_norm": 0.77, "acc_norm_stderr": 0.04229525846816505 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5787234042553191, "acc_stderr": 0.03227834510146268, "acc_norm": 0.5787234042553191, "acc_norm_stderr": 0.03227834510146268 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.43859649122807015, "acc_stderr": 0.04668000738510455, "acc_norm": 0.43859649122807015, "acc_norm_stderr": 0.04668000738510455 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5793103448275863, "acc_stderr": 0.0411391498118926, "acc_norm": 0.5793103448275863, "acc_norm_stderr": 0.0411391498118926 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.3915343915343915, "acc_stderr": 0.025138091388851112, "acc_norm": 0.3915343915343915, "acc_norm_stderr": 0.025138091388851112 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.38095238095238093, "acc_stderr": 0.04343525428949098, "acc_norm": 0.38095238095238093, "acc_norm_stderr": 0.04343525428949098 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.35, "acc_stderr": 0.047937248544110196, "acc_norm": 0.35, "acc_norm_stderr": 0.047937248544110196 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7677419354838709, "acc_stderr": 0.024022256130308235, "acc_norm": 0.7677419354838709, "acc_norm_stderr": 0.024022256130308235 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5073891625615764, "acc_stderr": 0.035176035403610105, "acc_norm": 0.5073891625615764, "acc_norm_stderr": 0.035176035403610105 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.71, "acc_stderr": 0.045604802157206845, "acc_norm": 0.71, "acc_norm_stderr": 0.045604802157206845 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7333333333333333, "acc_stderr": 0.03453131801885417, "acc_norm": 0.7333333333333333, "acc_norm_stderr": 0.03453131801885417 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7676767676767676, "acc_stderr": 0.03008862949021749, "acc_norm": 0.7676767676767676, "acc_norm_stderr": 0.03008862949021749 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8756476683937824, "acc_stderr": 0.02381447708659355, "acc_norm": 0.8756476683937824, "acc_norm_stderr": 0.02381447708659355 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6307692307692307, "acc_stderr": 0.024468615241478923, "acc_norm": 0.6307692307692307, "acc_norm_stderr": 0.024468615241478923 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.35185185185185186, "acc_stderr": 0.029116617606083015, "acc_norm": 0.35185185185185186, "acc_norm_stderr": 0.02911661

搜集汇总
数据集介绍
构建方式
在大型语言模型的评估生态中,Open LLM Leaderboard 扮演着标准化评测平台的角色。该数据集正是为记录模型 abideen/Mistral-v2-orpo 在 Leaderboard 上的评估过程而自动生成的。其构建方式基于一次完整的评测运行(run),运行时间戳为 2024-03-27T19:23:42.254208。数据集内部按照评测任务划分为 63 个配置(configuration),每个配置对应一项具体任务,例如 ARC-Challenge、HellaSwag、GSM8K 以及涵盖 57 个学科的 MMLU 子集。每个配置下的数据以 Parquet 格式存储,并通过时间戳命名的分割(split)来标识该次运行的结果。此外,数据集还包含一个名为“results”的附加配置,用于汇总所有任务的聚合指标,这些指标直接用于 Leaderboard 上最终分数的计算与展示。最新结果始终被指向名为“latest”的分割,便于用户快速获取最新进展。
特点
该数据集呈现出鲜明的结构化与可追溯性特征。它并非单一维度的分数集合,而是将模型在 63 个不同任务上的细粒度表现进行了系统化归档,每个任务配置独立成章,涵盖了从常识推理到专业学科知识的广泛测评维度。数据集的核心亮点在于其版本控制机制:每次评测运行都会生成一个独立的时间戳分割,而“latest”分割则动态指向最新一次评估结果,从而完整保留了模型性能演进的轨迹。这种设计使得研究者不仅能够审视模型当前的综合能力,还能回溯历史表现,为模型迭代提供对比基准。此外,数据集中记录的指标不仅包括准确率(acc),还包含了标准误差(acc_stderr)等统计量,为结果的可靠性提供了量化支撑。
使用方法
研究人员可通过 Hugging Face 的 datasets 库便捷地调用该数据集。例如,欲加载模型在 WinoGrande 任务上的详细评估结果,只需执行 `load_dataset("open-llm-leaderboard/details_abideen__Mistral-v2-orpo", "harness_winogrande_5", split="train")` 即可获取最新数据。若需回溯特定历史运行的结果,则可将 split 参数替换为对应的时间戳字符串,如 "2024_03_27T19_23_42.254208"。对于需要整体评估模型综合表现的场景,可以加载 "results" 配置,该配置以 JSON 格式存储了所有任务的聚合指标,便于直接进行性能对比与分析。数据以 Parquet 格式存储,兼顾了存储效率与读取速度,适合进行大规模或多次的模型评估研究。
背景与挑战
背景概述
随着大语言模型(LLM)在自然语言处理领域的迅猛发展,如何系统性地评估其多维度能力成为学术界与工业界共同关注的核心议题。由HuggingFace团队于2023年发起的Open LLM Leaderboard,旨在构建一个标准化、透明化的模型评测平台,通过整合涵盖常识推理、数学求解、知识问答及对抗性检测等多样化的基准任务(如ARC、HellaSwag、GSM8K、MMLU等),为研究者提供可复现的横向对比框架。该数据集记录了模型abideen/Mistral-v2-orpo在2024年3月27日的完整评测结果,包含63个任务配置的细粒度性能指标,其设计兼顾了评测结果的时效性与可追溯性,通过时间戳分片机制确保每次运行的独立性。作为开源社区推动模型能力透明化的重要工具,该数据集不仅揭示了Mistral-v2-orpo在常识推理(Winogrande准确率78.37%)与专业医学知识(MMLU临床知识67.55%)等维度的表现,更通过标准化流程促进了LLM评估范式的演进。
当前挑战
该数据集所承载的核心挑战体现在两个层面:其一,评测领域本身面临基准多样性不足与任务难度失衡的困境,现有任务如MMLU虽覆盖57个学科,但模型在抽象代数(30%)与大学数学(41%)等领域的低分表现暴露出复杂推理场景的脆弱性,亟需更精细的难度分层与跨任务泛化能力评估方案。其二,构建过程中遭遇的技术挑战包括:多任务结果聚合的统计一致性难题(如不同任务样本量差异导致的标准误波动),以及时间戳分片机制带来的数据版本管理复杂性——需确保每次独立运行的结果可准确回溯至对应模型迭代,同时避免评测环境差异(如硬件、库版本)对指标可比性的干扰。此外,TruthfulQA任务中mc1指标仅28.76%的准确率,凸显了模型在事实一致性检测上的系统性缺陷,这对评测数据集的鲁棒性设计提出了更高要求。
常用场景
经典使用场景
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard的标准化评测工具,被广泛用于对模型进行多维度能力检验。其典型使用场景涵盖常识推理(如HellaSwag)、知识问答(如ARC-Challenge)、数学推理(如GSM8K)以及涵盖57个学科的MMLU基准测试。研究者通过加载特定配置(如harness_winogrande_5)获取模型在细粒度任务上的逐项得分,从而系统性地衡量模型在推理、知识储备与语言理解等核心能力上的表现。
解决学术问题
该数据集有效解决了大语言模型性能评估中缺乏统一、透明基准的核心难题。它通过结构化存储模型在63个任务上的原始评测结果,为学界提供了可复现的对比框架。研究者得以深入分析模型在不同领域(如医学、法律、物理学)的泛化能力,并借助标准化指标(如acc_norm)消除评测偏差。这一机制促进了模型间公平比较,加速了如Mistral-v2-orpo等模型在推理鲁棒性、知识广度方面的改进研究。
衍生相关工作
该数据集衍生了一系列重要工作,包括基于其评测结果开发的模型性能预测工具与可视化分析平台。研究者利用其结构化数据构建了模型能力图谱,揭示不同架构(如Mistral-v2-orpo)在推理任务中的优劣模式。此外,该数据集催生了多任务评估标准化流程,被后续诸如‘Open LLM Leaderboard v2’等基准采纳。相关论文通过分析其存储的细粒度得分,提出了针对特定学科(如形式逻辑、法学)的定向优化策略,推动了领域专用模型的进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务