遇见数据集

open-llm-leaderboard/details_Aspik101__Vicuzard-30B-Uncensored-instruct-PL-lora_unload

收藏
Hugging Face2023-09-17 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型Aspik101/Vicuzard-30B-Uncensored-instruct-PL-lora_unload的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集包含64个配置,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储在特定的分割中,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于在Open LLM Leaderboard上计算和显示聚合指标。

This dataset was automatically generated during the evaluation runs of the model Aspik101/Vicuzard-30B-Uncensored-instruct-PL-lora_unload, specifically for evaluation on the Open LLM Leaderboard. It contains 64 configurations, each corresponding to one evaluation task. The dataset is produced from two runs, with the results of each run stored in a dedicated split named after the run's timestamp. The `train` split always points to the most recent results. Additionally, there is a configuration named `results` that stores the aggregated results across all runs, and is used to calculate and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在评估模型 Aspik101/Vicuzard-30B-Uncensored-instruct-PL-lora_unloadOpen LLM Leaderboard 上的运行过程中自动创建的。

数据集结构

  • 数据集由 64 个配置组成,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Aspik101__Vicuzard-30B-Uncensored-instruct-PL-lora_unload", "harness_winogrande_5", split="train")

最新结果

以下是 2023-09-17T06:39:08.245014 运行的最新结果: python { "all": { "em": 0.004404362416107382, "em_stderr": 0.0006781451620479503, "f1": 0.07459731543624175, "f1_stderr": 0.001589740038419953, "acc": 0.46844372186482186, "acc_stderr": 0.010745171507100412 }, "harness|drop|3": { "em": 0.004404362416107382, "em_stderr": 0.0006781451620479503, "f1": 0.07459731543624175, "f1_stderr": 0.001589740038419953 }, "harness|gsm8k|5": { "acc": 0.15314632297194844, "acc_stderr": 0.009919728152791473 }, "harness|winogrande|5": { "acc": 0.7837411207576953, "acc_stderr": 0.011570614861409348 } }

配置详情

以下是数据集的配置详情:

  • harness_arc_challenge_25

    • 分割: 2023_08_09T14_03_01.897575
      • 路径: **/details_harness|arc:challenge|25_2023-08-09T14:03:01.897575.parquet
    • 分割: latest
      • 路径: **/details_harness|arc:challenge|25_2023-08-09T14:03:01.897575.parquet
  • harness_drop_3

    • 分割: 2023_09_17T06_39_08.245014
      • 路径: **/details_harness|drop|3_2023-09-17T06-39-08.245014.parquet
    • 分割: latest
      • 路径: **/details_harness|drop|3_2023-09-17T06-39-08.245014.parquet
  • harness_gsm8k_5

    • 分割: 2023_09_17T06_39_08.245014
      • 路径: **/details_harness|gsm8k|5_2023-09-17T06-39-08.245014.parquet
    • 分割: latest
      • 路径: **/details_harness|gsm8k|5_2023-09-17T06-39-08.245014.parquet
  • harness_hellaswag_10

    • 分割: 2023_08_09T14_03_01.897575
      • 路径: **/details_harness|hellaswag|10_2023-08-09T14:03:01.897575.parquet
    • 分割: latest
      • 路径: **/details_harness|hellaswag|10_2023-08-09T14:03:01.897575.parquet
  • harness_hendrycksTest_5

    • 分割: 2023_08_09T14_03_01.897575
      • 路径:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-international_law|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-management|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-marketing|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2023-08-09T14:03:01.897575.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2023-08-09T14:03:01.897575.parquet
        • `**/details_harness|hendrycksTest-professional_accounting|5_2023-08-09T14:03:01.897575.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_Aspik101__Vicuzard-30B-Uncensored-instruct-PL-lora_unload 数据集图片
构建方式
在大语言模型评估领域,对模型性能的量化考核是推动技术进步的关键环节。该数据集源自对模型Aspik101/Vicuzard-30B-Uncensored-instruct-PL-lora_unload在Open LLM Leaderboard平台上的自动化评估过程。构建方式上,数据集整合了两次独立运行的结果,每次运行均作为特定配置下的独立分割存在,并以运行时间戳命名。数据集共计包含64个配置,每个配置对应一项被评估的任务,同时设有专门的“results”配置用于存储所有运行的汇总指标,这些聚合结果被用于计算和展示排行榜上的综合度量。
使用方法
研究者可通过HuggingFace的datasets库便捷地调用该数据集。具体而言,使用load_dataset函数并指定数据集的完整名称,同时传入目标任务的配置名称(如harness_winogrande_5)以及所需的分割标识(如“train”),即可加载特定运行下的详细评估结果。这种接口设计使得用户能够灵活地提取不同任务、不同时间点的模型表现数据,便于进行深入的比较分析与复现研究。
背景与挑战
背景概述
该数据集隶属于Hugging Face发起的Open LLM Leaderboard评估体系,由Hugging Face团队于2023年创建,旨在为大规模语言模型提供标准化、可复现的性能评估基准。核心研究问题聚焦于如何公正地衡量不同架构与训练策略下语言模型在多样化自然语言理解与生成任务上的表现。数据集记录了模型Aspik101/Vicuzard-30B-Uncensored-instruct-PL-lora_unload在多个子任务(如DROP、GSM8K、Winogrande等)上的详细评测结果,包含精确匹配率、F1分数及准确率等关键指标,为对比不同模型的推理、常识与数学能力提供了结构化数据支撑。其影响力体现在推动了大模型评测的透明化与社区协作,已成为研究者快速验证模型改进效果的重要工具。
当前挑战
当前面临的核心挑战包括:其一,领域问题层面,语言模型在复杂推理任务(如DROP的精确匹配率仅0.44%)与数学应用题(GSM8K准确率15.3%)上表现远逊于人类水平,暴露了模型在符号操作与多步推理上的本质缺陷。其二,构建过程中,评测结果的时效性与一致性难以保障——不同时间戳的运行记录可能导致指标波动,且任务配置的多样性(如64种配置)增加了数据整合与跨模型比较的复杂度。此外,未经过滤的模型版本(Uncensored)可能引入偏见或有害输出,给评估的公平性与安全性带来潜在挑战。
常用场景
经典使用场景
在大型语言模型(LLM)飞速演进的背景下,该数据集作为Open LLM Leaderboard的评估运行产物,为Vicuzard-30B-Uncensored-instruct-PL-lora_unload模型提供了多维度性能剖析。其经典使用场景在于,通过集成64个配置项,涵盖ARC挑战赛、DROP、GSM8K、Winogrande及HellaSwag等任务,实现对模型在常识推理、数学求解、自然语言理解与文本生成等关键维度的系统性评测。研究者可借此精准量化模型在零样本或少样本条件下的表现,从而在模型对比与迭代优化中建立可靠的基准参照。
解决学术问题
该数据集直面大模型评估中存在的碎片化与不可复现问题。传统上,模型性能比较常因评测基准、采样策略或提示模板的差异而失真。此数据集通过标准化运行记录与聚合结果,为学术社区提供了统一的度量标尺。它解决了如何在不同任务间公正比较模型泛化能力的难题,尤其凸显了模型在Winogrande(78.37%准确率)等任务上的代词消解与常识推理水平,推动了对LLM认知边界与局限性的深入理解。其意义在于,使模型间的细微差距得以被严谨捕获,为语言智能的量化进步奠定了数据基石。
实际应用
在实际应用层面,该数据集为部署高性能对话系统与智能助手提供了关键指导。基于Vicuzard-30B模型在GSM8K(15.31%准确率)等数学任务上的表现,开发者可评估模型在复杂逻辑推导场景中的适用性,从而在金融咨询、教育辅导或代码生成等垂直领域做出取舍。同时,DROP任务中0.44%的精确匹配率揭示了模型在精确文本提取上的局限,这警示在构建客服机器人或信息检索工具时需辅以外部知识库。数据集中的运行日志与错误分析,更可直接转化为模型微调与提示工程优化的实战依据。
数据集最近研究
最新研究方向
在大型语言模型(LLM)评估领域,Open LLM Leaderboard 已成为衡量模型综合能力的关键基准平台。该数据集围绕 Vicuzard-30B-Uncensored-instruct-PL-lora_unload 模型的自动评估过程构建,涵盖 ARC、DROP、GSM8K、HellaSwag、WinoGrande 及 MMLU 等多样化的推理与知识任务,反映了当前前沿研究方向中对模型鲁棒性与多任务泛化能力的深入关注。通过记录多次运行的时间戳与逐任务细粒度结果,该数据集为研究者提供了分析模型在数学推理、常识判断及专业领域知识掌握上的动态表现,进而推动了对未审查指令微调模型在开放场景下效能边界的探索。其系统化的评估框架不仅促进了 LLM 性能的透明化比较,也为后续模型优化与安全部署提供了关键数据支撑,对理解大模型在复杂任务中的真实能力具有重要学术与实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务