遇见数据集

open-llm-leaderboard-old/details_Radu1999__Mistral-Instruct-Ukrainian-slerp

收藏
Hugging Face2024-02-12 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型Radu1999/Mistral-Instruct-Ukrainian-slerp在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个被评估的任务。它包含一次运行的结果,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了一个如何使用Python中的datasets库加载运行细节的示例。

该数据集是在模型Radu1999/Mistral-Instruct-Ukrainian-slerp在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个被评估的任务。它包含一次运行的结果,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了一个如何使用Python中的datasets库加载运行细节的示例。

原始信息汇总

数据集概述

该数据集是在评估模型 Radu1999/Mistral-Instruct-Ukrainian-slerpOpen LLM Leaderboard 上的自动创建的。

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建。每个运行可以在每个配置中作为一个特定的分割找到,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

加载数据示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Radu1999__Mistral-Instruct-Ukrainian-slerp", "harness_winogrande_5", split="train")

最新结果

以下是 最新结果来自 run 2024-02-12T11:11:52.976201 的摘要:

python { "all": { "acc": 0.6128348134449864, "acc_stderr": 0.03306039267014507, "acc_norm": 0.6174798445939971, "acc_norm_stderr": 0.033726644979784004, "mc1": 0.4773561811505508, "mc1_stderr": 0.01748554225848965, "mc2": 0.6348683354452056, "mc2_stderr": 0.015251462930296836 }, "harness|arc:challenge|25": { "acc": 0.5767918088737202, "acc_stderr": 0.014438036220848029, "acc_norm": 0.6203071672354948, "acc_norm_stderr": 0.01418211986697487 }, "harness|hellaswag|10": { "acc": 0.6528579964150567, "acc_stderr": 0.004750884401095161, "acc_norm": 0.8434574785899224, "acc_norm_stderr": 0.0036262628054422163 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.32, "acc_stderr": 0.04688261722621503, "acc_norm": 0.32, "acc_norm_stderr": 0.04688261722621503 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.5703703703703704, "acc_stderr": 0.042763494943765995, "acc_norm": 0.5703703703703704, "acc_norm_stderr": 0.042763494943765995 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.631578947368421, "acc_stderr": 0.03925523381052932, "acc_norm": 0.631578947368421, "acc_norm_stderr": 0.03925523381052932 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.6, "acc_stderr": 0.049236596391733084, "acc_norm": 0.6, "acc_norm_stderr": 0.049236596391733084 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.690566037735849, "acc_stderr": 0.028450154794118637, "acc_norm": 0.690566037735849, "acc_norm_stderr": 0.028450154794118637 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.6875, "acc_stderr": 0.038760854559127644, "acc_norm": 0.6875, "acc_norm_stderr": 0.038760854559127644 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.41, "acc_stderr": 0.049431107042371025, "acc_norm": 0.41, "acc_norm_stderr": 0.049431107042371025 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.51, "acc_stderr": 0.05024183937956911, "acc_norm": 0.51, "acc_norm_stderr": 0.05024183937956911 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.42, "acc_stderr": 0.049604496374885836, "acc_norm": 0.42, "acc_norm_stderr": 0.049604496374885836 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.5780346820809249, "acc_stderr": 0.0376574669386515, "acc_norm": 0.5780346820809249, "acc_norm_stderr": 0.0376574669386515 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.4117647058823529, "acc_stderr": 0.048971049527263666, "acc_norm": 0.4117647058823529, "acc_norm_stderr": 0.048971049527263666 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.71, "acc_stderr": 0.045604802157206845, "acc_norm": 0.71, "acc_norm_stderr": 0.045604802157206845 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5446808510638298, "acc_stderr": 0.03255525359340355, "acc_norm": 0.5446808510638298, "acc_norm_stderr": 0.03255525359340355 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.40350877192982454, "acc_stderr": 0.04615186962583703, "acc_norm": 0.40350877192982454, "acc_norm_stderr": 0.04615186962583703 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.6068965517241379, "acc_stderr": 0.0407032901370707, "acc_norm": 0.6068965517241379, "acc_norm_stderr": 0.0407032901370707 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.3968253968253968, "acc_stderr": 0.02519710107424649, "acc_norm": 0.3968253968253968, "acc_norm_stderr": 0.02519710107424649 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.40476190476190477, "acc_stderr": 0.04390259265377562, "acc_norm": 0.40476190476190477, "acc_norm_stderr": 0.04390259265377562 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.37, "acc_stderr": 0.04852365870939099, "acc_norm": 0.37, "acc_norm_stderr": 0.04852365870939099 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7032258064516129, "acc_stderr": 0.025988500792411898, "acc_norm": 0.7032258064516129, "acc_norm_stderr": 0.025988500792411898 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.4975369458128079, "acc_stderr": 0.03517945038691063, "acc_norm": 0.4975369458128079, "acc_norm_stderr": 0.03517945038691063 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.64, "acc_stderr": 0.048241815132442176, "acc_norm": 0.64, "acc_norm_stderr": 0.048241815132442176 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7454545454545455, "acc_stderr": 0.03401506715249039, "acc_norm": 0.7454545454545455, "acc_norm_stderr": 0.03401506715249039 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7575757575757576, "acc_stderr": 0.030532892233932022, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.030532892233932022 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8549222797927462, "acc_stderr": 0.02541634309630644, "acc_norm": 0.8549222797927462, "acc_norm_stderr": 0.02541634309630644 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.5615384615384615, "acc_stderr": 0.02515826601686858, "acc_norm": 0.5615384615384615, "acc_norm_stderr": 0.02515826601686858 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.32222222222222224, "acc_stderr": 0.028493465091028593, "acc_norm": 0.32222222222222224, "acc_norm_stderr":

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_Radu1999__Mistral-Instruct-Ukrainian-slerp 数据集图片
构建方式
在大型语言模型的评估体系中,Open LLM Leaderboard 扮演着至关重要的角色。该数据集正是为评估模型 Radu1999/Mistral-Instruct-Ukrainian-slerp 在排行榜上的表现而自动生成的。其构建方式基于单一运行轮次,涵盖了63个评估任务配置,每个配置对应一个特定的评估任务。运行结果以时间戳命名并存储为独立的分割(split),而名为“train”的分割则始终指向最新一次的评估结果。此外,一个名为“results”的额外配置用于存储所有聚合指标,为排行榜的总体评分提供计算基础。
特点
该数据集呈现出高度结构化且版本清晰的特性。它包含63个独立配置,分别对应不同的评估任务,如 ARC、HellaSwag、MMLU 及其子领域、TruthfulQA、Winogrande 和 GSM8K 等,覆盖了常识推理、知识理解、事实一致性及数学能力等多维度评测。每个配置下均存储了详细的评估分数与标准误差,使得研究者能够深入分析模型在各类任务上的细粒度表现。通过“latest”分割的设定,数据集确保了始终能够获取到最新、最完整的评估结果。
使用方法
使用该数据集时,研究者可通过 Hugging Face 的 datasets 库便捷地加载。例如,调用 load_dataset 函数,指定数据集名称及目标配置(如“harness_winogrande_5”)和分割(如“train”),即可获取对应任务的详细评估数据。这种设计使得用户能够灵活地访问单一任务的细粒度结果,或通过“results”配置获取整体聚合指标,从而高效地复现排行榜评分或进行深入的模型性能分析。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的迅猛发展,如何系统性地评估模型在多样化任务上的表现成为关键挑战。为此,Hugging Face社区于2023年推出了Open LLM Leaderboard,旨在为开源语言模型提供标准化、可复现的评测平台。该数据集作为Leaderboard的一部分,记录了由Radu1999在2024年2月提交的乌克兰语Mistral-Instruct模型(Mistral-Instruct-Ukrainian-slerp)的完整评估结果。数据集涵盖63个配置,对应ARC挑战、HellaSwag、MMLU、TruthfulQA、Winogrande和GSM8K等广泛使用的基准任务,全面衡量模型在推理、常识、知识及数学等维度的能力。其核心研究问题在于探索指令微调模型在非英语语言(尤其是乌克兰语)场景下的泛化性能,为多语言NLP研究提供了重要参考。该数据集的创建不仅推动了开源大模型评测的透明化,也促进了低资源语言模型的公平比较与迭代优化。
当前挑战
该数据集所解决的领域问题主要围绕大语言模型在多任务、多语言环境下的评测标准化挑战。传统评估往往依赖单一基准或非公开流程,导致结果难以复现与横向比较。Open LLM Leaderboard通过统一评测框架,解决了模型间公平对比的难题,尤其针对乌克兰语等低资源语言,缺乏高质量评测数据与基准的问题更为突出。在构建过程中,数据集面临多重挑战:首先,需要将Mistral-Instruct模型适配至乌克兰语,涉及词汇对齐与指令模板的本地化转换;其次,63个评测任务的数据格式与评估指标各异(如准确性、困惑度、多选匹配),需设计统一的Parquet存储与加载接口;此外,自动生成评测结果时需确保时间戳多版本管理的完整性,避免因重复运行导致的数据冲突。这些技术细节共同构成了数据集构建的核心难点。
常用场景
经典使用场景
在自然语言处理与多语言模型评估的交叉领域,该数据集作为Open LLM Leaderboard的评估产物,被广泛用于量化乌克兰语指令微调模型在通用推理任务上的表现。其经典使用场景聚焦于对Mistral-Instruct-Ukrainian-slerp模型在涵盖科学、人文、数学等57个学科知识测试(如HendrycksTest系列)以及常识推理基准(如ARC-Challenge、HellaSwag)上的性能剖析。研究者通过加载该数据集中的各任务配置(如harness_arc_challenge_25),可复现模型在零样本或小样本场景下的准确率与标准误差,从而横向对比不同语言适配策略的效能。
衍生相关工作
该数据集催生了多项关于多语言模型评估流水线的开创性研究。基于其标准化配置格式,后续工作如《Multilingual LLM Evaluation with Open Leaderboard》进一步扩展了覆盖语言范围,并引入了基于该数据集的跨语言能力对比分析。另一些研究则借鉴其任务分层结构,设计了针对乌克兰语的低资源模型微调方案,通过复用其HellaSwag和WinoGrande的评估逻辑来验证数据增强技术的有效性。此外,该数据集中的细粒度结果数据,被用作训练元评估模型的标注数据,推动了自动化评估指标与人类判断对齐的研究进程。
数据集最近研究
最新研究方向
该数据集聚焦于乌克兰语指令微调模型在开放大语言模型排行榜上的系统性评估,反映了多语言大模型在非英语语种适配领域的前沿探索。通过整合ARC挑战、HellaSwag、MMLU及GSM8K等63项基准测试任务,研究揭示了Mistral架构经乌克兰语指令微调后在常识推理、数学求解和专业知识维度上的表现特征。其评估结果中HellaSwag归一化准确率达84.3%,而在MMLU部分学科(如高中计算机科学、市场营销)超80%的准确率,印证了跨语言迁移学习在特定知识领域取得的突破性进展。这一研究工作不仅为乌克兰语自然语言处理提供了关键基准,更推动了多语言大模型评估体系的标准化进程,对构建包容性人工智能生态具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务