A-Eval
收藏资源简介:
A-Eval是一个用于从实际应用角度评估各种规模聊天大型语言模型的基准。该数据集包含678个问答对,跨越5个类别、27个子类别和3个难度级别。A-Eval提供了清晰的实证和工程指南,用于为现实世界应用选择“最佳”模型。
A-Eval is a benchmark for evaluating chat large language models of various scales from the perspective of real-world applications. This dataset contains 678 question-answer pairs, spanning 5 categories, 27 subcategories, and 3 difficulty levels. A-Eval provides clear empirical and engineering guidelines for selecting the "best" model for real-world applications.
A-Eval 数据集概述
简介
A-Eval 是一个从实际应用角度评估不同规模聊天大型语言模型(Chat LLMs)的基准。数据集包含 678 个问答对,涵盖 5 个类别、27 个子类别和 3 个难度级别。A-Eval 为选择最适合实际应用的模型提供了明确的实证和工程指导。
应用驱动的任务分类
678个问答对5个类别,27个子类别3个难度级别
评估结果
基于 QWen1.5-72B-Chat,我们设计了一种自动评估方法来评估 8 种不同规模的模型。我们的额外专家评估验证了自动评估方法的可靠性。
平均准确率
我们展示了不同规模的模型在 A-Eval 上的平均准确率。
- (a) 不同规模的模型在所有任务和难度级别上的平均准确率。虚线代表专家评估结果,实线代表不同评分阈值 T 的自动评估结果。
- (b) 不同规模的模型在简单、中等和困难数据上的平均准确率。虚线代表专家评估结果,实线代表使用 90 和 60 评分阈值的自动评估结果。
按任务的准确率
对于每个特定任务及其相应的子任务,展示了不同规模模型的平均准确率。
- (a) 当 T = 60 时的准确率。
- (b) 当 T = 90 时的准确率。
模型选择
最佳模型定义为在最小规模下达到所需准确率的模型。利用评估结果,用户可以通过在性能图表上绘制水平线来轻松识别最佳模型。
引用
如果您在我们的研究中使用了我们的基准或数据集,请引用我们的论文。
bash @misc{lian2024best, title={What is the best model? Application-driven Evaluation for Large Language Models}, author={Shiguo Lian and Kaikai Zhao and Xinhui Liu and Xuejiao Lei and Bikun Yang and Wenjing Zhang and Kai Wang and Zhaoxiang Liu}, year={2024}, eprint={2406.10307}, archivePrefix={arXiv}, }




