microsoft/Taskbench
收藏资源简介:
TaskBench是一个用于评估大型语言模型(LLMs)在任务自动化方面性能的基准数据集。任务自动化可以分解为三个关键阶段:任务分解、工具调用和参数预测。为了应对这一挑战,我们提出了一个全面的评估框架和一个高质量的任务自动化数据集。数据集包含三个领域的样本:HuggingFace工具、多媒体工具和日常生活API。数据集的构建过程包括工具图构建、图采样和反向指令生成,并通过LLM和规则基础的批评以及人工验证来确保数据质量。最终数据集包含28,271个样本,涵盖了三个领域:HuggingFace工具、多媒体工具和日常生活API。
TaskBench是一个用于评估大型语言模型(LLMs)在任务自动化方面性能的基准数据集。任务自动化可以分解为三个关键阶段:任务分解、工具调用和参数预测。为了应对这一挑战,我们提出了一个全面的评估框架和一个高质量的任务自动化数据集。数据集包含三个领域的样本:HuggingFace工具、多媒体工具和日常生活API。数据集的构建过程包括工具图构建、图采样和反向指令生成,并通过LLM和规则基础的批评以及人工验证来确保数据质量。最终数据集包含28,271个样本,涵盖了三个领域:HuggingFace工具、多媒体工具和日常生活API。
数据集概述
基本信息
- 语言: 英语
- 许可证: MIT
- 标签: agent, tool-learning, task-automation, LLM
- 别名: TaskBench
- 大小分类: n<21k
配置详情
- HuggingFace 配置:
- 测试集路径:
data_huggingface/data.parquet
- 测试集路径:
- 多媒体配置:
- 测试集路径:
data_multimedia/data.parquet
- 测试集路径:
- 日常生活API配置:
- 测试集路径:
data_dailylifeapis/data.parquet
- 测试集路径:
数据集描述
TaskBench 是一个用于评估大型语言模型(LLMs)在任务自动化方面的基准。任务自动化可以分为三个关键阶段:任务分解、工具调用和参数预测。数据收集过程包括以下三个阶段:
- 工具图构建: 构建工具库并使用工具库构建工具图。工具图中的节点代表工具,边代表工具之间的依赖关系,包括资源依赖和时间依赖。
- 图采样: 从工具图中采样生成每个样本的工具图。根据采样工具图的拓扑结构,采样方式包括节点、链和DAGs,代表任务自动化的不同任务分解结构。
- 反向指令: 使用采样的工具图生成任务步骤和指令,然后使用指令生成工具调用参数以完成工具调用图。
数据集质量保证
- LLM-based Critic: 使用LLM检查生成数据与采样工具图的对齐情况。
- Rule-based Critic: 使用简单规则确定创建数据中的工具图与采样工具图的对齐情况。
- 人工验证: 包括检查指令的语法、工具调用图的正确性和工具调用参数的正确性。
数据集结构
每个数据集目录包含以下文件:
data.json: 数据集文件,包含样本。graph_desc.json: 工具图描述文件,包含数据集的工具图。user_requests.json: 包含数据集的用户请求。tool_desc.json: 工具描述文件,包含数据集的工具描述。
处理统计
- 概览: 提供每个数据集的样本数量、由批评者检查的样本数量和由人工验证的样本数量。按工具调用图结构分组,提供每个组的样本数量。
- LLM-based 和 Rule-based Critics: 提供由LLM-based批评者、Rule-based批评者和两者都检查的样本数量。
- 人工验证: 提供每个部分(语法检查、指令检查和工具调用图检查)的样本数量,以及被丢弃或修正的样本数量。
提示生成
- 反向指令: 根据采样的工具图生成任务步骤和指令。
- LLM-based Critic: 检查任务步骤、用户请求和工具调用图的正确性。
评估框架
TaskBench 提供了一个全面的任务自动化评估框架,包括任务分解、工具调用和参数预测三个阶段。每个阶段的评估指标如下:
- 任务分解: 使用 Rouge-1 (R1)、Rouge-2 (R2) 和 Bertscore F1 (BsF) 指标。
- 工具调用: 报告节点预测 (n-F1) 和边预测 (e-F1) 的 F1 值。
- 参数预测: 报告参数类型 (或名称) F1 (t-F1) 和参数值 F1 (v-F1)。
数据集生成
如果需要生成自己的数据集,可以按照以下步骤操作:
- 构建自己的工具图: 构建工具库并使用工具库生成工具图。
- 生成数据集: 使用生成的工具图和工具描述文件生成数据集。
排行榜
基于评估框架和 TaskBench 数据集,提供了一个包含17个LLMs的任务自动化性能排行榜。每个LLM的评估结果包括多媒体工具域和HuggingFace工具域的性能指标。




