遇见数据集

INSTRUCTEXCEL

收藏
arXiv2023-10-23 更新2024-06-21 收录
官方服务:

资源简介:

INSTRUCTEXCEL是一个大规模的基准数据集,旨在评估大型语言模型在自然语言指令下生成Excel OfficeScripts代码的能力。该数据集由微软主导创建,利用Excel的‘自动化’功能从用户的操作中自动生成OfficeScripts。数据集包含超过10,000个样本,涵盖170多种Excel操作,覆盖2,000个公开可用的Excel工作表。这些样本通过众包方式收集,每个样本包括自然语言描述和相应的OfficeScript代码。INSTRUCTEXCEL的应用领域主要集中在帮助非专家用户通过自然语言指令执行复杂的Excel任务,从而提高工作效率和学习Excel功能。

INSTRUCTEXCEL is a large-scale benchmark dataset designed to evaluate the ability of large language models (LLMs) to generate Excel OfficeScripts code under natural language instructions. This dataset was primarily created by Microsoft, which leverages Excel's "Automate" feature to automatically generate OfficeScripts from user operations. It contains over 10,000 samples covering more than 170 types of Excel operations, and spans 2,000 publicly available Excel worksheets. These samples were collected via crowdsourcing, with each sample consisting of a natural language description and its corresponding OfficeScript code. The main application scenarios of INSTRUCTEXCEL focus on helping non-expert users perform complex Excel tasks through natural language instructions, thereby improving work efficiency and facilitating the learning of Excel functions.

提供机构:
微软
创建时间:
2023-10-23
搜集汇总
数据集介绍
构建方式
在电子表格自动化领域,如何将自然语言指令转化为可执行代码一直是人机交互研究的核心挑战。INSTRUCTEXCEL数据集正是为解决这一问题而构建,它聚焦于Excel办公脚本(OfficeScripts)的自动生成。数据集的构建依托于Excel的'自动操作'(Automate)功能,该功能能够记录用户在电子表格中的操作并自动生成对应的TypeScript代码。研究者首先从公开的Excel文件中筛选出2000份符合要求的文档,随后通过众包平台招募具有Excel基础知识的标注者。每位标注者需针对每份文档提出5个自然语言操作指令,并亲自在Excel网页版中执行相应操作,利用Automate功能记录并复制生成的OfficeScripts代码。最终,经过严格的质量审核与数据清洗,共收集超过10,000个样本,覆盖170余种Excel操作,构建起这一规模宏大的基准数据集。
特点
INSTRUCTEXCEL数据集呈现出鲜明的领域特性与结构优势。其核心特点在于实现了自然语言指令与电子表格操作之间的精准映射,每个样本均包含用户输入的自然语言描述、线性化的电子表格数据、对应的OfficeScripts代码以及文件元信息。数据集覆盖广泛,从基础的单元格格式化、公式填充到复杂的条件格式设置、图表创建等高级操作均有所涉及,操作分布呈现长尾特征,既包含高频的简单方法调用,也包含需要多步骤组合的复杂任务。尤为重要的是,数据集的代码由Automate功能自动生成,有效规避了人工编码中常见的语法错误与逻辑缺陷,保证了输出质量的高度一致性。此外,数据集中存在部分语义等价的多解样本,为评估模型的鲁棒性与泛化能力提供了天然的研究素材。
使用方法
INSTRUCTEXCEL的使用方法灵活多样,适用于多种研究场景。研究者可将该数据集作为基准测试平台,评估大语言模型在Excel代码生成任务上的表现,具体可通过零样本、少样本以及微调等范式进行实验。在输入层面,需将用户自然语言指令与线性化的电子表格数据拼接后输入模型,输出则为对应的OfficeScripts代码。为提升模型性能,可采用动态提示(Dynamic Prompting)策略,根据输入指令的语义相似性从训练集中检索最相关的示例作为上下文。此外,数据集还可作为子任务研究的源头,例如通过筛选条件格式化相关的样本,可构建专门的条件格式化规则学习基准,并借助中间语言(IL)表示进行精确评估。值得注意的是,由于部分电子表格文件体积较大,在实际使用中可能需要根据模型上下文长度对表格数据进行截断处理。
背景与挑战
背景概述
随着大型语言模型的蓬勃发展,指令学习范式已在众多自然语言处理任务中展现出卓越的泛化能力。然而,在电子表格这一广泛应用的领域,如何将用户的自然语言指令精准转化为可执行的代码,仍是一个亟待探索的前沿课题。为填补这一空白,来自微软、马萨诸塞大学阿默斯特分校及亚利桑那州立大学的研究团队于2023年联合推出了INSTRUCTEXCEL基准数据集。该数据集的核心研究问题在于评估大型语言模型能否根据用户用自然语言描述的Excel操作意图,自动生成相应的OfficeScript代码。研究团队巧妙利用Excel的“自动化”功能,通过众包方式让工作人员记录操作并自动生成代码,从而构建了包含超过1万个样本、涵盖170余种Excel操作及2000个公开电子表格的大规模基准。INSTRUCTEXCEL的诞生,为自然语言到代码生成领域开辟了新的研究方向,对推动智能办公助手的发展具有里程碑式的影响力。
当前挑战
INSTRUCTEXCEL所面临的挑战首先体现在领域问题的复杂性上:电子表格操作涉及条件格式化、公式创建、图表绘制等众多精细且逻辑严密的子任务,用户指令往往隐含着对单元格引用、数据类型及操作顺序的精确要求,这对模型理解意图与生成正确代码的能力构成了严峻考验。其次,在数据集构建过程中,挑战同样显著:众包工作人员需具备基本的Excel操作知识,并确保所记录的操作与自然语言描述严格一致;同时,由于电子表格文件大小不一、内容繁杂,如何在有限的模型上下文窗口中有效呈现电子表格数据,并避免因数据截断导致信息丢失,是构建过程中必须克服的技术难题。此外,代码生成的多样性(如同一任务可有多种等效实现)也给评估指标的选择带来了挑战,单纯的文本匹配难以全面衡量模型的真实性能。
常用场景
经典使用场景
INSTRUCTEXCEL作为一项专注于自然语言指令到Excel OfficeScript代码转换的基准测试,其经典使用场景在于评估和驱动大语言模型在电子表格自动化任务中的表现。该数据集通过收集超过10,000个样本,涵盖170余种Excel操作,为模型提供了从用户自然语言描述中生成可执行代码的标准化测试环境。研究者可利用该基准,在零样本、少样本及动态提示等多种设置下,系统性地检验模型对Excel领域特定API的掌握程度,从而推动人机交互中智能助手能力的边界拓展。
衍生相关工作
INSTRUCTEXCEL的发布已催生了一系列衍生研究,尤其是在条件格式化规则提取与验证方面。通过从数据集中筛选出660个格式化相关样本,研究者构建了专用的中间语言表示,并开发了基于执行等价性的评估指标,如Sketch Match和Execution Match。此外,该数据集还为图表生成、公式预测等子任务提供了可复用的数据源,推动了如Format5、CorNet等专用模型的诞生,进一步丰富了电子表格智能化的研究生态。
数据集最近研究
最新研究方向
在大语言模型(LLM)蓬勃发展的浪潮中,INSTRUCTEXCEL数据集应运而生,聚焦于将自然语言指令精准转化为Excel可执行的OfficeScript代码。当前研究前沿集中于探索指令学习范式在该垂直领域的应用,尤其关注GPT-4等先进模型在零样本与少样本场景下的代码生成能力。动态提示策略的引入显著提升了模型对复杂电子表格操作的语义理解,而基于条件格式化规则等子任务的深入剖析则揭示了数据集在细粒度功能验证中的潜力。这一研究方向不仅推动了人机交互界面的智能化演进,更为非专业用户提供了低门槛的自动化办公工具,有望重塑日常数据处理的效率与体验。
相关研究论文
  • 1
    InstructExcel: A Benchmark for Natural Language Instruction in Excel微软 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务