aherntech/sparc
收藏资源简介:
SParC是一个上下文依赖的多轮版本Spider任务1.0数据集,专门用于文本到SQL问题的聊天机器人测试集。该数据集包含4,298个连贯的问题序列(超过12,000个单独的问题,每个问题都标注了SQL查询),这些数据来源于用户与138个领域的200个复杂数据库的受控交互。SParC展示了复杂的上下文依赖、更大的语义多样性,并且由于其跨领域性质和在测试时未见过的数据库,需要泛化到未见过的领域。该数据集为未来的研究提供了显著的挑战。
SParC是一个上下文依赖的多轮版本Spider任务1.0数据集,专门用于文本到SQL问题的聊天机器人测试集。该数据集包含4,298个连贯的问题序列(超过12,000个单独的问题,每个问题都标注了SQL查询),这些数据来源于用户与138个领域的200个复杂数据库的受控交互。SParC展示了复杂的上下文依赖、更大的语义多样性,并且由于其跨领域性质和在测试时未见过的数据库,需要泛化到未见过的领域。该数据集为未来的研究提供了显著的挑战。
数据集概述:SParC
基本信息
- 许可证: CC-BY-4.0
- 任务类别: 文本到文本生成
- 语言: 英语
- 标签: 文本到SQL
- 数据集名称: SParC
- 数据集大小: 1K<n<10K
数据集描述
SParC是一个针对文本到SQL问题的聊天机器人测试集,它是Spider任务1.0的上下文依赖多轮版本。该数据集包含4,298个连贯的问题序列(超过12,000个带SQL查询的独立问题),来源于200个复杂数据库和138个领域的受控用户交互。
数据集特点
- 上下文依赖性: 数据集展示了复杂的上下文依赖关系。
- 语义多样性: 具有更大的语义多样性。
- 跨域性质: 由于其跨域特性及测试时未见的数据库,需要模型具有泛化到未见领域的能力。
性能指标
- 最佳模型精确匹配准确率: 20.2%(所有问题),不足10%(所有交互序列)。
引用信息
@misc{yu2019sparc, title={SParC: Cross-Domain Semantic Parsing in Context}, author={Tao Yu and Rui Zhang and Michihiro Yasunaga and Yi Chern Tan and Xi Victoria Lin and Suyi Li and Heyang Er and Irene Li and Bo Pang and Tao Chen and Emily Ji and Shreya Dixit and David Proctor and Sungrok Shim and Jonathan Kraft and Vincent Zhang and Caiming Xiong and Richard Socher and Dragomir Radev}, year={2019}, eprint={1906.02285}, archivePrefix={arXiv}, primaryClass={cs.CL} }




