Orange/CoQAR
收藏资源简介:
CoQAR是一个包含4.5K对话的语料库,源自CoQA数据集,共有53K个后续问答对。每个原始问题都手动注释了至少2个最多3个上下文外的重写。CoQAR可用于至少三种NLP任务:问题释义、问题重写和对话式问答。数据集结构包括对话ID、轮次ID、原始问题、问题释义、答案、答案跨度开始、答案跨度结束、答案跨度文本、对话历史、文件名、故事和名称等字段。
CoQAR是一个包含4.5K对话的语料库,源自CoQA数据集,共有53K个后续问答对。每个原始问题都手动注释了至少2个最多3个上下文外的重写。CoQAR可用于至少三种NLP任务:问题释义、问题重写和对话式问答。数据集结构包括对话ID、轮次ID、原始问题、问题释义、答案、答案跨度开始、答案跨度结束、答案跨度文本、对话历史、文件名、故事和名称等字段。
数据集概述
数据集名称
CoQAR
数据集来源
- Repository: https://github.com/Orange-OpenSource/CoQAR/
- Paper: https://arxiv.org/abs/2207.03240
数据集描述
CoQAR是一个包含4.5K对话的语料库,源自Conversational Question-Answering dataset CoQA,总计53K个后续问答对。每个原始问题都手动标注了至少2个最多3个脱离上下文的改写。
语言
英语
数据集结构
数据集由多个对话组成,每行对应一个对话中的一个问题。字段包括:
- conversation_id
- turn_id
- original_question
- question_paraphrases
- answer
- answer_span_start
- answer_span_end
- answer_span_text
- conversation_history
- file_name
- story
- name
许可证信息
- 注释发布在CC-BY-SA 4.0许可证下。
- CoQA数据集的原始内容根据以下不同的许可证发布:
- 文学和维基百科段落共享在CC BY-SA 4.0许可证下。
- 儿童故事来自MCTest,带有MSR-LA许可证。
- 中学/高中考试段落来自RACE,带有自己的许可证。
- 新闻段落来自DeepMind CNN数据集,带有Apache许可证。
引用信息
@inproceedings{brabant-etal-2022-coqar, title = "{C}o{QAR}: Question Rewriting on {C}o{QA}", author = "Brabant, Quentin and Lecorv{e}, Gw{e}nol{e} and Rojas Barahona, Lina M.", booktitle = "Proceedings of the Thirteenth Language Resources and Evaluation Conference", month = jun, year = "2022", address = "Marseille, France", publisher = "European Language Resources Association", url = "https://aclanthology.org/2022.lrec-1.13", pages = "119--126" }




