遇见数据集

projecte-aina/CoQCat

收藏
Hugging Face2024-09-20 更新2024-03-04 收录
官方服务:

资源简介:

CoQCat是一个用于加泰罗尼亚语对话式问答的数据集,基于CoQA数据集构建。它包含89,364个问答对,来源于6,000个来自六个不同领域的文本段落。问题和回答设计为保持对话风格,答案以自由文本形式呈现,并从段落中突出显示证据。开发集和测试集中,每个问题还收集了两个额外的回答。该数据集旨在促进加泰罗尼亚语这一低资源语言的模型开发。

CoQCat is a dataset for Catalan conversational question answering, constructed based on the CoQA dataset. It contains 89,364 question-answer pairs, sourced from 6,000 text passages across six distinct domains. The questions and answers are designed to maintain a conversational style, with answers presented in free-text form and supporting evidence highlighted from the source paragraphs. For each question in the development and test sets, two additional answers were collected. This dataset aims to facilitate model development for Catalan, a low-resource language.

提供机构:
projecte-aina
原始信息汇总

数据集概述

数据集描述

数据集摘要

名称: CoQCat - Conversational Question Answering in Catalan
语言: 加泰罗尼亚语 (ca-ES)
许可证: CC BY-NC-ND 4.0
大小: 10K<n<100K
任务类型: 对话生成, 抽取式问答, 封闭领域问答
数据集组成: 89,364个问答对,来源于6,000个文本段落,涉及六个不同领域。问题和回答保持对话风格,答案以自由文本格式呈现,并突出显示来自段落的证据。

支持的任务和排行榜

  • 对话模型
  • 问答系统

语言

数据集使用加泰罗尼亚语 (ca-ES)。

数据集结构

数据实例

数据集包含三个JSON文件,分别对应训练集、开发集和测试集。每个实例包含以下字段:

  • source: 文本来源
  • id: 实例ID
  • filename: 文件名
  • title: 标题
  • story: 故事文本
  • questions: 问题列表,每个问题包含input_textturn_id
  • answers: 答案列表,每个答案包含input_text, span_text, span_start, span_endturn_id
  • additional_answers: 仅在开发集和测试集中,包含额外的答案列表

数据字段

  • source: 字符串
  • id: 字符串
  • filename: 字符串
  • story: 字符串
  • questions: 包含字典的列表,每个字典包含input_textturn_id
  • answers: 包含字典的列表,每个字典包含input_text, span_text, span_start, span_endturn_id
  • additional_answers: 字典,包含01两个键,每个键对应一个包含字典的列表,与answers结构相同

数据分割

  • dev.json: 8,909个问答示例,600个文本段落,来自4个领域
  • test.json: 8,986个问答示例,600个文本段落,来自6个领域
  • train.json: 71,489个问答示例,4800个文本段落,来自4个领域

数据集创建

策划理由

创建此数据集旨在促进加泰罗尼亚语这一低资源语言的模型开发。

源数据

数据来源于不同领域和来源,包括加泰罗尼亚语维基百科、Gutenberg项目、VilaWeb、Petites històries和电影剧情。

标注

标注工作由M47 labs公司通过公开招标过程进行。标注团队由至少4名标注人员组成,最好是人文或社会科学领域的学生或毕业生,具有加泰罗尼亚语的优秀知识(最低C1水平),以及一名有经验的资深协调员。

使用数据的注意事项

数据集的社会影响

希望此数据集能帮助开发加泰罗尼亚语的虚拟助手,这是一种经常被忽视的语言。

附加信息

数据集策展人

巴塞罗那超级计算中心的语言技术单元 (langtech@bsc.es)

许可证信息

此工作基于CC BY-NC-ND 4.0国际许可证。

引用信息

@inproceedings{gonzalez-agirre-etal-2024-building-data, title = "Building a Data Infrastructure for a Mid-Resource Language: The Case of {C}atalan", author = "Gonzalez-Agirre, Aitor and Marimon, Montserrat and Rodriguez-Penagos, Carlos and Aula-Blasco, Javier and Baucells, Irene and Armentano-Oller, Carme and Palomar-Giner, Jorge and Kulebi, Baybars and Villegas, Marta", editor = "Calzolari, Nicoletta and Kan, Min-Yen and Hoste, Veronique and Lenci, Alessandro and Sakti, Sakriani and Xue, Nianwen", booktitle = "Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024)", month = may, year = "2024", address = "Torino, Italia", publisher = "ELRA and ICCL", url = "https://aclanthology.org/2024.lrec-main.231", pages = "2556--2566", }

DOI

贡献

感谢M. Carme Marí和VilaWeb团队允许我们使用他们的文本,以及所有加泰罗尼亚语维基百科和Gutenberg项目的志愿者。

搜集汇总
数据集介绍
projecte-aina/CoQCat 数据集图片
构建方式
CoQCat数据集的构建以推动加泰罗尼亚语这一低资源语言的自然语言处理研究为初衷,其设计灵感源自英文对话问答数据集CoQA。数据来源涵盖六个不同领域,包括加泰罗尼亚语维基百科、古登堡计划文学作品、VilaWeb新闻、神话传说、短篇故事及电影情节,共计6000篇文本段落。注释过程由专业公司M47 labs通过公开招标承担,采用双人协作模式:一名注释者基于文本提问,另一名回答,以保持对话的自然流畅性。对于开发集和测试集,额外引入第三方注释者提供补充答案,从而增强答案的多样性和鲁棒性。最终,数据集包含89,364个问答对,并分为训练集(4800段落)、开发集(600段落)和测试集(600段落),确保覆盖不同领域的均衡分布。
使用方法
CoQCat数据集可直接用于训练和评估加泰罗尼亚语的对话式问答模型,支持对话生成、抽取式问答和封闭域问答等任务。用户可通过HuggingFace Datasets库加载默认配置,获取预划分的训练、验证和测试集。数据结构包含source(来源域)、story(文本段落)、questions(问题列表)和answers(答案列表,含文本和位置信息),开发集和测试集额外提供additional_answers字段以获取多答案标注。使用时,模型需根据对话历史生成自然语言答案,并可利用span信息进行证据定位。数据集遵循CC BY-NC-ND 4.0许可,仅限非商业用途且禁止修改,引用时需注明BSC语言技术团队的原始论文。
背景与挑战
背景概述
在自然语言处理领域,对话式问答系统作为人机交互的核心技术之一,长期受限于高质量标注数据的匮乏,尤其对于加泰罗尼亚语这类中低资源语言而言,其研究进展更为缓慢。为填补这一空白,巴塞罗那超级计算中心语言技术团队于2024年主导构建了CoQCat数据集,该数据集基于斯坦福大学CoQA语料库的设计理念,通过众包标注方式收集了来自6个领域共6000篇文本的89364个问答对,旨在推动加泰罗尼亚语对话式问答模型的发展。作为加泰罗尼亚政府Aina项目的关键产出,该数据集不仅提供了涵盖传记、文学、新闻等多领域的对话样本,还创新性地为开发集和测试集每道问题配备了三份独立回答,为评估模型鲁棒性奠定了坚实基础。
当前挑战
CoQCat数据集面临的核心挑战在于双重维度的技术壁垒。其一,在领域问题层面,对话式问答需同时处理指代消解、话题延续和上下文依赖等复杂语义现象,要求模型具备跨语句推理能力,这与传统单轮问答存在本质差异;其二,在构建过程中,低资源语言的标注资源稀缺性导致数据采集困难,团队需从维基百科、古登堡计划等多元渠道筛选文本,并委托专业标注公司组织至少4名具备C1级加泰罗尼亚语能力的标注员,通过双人协作模式确保对话的自然性与答案的准确性,这种精细化的质量控制流程显著增加了构建成本与时间投入。
常用场景
经典使用场景
CoQCat数据集专为加泰罗尼亚语的对话式问答任务而设计,其核心应用场景在于训练和评估能够理解并生成自然对话流的信息检索系统。该数据集包含了来自六个不同领域的六千篇文本段落,并由此衍生出近九万个问答对,每个问答对都维持了对话的连贯性与上下文依赖性。研究者常利用此数据集来构建能够追踪对话历史、理解指代消解以及进行多轮推理的模型,从而推动低资源语言在交互式信息获取领域的发展。
解决学术问题
该数据集主要解决了低资源语言——加泰罗尼亚语在对话式问答领域缺乏大规模、高质量标注语料的学术困境。它填补了该语言在机器阅读理解与多轮对话建模方面的空白,为研究跨句子推理、答案生成与对话一致性等核心问题提供了基准。CoQCat的构建促进了多语言自然语言处理技术的公平性,使得非英语语言的对话系统研究能够获得同等程度的关注与进展,具有重要的语言资源建设意义。
实际应用
在实际应用中,CoQCat数据集为开发面向加泰罗尼亚语用户的智能虚拟助手和客服系统提供了关键支撑。例如,在图书馆、博物馆或公共服务机构中,基于该数据集训练的模型能够理解用户以自然对话形式提出的复杂问题,并准确从本地化知识库中提取答案。此外,该数据集还可用于教育领域的自动问答辅导系统,帮助加泰罗尼亚语学习者通过交互式对话获取知识,从而提升用户体验与服务效率。
数据集最近研究
最新研究方向
在低资源语言自然语言处理领域,CoQCat数据集的出现标志着加泰罗尼亚语对话式问答研究迈入了新阶段。该数据集基于CoQA框架构建,涵盖了传记、文学、新闻、神话、短篇故事及电影情节六大领域,包含近九万个问答对,并创新性地引入了多轮对话中的证据标注机制。当前前沿研究聚焦于如何利用该数据集训练具备上下文感知能力的对话模型,以克服低资源语言在语义理解和指代消解方面的固有挑战。随着加泰罗尼亚语虚拟助手与智能客服系统需求的日益增长,CoQCat为构建更加自然流畅的人机交互界面提供了关键的数据基础设施,其影响力正逐步扩展到其他罗曼语族低资源语言的迁移学习研究之中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务