遇见数据集

CICEROv2

收藏
arXiv2022-11-03 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

CICEROv2是由密歇根大学和新加坡科技与设计大学联合创建的数据集,包含8,351个实例,来源于2,379个对话。该数据集旨在通过多视角上下文常识推理任务,提供多个合理但独立的推理答案,涵盖原因、后续事件、动机和情感反应四个维度。创建过程中,通过人工标注确保答案的多样性和准确性。CICEROv2的应用领域包括自然语言处理中的对话理解和常识推理,旨在提高模型对复杂对话情境的理解能力。

CICEROv2 is a dataset jointly created by the University of Michigan and the Singapore University of Technology and Design. It contains 8,351 instances sourced from 2,379 conversations. This dataset aims to provide multiple plausible yet independent reasoning answers via multi-perspective contextual commonsense reasoning tasks, covering four dimensions: causes, subsequent events, motivations, and emotional reactions. During the dataset creation process, manual annotation was adopted to ensure the diversity and accuracy of the answers. The application fields of CICEROv2 include dialogue understanding and commonsense reasoning in natural language processing, with the goal of enhancing models' ability to comprehend complex conversational contexts.

创建时间:
2022-10-06
搜集汇总
数据集介绍
CICEROv2 数据集图片
构建方式
CICEROv2数据集从CICERO中采样二元对话中的目标话语,并针对因果、后续事件、动机和情感反应四个常识推理维度进行人工标注。标注者需为每个问题撰写至少两个语义多样且正确的答案,以及两个或更多错误的答案,确保所有答案均基于上下文和常识知识,且错误答案需与对话信息矛盾。数据集共包含2,379段对话中的8,351个实例,其中17%的正确答案与CICERO重叠,但错误答案均为全新人工撰写。
特点
CICEROv2的核心特点在于其多视角(multiview)的常识推理能力,每个推理维度均提供多个语义迥异的人工标注答案,显著提升了答案的多样性和质量。与CICERO相比,CICEROv2在BLEU、ROUGE-L和语义相似度等指标上均表现出更低的内部相似性,从而更真实地反映常识解释的多元性。此外,数据集中所有错误答案均为人工设计,避免了自动生成带来的词汇和语义冗余,为模型训练提供了更具挑战性的负样本。
使用方法
CICEROv2适用于多选答案选择任务(MCQ),模型需根据对话上下文和目标话语,从混合的正确答案和干扰项中同时选出多个正确选项。研究者可基于该数据集微调预训练语言模型(如T5),或结合DIALeCT等专门设计的预训练目标(包括概念去噪、话语排序等)来提升模型的多视角常识推理能力。数据集划分为训练集、验证集和测试集,支持跨数据集迁移评估,尤其适合低资源场景下的模型性能测试。
背景与挑战
背景概述
在自然语言处理领域,常识推理是理解对话深层语义的关键能力,然而现有数据集往往局限于单一视角的解释,忽略了常识推断固有的多面性。CICEROv2数据集由新加坡科技设计大学与密歇根大学的研究团队于2022年联合创建,旨在解决多视角上下文常识推断这一核心研究问题。该数据集包含2,379段对话中的8,351个实例,覆盖原因、后续事件、动机和情感反应四个维度,每个实例均提供多人独立撰写且语义多样的正确答案,显著提升了常识推理的丰富性与鲁棒性。CICEROv2的发布推动了对话系统中多答案选择任务的发展,为评估和增强语言模型的常识能力提供了高质量基准。
当前挑战
CICEROv2所面临的挑战主要体现在两个层面。首先,在领域问题层面,多视角常识推断要求模型从对话中识别出多个合理且独立的解释,这远比单一答案选择更为困难,传统模型如T5-Large在多项选择任务中精确匹配得分骤降至20%,凸显了语义多样性带来的判别复杂性。其次,在数据集构建过程中,挑战在于确保人工标注的答案既与上下文一致又彼此语义迥异,同时避免与已有数据产生词汇或语义重叠。为此,研究者设计了严格的标注指南,要求标注者撰写至少两个正确和两个错误答案,并采用对抗性过滤与质量审核流程,以保障数据的多元性与可靠性。
常用场景
经典使用场景
在对话系统的研究中,CICEROv2被广泛用于多视角上下文常识推理任务,该任务要求模型在二元对话中针对特定话语,从原因、后续事件、动机和情感反应四个维度生成或选择多个合理且语义迥异的常识解释。这一场景的核心挑战在于捕捉对话结构的复杂性,并利用常识知识推断出多元化的隐含信息,从而提升模型对自然语言中非显式内容的深度理解能力。
衍生相关工作
基于CICEROv2,研究者衍生出多项经典工作,其中最突出的是DIALeCT(对话级常识Transformer)模型。该模型通过设计一组自监督预训练目标,包括概念去噪、话语排序和答案生成等任务,有效将常识知识编码到预训练语言模型中,显著提升了在多视角常识推理任务上的性能。此外,CICEROv2还催生了跨数据集迁移学习的研究,证明了其训练样本的高多样性能够增强模型的泛化能力,为低资源场景下的常识推理提供了新范式。
数据集最近研究
最新研究方向
在对话系统与常识推理的交汇领域,CICEROv2数据集聚焦于多视角上下文常识推断这一前沿方向,突破了传统单一解释的局限。该数据集通过收集每个对话事件的多个人工标注的、语义多样化的常识解释,涵盖了原因、后续事件、动机和情感反应四个维度,显著提升了推理的丰富性和鲁棒性。其核心意义在于应对自然语言处理中对话理解的深层挑战——即同一事件可能蕴含多种合理且独立的常识解释。这一研究方向与当前大语言模型在开放域对话、情感分析及关系抽取等热点任务中的可解释性需求紧密相连,为构建更贴近人类认知模式的对话AI提供了关键的数据支撑和评估基准,推动了从静态知识库向动态、多视角常识推理的范式转变。
相关研究论文
  • 1
    Multiview Contextual Commonsense Inference: A New Dataset and Task密歇根大学, 美国 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务