遇见数据集

Felix-ML/quoteli3

收藏
Hugging Face2022-10-25 更新2024-03-04 收录
官方服务:

资源简介:

该数据集基于Muzny等人(2017)的quoteli3数据集,包含三部文学作品的注释引用:契诃夫的《草原》、奥斯汀的《艾玛》和《傲慢与偏见》。数据集的语言为英语,结构包括训练和测试数据,分别包含引用和角色的特征和行数。

This dataset is based on the quoteli3 dataset from Muzny et al. (2017). It contains annotated citations from three literary works: Anton Chekhov's *Steppe*, Jane Austen's *Emma* and *Pride and Prejudice*. The dataset is in English. Its structure includes training and test datasets, which respectively contain the features and line counts for citations and characters.

提供机构:
Felix-ML
原始信息汇总

数据集概述

数据集名称

  • 名称: quoteli3

数据集描述

  • 摘要: 该数据集基于Muzny等人(2017)的quoteli3数据集,包含三部文学作品(Chekhov的《The Steppe》、Austen的《Emma》和《Pride and Prejudice》)的标注引用。

语言

  • 语言: 英语

数据集结构

  • 训练数据:
    • 引用:
      • 特征: [mention, oid, speaker, connection, id, answer, answer_mention {answer, answer_start, answer_end, answer_in_context}, question, context, large_context, book_title]
      • 行数: 1575
    • 角色:
      • 特征: [aliases, description, gender, name, id, book_title]
      • 行数: 32
  • 测试数据:
    • 引用:
      • 特征: [mention, oid, speaker, connection, id, answer, answer_mention {answer, answer_start, answer_end, answer_in_context}, question, context, large_context, book_title]
      • 行数: 1513
    • 角色:
      • 特征: [aliases, description, gender, name, id, book_title]
      • 行数: 145
搜集汇总
数据集介绍
构建方式
Felix-ML/quoteli3数据集源自Muzny等人于2017年提出的经典引用归因研究,旨在为文学文本中的对话引用提供结构化标注。该数据集精心选取了契诃夫的《草原》、奥斯汀的《爱玛》与《傲慢与偏见》三部英文文学名著,通过对作品中出现的引文及其相关人物进行系统化注释构建而成。数据集的构建不仅涵盖了引文本身,还包含了引文所指代的说话者、上下文语境以及引文与人物之间的关联信息,从而形成了一个多层次、高精细度的标注体系。训练集与测试集分别包含1575条与1513条引文数据,以及32个与145个人物实体,确保了模型训练与评估的充分性。
特点
该数据集最显著的特征在于其聚焦于文学叙事中的引用归因任务,为自然语言处理领域提供了一个高度专业化且具有挑战性的基准。数据集中的每条引文均包含了丰富的元信息,如引文的原始表述(mention)、说话者标识(speaker)、引文与上下文的连接关系(connection),以及经过精心设计的问答对(question与answer),使得研究者能够从多个角度探索引用解析的复杂性。此外,人物实体数据集中包含了别名、描述、性别等属性,为跨文本的人物共指消解提供了有力支持。数据集的规模虽不庞大,但其精细的标注质量与文学领域的独特视角,使其在引用归因研究中具有不可替代的价值。
使用方法
使用Felix-ML/quoteli3数据集时,研究者可直接通过Hugging Face Datasets库加载数据,支持常见的机器学习框架如PyTorch与TensorFlow。数据集的引文部分提供了'mention'、'context'、'large_context'等字段,便于构建基于上下文的引用归因模型;而'question'与'answer'字段则天然适配于问答系统的训练范式。人物实体数据可用于训练人物识别与属性推断模型。建议研究者根据任务需求,灵活组合引文与人物数据,例如利用人物别名实现跨段落的人物追踪,或结合'connection'字段分析引文与叙述者的交互模式。数据集的官方主页还提供了原始论文与代码资源,供深入参考。
背景与挑战
背景概述
在自然语言处理领域,引用归因(quote attribution)是文本理解中的一项关键任务,旨在识别文学或新闻文本中话语的发出者。Felix-ML/quoteli3数据集由斯坦福大学的Grace Muzny等人于2017年创建,其核心研究问题聚焦于通过两阶段筛分方法实现高精度的引用归因。该数据集基于三部经典英文文学作品——契诃夫的《草原》、奥斯汀的《爱玛》与《傲慢与偏见》——进行人工标注,涵盖了1575条训练引文和1513条测试引文,同时提供了32个训练角色与146个测试角色的详细属性。作为引用归因领域的基准资源,quoteli3推动了对话理解与叙事结构分析的发展,为后续研究提供了标准化的评估平台。
当前挑战
该数据集所解决的领域挑战在于文学文本中引用归因的歧义性,例如间接引语、多角色对话或未明确标注说话者的场景,这要求模型具备对上下文和角色特征的深度理解。构建过程中面临的核心挑战包括:其一,人工标注需精确对齐引文与说话者,但文学语言中常出现嵌套引用或隐含指代,增加了标注一致性难度;其二,角色数量有限(训练集仅32位),导致样本稀疏性,可能影响模型泛化能力;其三,作品风格差异显著,如契诃夫的细节描写与奥斯汀的对话密集性,对归因算法的适应性提出更高要求。
常用场景
经典使用场景
在自然语言处理与计算文学分析的交叉领域中,Felix-ML/quoteli3数据集被广泛用于引语归属(Quote Attribution)任务的研究与评估。该数据集精选自三部经典文学作品——契诃夫的《草原》、奥斯汀的《爱玛》与《傲慢与偏见》,提供了丰富的引语及其对应说话者的标注信息。研究者常借助该数据集训练和测试模型,以识别文本中每一句引语的具体发言人,从而推动叙事理解与角色对话解析的自动化进程。其精心设计的训练与测试划分,使得模型在跨作品泛化能力上的评估成为可能,是引语归属研究中的标杆性资源。
衍生相关工作
quoteli3数据集催生了一系列具有影响力的学术工作,其中最经典的是Muzny等人提出的两阶段筛分法(Two-Stage Sieve Approach),该方法首次将引语检测与归属分离为两个串联子任务,显著提升了系统性能。后续研究在此基础上引入了图神经网络与注意力机制,以建模角色间的对话关系与上下文依赖。此外,该数据集还被用于跨语言引语归属研究,以及结合预训练语言模型(如BERT)的微调实验,推动了叙事文本理解向更深层次的人物关系推理与话语角色识别方向演进。
数据集最近研究
最新研究方向
在自然语言处理领域,引语归属(Quote Attribution)作为话语分析的核心任务之一,近年来随着叙事文本理解需求的攀升而备受关注。Felix-ML/quoteli3数据集聚焦于经典文学作品中的引语与说话者映射关系,其基于Muzny等人提出的两阶段筛分方法,为细粒度的人物对话解析提供了标准化基准。当前前沿研究正围绕该数据集推进多项突破:一方面,结合预训练语言模型(如BERT、RoBERTa)进行上下文敏感的说话者消歧,显著提升了多角色文本中的归属准确率;另一方面,研究者通过引入篇章级语义角色标注与跨句指代推理,探索复杂叙事结构下隐含引语的自动识别。此外,该数据集在数字人文领域亦引发热议,成为分析19世纪英语小说中性别化话语模式、权力动态与社交网络的关键语料。其意义不仅在于推动信息抽取技术的迭代,更在于为文学计算与计算社会学的交叉研究提供了可复现的实验平台,助力揭示文学文本中隐含的社会结构编码。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务