遇见数据集

community-datasets/per_sent

收藏
Hugging Face2024-06-26 更新2024-06-15 收录
官方服务:

资源简介:

PerSenT数据集是一个用于情感分类的英文数据集,主要关注新闻文章中作者对主要实体的情感倾向。数据集包含5.3k文档和38k段落的标注,覆盖3.2k个独特实体。每个文档和段落都有情感标签(正面、中性、负面)。数据集的结构包括文档索引、标题、目标实体、文档内容、掩码文档、真实情感以及每个段落的情感标签。数据集分为训练集、验证集和两个测试集,确保每个实体只出现在一个集合中。数据集的创建过程包括从MPQA、KBP Challenge和Media Rank等来源选择文章,并通过Amazon Mechanical Turk进行标注。

PerSenT Dataset is an English dataset for sentiment classification, which primarily focuses on the sentiment orientation of authors towards key entities in news articles. It contains annotations for 5.3k documents and 38k paragraphs, covering 3.2k unique entities. Each document and paragraph is labeled with sentiment categories including positive, neutral and negative. The dataset structure consists of document index, title, target entity, document content, masked document, ground-truth sentiment, and per-paragraph sentiment labels. The dataset is partitioned into training, validation and two test sets, with the constraint that each unique entity appears in exactly one split. The dataset construction process includes selecting articles from sources such as MPQA, KBP Challenge and Media Rank, followed by annotation via Amazon Mechanical Turk.

提供机构:
community-datasets
原始信息汇总

数据集概述

基本信息

  • 数据集名称: PerSenT
  • 语言: 英语
  • 数据集大小: 1K<n<10K
  • 任务类别: 文本分类
  • 任务ID: 情感分类
  • 许可证: 未知

数据集结构

特征字段

  • DOCUMENT_INDEX: 文档索引,数据类型为int64
  • TITLE: 文章标题,数据类型为string
  • TARGET_ENTITY: 目标实体,数据类型为string
  • DOCUMENT: 文章文本,数据类型为string
  • MASKED_DOCUMENT: 目标实体被掩码的文章文本,数据类型为string
  • TRUE_SENTIMENT: 整个文档的情感标签,数据类型为class_label,包含三个类别:Negative, Neutral, Positive
  • Paragraph{0..15}: 每个段落的情感标签,数据类型为class_label,包含三个类别:Negative, Neutral, Positive

数据分割

  • train: 3355个样本,14595163字节
  • test_random: 579个样本,2629500字节
  • test_fixed: 827个样本,3881800字节
  • validation: 578个样本,2322922字节

数据集创建

数据来源

  • MPQA: 包含手动标注的新闻文章,用于意见、信念、情感、情绪、推测等。
  • KBP Challenge: 包含TAC 2014 KBP英语情感槽填充挑战数据集。
  • Media Rank: 用于对约50k新闻源进行排名,并用于对新闻文章的政治意识形态进行分类。

预处理步骤

  • 使用Stanford NER和共指消解技术识别文章中的人物实体。
  • 移除不符合条件的文章,如提及最频繁人物实体少于三次的文章。
  • 过滤掉过长或过短的文章,保留至少有3个段落且最多有16个段落的文章。

标注过程

  • 使用Amazon Mechanical Turk进行文档和段落级别的标注。
  • 标注者首先验证目标实体是否为文档的主要实体,然后对包含目标实体提及或引用的每个段落进行评分。
  • 最后,标注者根据整个文档对实体的情感进行评分,评分类别为Negative, Neutral, Positive。

许可证

  • 许可证信息: Creative Commons Attribution 4.0 International License

引用信息

@inproceedings{bastan2020authors, title={Authors Sentiment Prediction}, author={Mohaddeseh Bastan and Mahnaz Koupaee and Youngseo Son and Richard Sicoli and Niranjan Balasubramanian}, year={2020}, eprint={2011.06128}, archivePrefix={arXiv}, primaryClass={cs.CL} }

搜集汇总
数据集介绍
community-datasets/per_sent 数据集图片
构建方式
PerSenT数据集的构建源自对新闻文本中作者针对主要实体所表达情感的精细化捕捉。其数据来源融合了MPQA、KBP Challenge及MediaRank三大资源,通过斯坦福命名实体识别与共指消解技术提取文章中的人物实体,并依据实体提及频率筛选出每篇文章的核心实体。为确保数据质量,剔除了篇幅过短或过长的文档,仅保留包含3至16个段落的文章。在标注环节,借助Amazon Mechanical Turk众包平台,由标注员首先验证目标实体的主导地位,随后逐段落评估作者对该实体的情感倾向,最终整合为文档级标签。原始的五级细粒度情感(如“轻微正面”)被合并为消极、中立与积极三个粗粒度类别,从而构建起包含约5,300篇文档与38,000个段落的多层次情感标注数据集。
特点
该数据集的核心特点在于其独特的文档-段落双层情感标注结构,每篇文章不仅拥有整体情感标签,其内部最多16个段落也各自附有独立的标注,从而支持从局部到全局的情感分析研究。数据划分策略尤为严谨,为确保实体不跨集出现,采用基于实体的互斥分割方法,并针对出现频率极高的实体单独构建“频繁实体测试集”,以评估模型在长尾分布下的泛化能力。此外,数据集中包含掩码文档字段(MASKED_DOCUMENT),将目标实体替换为特殊标记[TGT],为研究实体级情感推理提供了天然的去偏工具。这些设计共同使PerSenT成为面向新闻文本作者情感预测任务的标志性基准。
使用方法
PerSenT数据集适用于文本分类中的情感分析任务,尤其聚焦于作者对特定实体的态度推断。使用时,可直接加载预定义的训练集、验证集、标准测试集及频繁实体测试集。每个样本包含文档索引、标题、原文、掩码文档、目标实体名称及文档级情感标签,同时提供Paragraph0至Paragraph15共16个段落级标签,缺失段落以-1填充。研究者可基于文档全文进行情感分类,也可利用段落标签开展段落级情感建模或跨段落情感传递分析。结合掩码文档字段,可设计消融实验或注意力机制来探究实体信息对情感判断的影响。该数据集在HuggingFace平台以community-datasets/per_sent命名提供,支持通过datasets库直接加载与使用。
背景与挑战
背景概述
在自然语言处理领域,情感分析一直是研究热点,然而传统方法多聚焦于文本整体或句子级别的情感极性判断,忽略了作者对特定实体的倾向性表达。PerSenT数据集由Stony Brook大学的研究团队于2020年创建,旨在填补这一空白,通过众包方式标注了5,300余篇新闻文档及38,000个段落,涵盖3,200个独特实体。该数据集的核心研究问题在于捕捉作者在新闻报道中对主要实体的情感态度,为细粒度、目标导向的情感分析提供了标准化评估基准。其发布推动了作者情感预测任务的发展,在计算语言学与社会科学交叉研究中具有重要影响力。
当前挑战
PerSenT数据集所解决的领域挑战在于,传统情感分析模型难以区分作者对同一文档内不同实体的情感差异,且易受文档结构影响,无法准确捕捉段落级的情感动态。构建过程中面临多重困难:首先,需从MPQA、KBP Challenge和MediaRank等多源异构数据中筛选包含明确主要实体的新闻,并利用命名实体识别与共指消解技术提取目标实体,处理实体分布不均问题;其次,众包标注需设计有效任务流程,确保标注者聚焦于作者视角而非自身情感,并将五级细粒度标签合理合并为三级,以平衡标注一致性与信息粒度。
常用场景
经典使用场景
PerSenT数据集的核心应用场景在于面向新闻文本的作者情感倾向分析,其独特之处在于将情感判断的粒度从传统的文档级别精细至段落级别。该数据集覆盖了超过三千个独立实体与五千余篇新闻文章,每篇文章均标注了作者对主要实体的整体情感倾向,同时其内部的每一个段落也获得了独立的情感标签。这种多层次、细粒度的标注结构,为研究者提供了一个绝佳的实验平台,用以探索情感在文本不同层级间的分布规律与传递机制,尤其适用于训练和评估那些能够捕捉局部语境情感信号的序列模型或注意力机制模型。
衍生相关工作
PerSenT数据集发布后,催生了一系列旨在改进目标导向情感分析与可解释性模型的研究工作。经典衍生工作包括基于注意力机制的细粒度情感分类模型,这些模型利用段落级标签作为辅助监督信号,学习在长文本中定位并聚焦于与目标实体高度相关的关键句子。另一重要方向是跨段落情感推理,研究者尝试构建图神经网络或层次化循环网络,以捕捉文章不同段落之间关于同一实体的情感流转与矛盾关系。此外,该数据集还被用于评估预训练语言模型(如BERT、RoBERTa)在实体级情感理解上的能力,推动了针对长文本、多实体复杂场景的上下文表示学习方法的创新。
数据集最近研究
最新研究方向
在细粒度情感分析的前沿探索中,PerSenT数据集聚焦于新闻文本中作者对特定实体所持态度的深层挖掘,突破了传统文档级情感分类的局限。其创新之处在于同时提供篇章与段落级别的标注,为理解情感在文本结构中的分布与演变提供了独特视角。当前研究热点集中于利用该数据集训练模型以捕捉跨段落的情感连贯性与转折,进而提升对复杂叙事中隐含立场的推断能力。该数据集与媒体偏见分析、舆情监控等热点事件紧密相连,通过揭示新闻报道中作者对政治人物、企业等实体的潜在倾向,为自动化事实核查与立场检测提供了关键基准,推动了自然语言处理从表层情感识别向深层意图理解的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务