遇见数据集

soda-lmu/tweet-annotation-sensitivity-2

收藏
Hugging Face2024-04-24 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含了对推文中仇恨言论(HS)和冒犯性语言(OL)的注释,这些推文来自Davidson等人(2017)创建的语料库。数据集中的3000条推文在五种不同的实验条件下进行了注释,每种条件在注释任务结构上有所不同。此外,数据集还包含了注释者的人口统计信息。

This dataset comprises annotations for hate speech (HS) and offensive language (OL) within tweets, sourced from the corpus established by Davidson et al. (2017). A total of 3000 tweets from this dataset were annotated across five distinct experimental conditions, each varying in the structure of the annotation task. Furthermore, the dataset incorporates demographic information of the annotators.

提供机构:
soda-lmu
原始信息汇总

Tweet Annotation Sensitivity Experiment 2: Annotations in Five Experimental Conditions

描述

该数据集包含在五种实验条件下对仇恨言论(HS)和冒犯性语言(OL)的推文数据注释。推文数据采样自Davidson et al. (2017)创建的语料库。我们选择了3,000条推文进行注释。我们设计了五种实验条件,这些条件变化了注释任务结构,如下所示:

  • <font color= #871F78>条件A</font>:在一个屏幕上展示推文和三个选项:仇恨言论、冒犯性语言或两者都不是。注释者可以选择仇恨言论、冒犯性语言,或指示两者都不适用。

  • <font color= Blue>条件B</font>:第一个屏幕提示注释者指示推文是否包含仇恨言论。在下一个屏幕上,他们再次看到推文,并被问及是否包含冒犯性语言。

  • <font color= red>条件C</font>:类似于条件B,但颠倒了仇恨言论和冒犯性语言的顺序。

  • <font color=green>条件D</font>:注释者首先被要求为其分配的所有推文注释仇恨言论,然后被要求为同一组推文注释冒犯性语言。

  • 条件E:与条件D相同,但首先进行冒犯性语言注释任务,然后进行仇恨言论注释任务。

我们于2022年11月至12月期间从众包平台Prolific招募了美国注释者。每位注释者最多注释50条推文。数据集还包含注释者的 demographic 信息。注释者在完成任务后获得超过美国联邦最低时薪的固定小时工资。

代码本

列名 描述 类型
case_id 案例ID 整数
duration_seconds 连接任务的持续时间(秒) 整数
last_screen 最后回答的问题 因子
device 设备类型 因子
ethn_hispanic 西班牙裔种族/民族 二进制
ethn_white 白人种族/民族 二进制
ethn_afr_american 非裔美国人种族/民族 二进制
ethn_asian 亚洲人种族/民族 二进制
ethn_sth_else 其他种族/民族 二进制
ethn_prefer_not 种族/民族选择不透露 二进制
age 年龄 整数
education 教育程度 因子
english_fl 英语为第一语言 二进制
twitter_use Twitter使用频率 因子
socmedia_use 社交媒体使用频率 因子
prolific_hours 过去一个月在Prolific平台的工作量(小时) 整数
task_fun 任务感知:有趣 二进制
task_interesting 任务感知:有趣 二进制
task_boring 任务感知:无聊 二进制
task_repetitive 任务感知:重复 二进制
task_important 任务感知:重要 二进制
task_depressing 任务感知:压抑 二进制
task_offensive 任务感知:冒犯 二进制
repeat_tweet_coding 再次进行推文任务的可能性 因子
repeat_hs_coding 再次进行仇恨言论任务的可能性 因子
target_online_harassment 遭受网络仇恨行为 二进制
target_other_harassment 遭受其他仇恨行为 二进制
party_affiliation 党派身份 因子
societal_relevance_hs 仇恨言论的相关性感知 因子
annotator_id 注释者ID 整数
condition 实验条件(A-E) 因子
tweet_batch 批次中的推文ID 因子
hate_speech 仇恨言论注释 逻辑
offensive_language 冒犯性语言注释 逻辑
tweet_id 推文ID 整数
orig_label_hs 原始数据集中将推文注释为仇恨言论的人数 整数
orig_label_ol 原始数据集中将推文注释为冒犯性语言的人数 整数
orig_label_ne 原始数据集中将推文注释为两者都不是的人数 整数
tweet_hashed 用户名被哈希处理的推文 字符
搜集汇总
数据集介绍
soda-lmu/tweet-annotation-sensitivity-2 数据集图片
构建方式
在仇恨言论与攻击性语言检测领域,数据集构建方式的差异深刻影响模型性能。该数据集源自Davidson等人(2017)的语料库,从中精心筛选出3,000条推文,并设计了五种实验条件(A至E)进行标注。条件A将推文与三个选项(仇恨言论、攻击性语言、两者均非)置于同一屏幕,允许标注者多选;条件B与C则将任务拆分为两个连续屏幕,分别询问仇恨言论与攻击性语言,但顺序相反;条件D与E将两类标注任务完全独立,先完成全部推文的一个任务,再执行另一个。标注者通过Prolific平台招募,均为美国本土用户,每人最多标注50条推文,并获取高于联邦最低时薪的固定报酬。数据集还收录了标注者的详尽人口统计学信息,为分析标注偏差提供了丰富维度。
特点
该数据集的核心特点在于其精细的实验设计,系统性地探究了标注任务结构对结果的影响。五种条件覆盖了从单屏多选到分屏顺序、再到任务分离的完整谱系,使得研究者能够直接比较不同标注范式下仇恨言论与攻击性语言标注的差异。每条推文在每种条件下均被标注,确保了跨条件可比性。此外,数据集不仅包含标注结果,还整合了标注者的年龄、种族、教育背景、社交媒体使用频率、党派倾向等多元人口学特征,以及任务感知(如趣味性、重要性、压抑性)和过往经历(如是否遭受网络骚扰),为理解标注者主观因素如何塑造标注行为提供了前所未有的数据基础。这种多层次、多维度的数据架构,使其成为研究标注敏感性与模型鲁棒性的理想资源。
使用方法
该数据集主要适用于文本分类任务,尤其是仇恨言论与攻击性语言检测的敏感性分析。使用时,可加载包含条件标签(condition)、标注者ID(annotator_id)及推文内容(tweet_hashed)的完整数据表。研究者可按实验条件分组,比较不同结构下标注结果的一致性,或利用人口学变量作为协变量,分析标注偏差的来源。对于模型训练,建议采用跨条件交叉验证,以评估模型在不同标注范式下的泛化能力。此外,可结合原始Davidson数据集中的标签(orig_label_hs、orig_label_ol、orig_label_ne)进行对比实验。数据以CSV格式提供,可通过Pandas等库直接读取。引用时请标注相关论文(Kern et al., 2023; Beck et al., 2024),以确保学术规范性。
背景与挑战
背景概述
在自然语言处理领域,仇恨言论与攻击性语言的自动检测是维护网络空间清朗的关键技术之一,然而标注数据的质量与一致性始终是制约模型性能的瓶颈。该数据集由Christoph Kern等研究人员于2022年11月至12月期间,通过Prolific众包平台招募美国标注者构建而成,旨在系统探究标注任务结构对数据质量的影响。研究团队从Davidson等人2017年创建的语料库中精选3000条推文,设计了五种实验条件(A至E),分别改变标注界面的呈现方式与任务顺序,以评估不同标注范式下仇恨言论与攻击性语言识别的一致性。这一开创性工作揭示了标注过程的敏感性,为提升模型训练的可靠性提供了实证基础,对社交媒体内容审核领域产生了深远影响。
当前挑战
该数据集所应对的核心挑战在于标注任务结构如何影响数据质量,进而干扰下游模型的泛化能力。具体而言,首先面临的领域问题是仇恨言论与攻击性语言的界定模糊性,不同标注者因文化背景、个人经历或任务设计差异,可能对同一文本产生截然不同的判断,导致标注噪声与模型偏差。其次,构建过程中的挑战尤为突出:实验条件的设计需平衡任务分解与认知负荷,例如条件A的单屏多选可能引发选项混淆,而条件B至E的分步标注则需防范顺序效应;此外,标注者的异质性(如种族、教育程度、社交媒体使用频率)需通过详尽的元数据记录加以控制,以确保实验的可重复性。这些挑战共同制约着标注数据的生态效度,对构建鲁棒的检测模型构成持续考验。
常用场景
经典使用场景
该数据集的核心应用场景在于探究不同标注任务结构对仇恨言论与攻击性语言标注结果的影响。研究者通过设计五种实验条件,包括单屏多选项、分屏顺序标注以及独立分批次标注,系统性评估了标注流程变化如何改变人工标注的倾向性与一致性。这种精细化的实验设计为理解标注偏差的来源提供了独特视角,尤其适用于验证标注任务设计中‘顺序效应’与‘任务分割效应’对数据质量的影响,成为计算语言学中标注方法论研究的关键实验平台。
实际应用
在实际应用中,该数据集为社交媒体平台的内容审核系统提供了优化依据。平台可利用其标注变异性分析结果,设计更科学的众包标注任务,减少因标注流程不当导致的误判。此外,数据集中包含的标注者人口统计信息与任务感知数据,可辅助开发个性化标注培训方案,提升审核质量。对于非营利组织和政策制定者,该数据集有助于评估不同审核策略对言论自由与安全边界的影响,从而制定更合理的社区准则。
衍生相关工作
该数据集衍生了一系列关于标注方法论的重要工作。Kern等人(2023)基于此数据在EMNLP会议上发表了关于标注敏感性如何影响模型性能的开创性论文,揭示了训练数据收集方法对模型表现的因果效应。Beck等人(2024)进一步利用该数据集研究了标注任务中的顺序效应,在UncertaiNLP研讨会上展示了任务排序如何系统性地改变标注结果。这些工作共同构建了‘标注敏感性’研究框架,催生了后续关于标注流程标准化与不确定性建模的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务