遇见数据集

SQUINKY! A Corpus of Sentence-level Formality, Informativeness, and Implicature

收藏
arXiv2016-09-28 更新2024-06-21 收录
官方服务:

资源简介:

SQUINKY!是一个包含7032个句子的数据集,由密歇根大学的计算机科学与工程部门创建。该数据集通过亚马逊Mechanical Turk平台由人工标注者对句子的正式性、信息量和隐含意义进行评分,评分范围为1-7。数据集的内容涵盖了博客、新闻文章、学术论文和在线论坛等多种文档类型,旨在研究不同文体和语境下的语言使用。创建过程中,研究者对数据进行了严格的清洗和句子分割,确保数据的质量。该数据集的应用领域包括语言学研究、自然语言处理和文本分析,旨在解决如何量化和理解语言的正式性、信息量和隐含意义的问题。

SQUINKY! is a dataset containing 7032 sentences, developed by the Department of Computer Science and Engineering at the University of Michigan. Human annotators rated the sentences on three aspects—formality, informativeness, and implicature—via the Amazon Mechanical Turk platform, with scores ranging from 1 to 7. The dataset covers diverse document types including blogs, news articles, academic papers, and online forums, and is designed to study language usage across different styles and contexts. During the dataset construction process, researchers performed rigorous data cleaning and sentence segmentation to guarantee data quality. Its application fields cover linguistic research, natural language processing, and text analysis, with the objective of resolving the problem of quantifying and understanding language formality, informativeness, and implicature.

创建时间:
2015-06-08
搜集汇总
数据集介绍
SQUINKY! A Corpus of Sentence-level Formality, Informativeness, and Implicature 数据集图片
构建方式
在自然语言处理领域,句子级别的语用属性标注是理解文本风格与交际意图的关键。SQUINKY! 语料库的构建始于从博客、新闻和在线论坛三个体裁中精选的7,032条独特句子,这些句子源自Lahiri等人先前研究中经过人工清洗与分句处理的文本数据。随后,研究团队通过亚马逊机械土耳其人平台开展了两次独立的标注实验,邀请标注者采用1至7分的李克特量表对每条句子的正式程度、信息量和隐含意义进行评分。首次实验仅要求标注者来自美国,而第二次实验则额外设置了至少完成1000次任务且通过率不低于99%的资质门槛,以提升标注质量。每条句子均获得五次独立评分,最终取均值作为其语用属性值,从而构建出这一迄今规模最大的句子层级标注语料库。
特点
该语料库的核心特色在于其多维度的语用标注体系,首次将正式程度、信息量与隐含意义三个变量在句子层面进行大规模关联分析。标注结果显示,正式度与信息量之间呈现高度正相关,验证了深度正式性旨在促进更清晰直接沟通的理论假设。相比之下,隐含意义的标注一致性较低,反映出其作为最主观语用变量的认知复杂性。语料库覆盖新闻、博客与论坛三种体裁,其中新闻句子普遍具有最高的正式度与信息量,而论坛句子则分布更为分散,体现了不同交际场景下的风格差异。此外,句子长度与正式度、信息量呈正相关,进一步佐证了正式文本倾向于更详尽表达的规律。
使用方法
研究者可利用该语料库开展多种计算语言学分析。首先,通过比较不同体裁中句子的语用属性分布,可揭示文体风格的系统性差异,例如新闻文本的开端句子往往承载最高信息量。其次,语料库的标注结果可用于训练自动预测模型,以句子长度、词性标注频率或词汇密度等特征为输入,预测任意句子的正式度或信息量。此外,隐含意义的评分虽可靠性较低,但为探索语用歧义与语境依赖性提供了宝贵的基准数据。用户可直接从公开链接下载完整数据集,并参考论文中的相关性分析(如斯皮尔曼等级相关系数)来验证或拓展关于语用变量间关系的理论假设。
背景与挑战
背景概述
SQUINKY! 数据集由密歇根大学的 Shibamouli Lahiri 于 2015 年创建,旨在填补句子层面语用属性标注的空白。该数据集包含 7,032 条人工标注的句子,覆盖形式性、信息性和隐含意义三个维度,采用 1-7 级李克特量表。其核心研究问题在于量化文本的语用特征,探索形式性与信息性、隐含意义之间的内在关联,并验证 Heylighen 和 Dewaele 提出的深度形式性理论。作为迄今规模最大的句子级语用标注语料库,SQUINKY! 为自然语言处理中的文体分析、语用推理和文本生成研究提供了重要基准,推动了计算语用学的发展。
当前挑战
该数据集面临的核心挑战包括:首先,隐含意义的标注主观性极强,跨实验的斯皮尔曼相关系数仅为 0.14,显著低于形式性(0.68)和信息性(0.64),反映出该概念难以通过简单语义或句法规则捕捉。其次,构建过程中需克服噪声干扰,如从 PDF 提取的论文数据因字符损坏和文本缺失被舍弃,仅保留博客、新闻和论坛数据。此外,众包标注缺乏严格质量控制,尽管通过两轮实验验证了均值可靠性,但隐含意义标注仍存在中心趋势偏差,亟需更精细的标注策略和自动评分模型来提升一致性。
常用场景
经典使用场景
在自然语言处理与计算语言学领域,SQUINKY语料库作为首个大规模句子级标注资源,为文体风格的量化分析提供了坚实基石。该数据集涵盖7,032条来自博客、新闻与论坛的句子,经由人工标注获取其在1-7李克特量表上的正式度、信息量与隐含意义评分。研究者可借此深入探究不同体裁中句子层面的语用特征分布,例如新闻文本中正式度与信息量的递减趋势,以及论坛语料中信息量的均匀分散现象,从而揭示文体维度与交际意图之间的微妙关联。
衍生相关工作
SQUINKY语料库的发布催生了一系列衍生研究。Lahiri与Lu基于该数据集进一步探索了句子正式度的自动预测方法,验证了词汇特征与句法结构在风格判别中的有效性。后续工作借鉴其标注范式,构建了针对特定领域(如邮件、学术摘要)的语用属性数据集,并引入深度学习模型进行多维风格评分。此外,该语料库中隐含意义的标注挑战激发了Degen等人对特定隐含类型(如标量隐含)的细粒度研究,推动了语用推理与计算模型的结合。这些工作共同拓展了句子级语用分析的理论与实践边界。
数据集最近研究
最新研究方向
在当前自然语言处理的前沿探索中,SQUINKY!语料库的构建标志着对句子层面语用变量系统量化的重大跨越。该研究聚焦于形式性、信息量与隐含意的连续尺度标注,突破了传统二元分类的局限,揭示了这三种语用特征在新闻、博客、论坛等多体裁文本中的差异化分布模式。尤为值得关注的是,研究发现形式性与信息量之间存在显著正相关,而隐含意的标注则面临主观性强、一致性低的挑战,这一发现为后续自动语用预测模型的开发提供了关键基准。随着社交媒体与在线交流的蓬勃发展,该语料库不仅为风格迁移、文本生成中的语用控制提供了实证基础,更推动了语言计算从表面特征向深层交际意图的转向,其对隐含意量化方法的探索尤为契合当前多模态与对话系统中隐含意义理解的研究热点。
相关研究论文
  • 1
    SQUINKY! A Corpus of Sentence-level Formality, Informativeness, and Implicature计算机科学与工程 密歇根大学 安娜堡, MI 48109 · 2016年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务