遇见数据集

CrisisLTLSum

收藏
arXiv2022-10-26 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

CrisisLTLSum是由密歇根州立大学等机构创建的,目前最大的本地危机事件时间线数据集,包含1000个事件时间线,涵盖野火、本地火灾、交通和风暴四个领域。数据集通过半自动化流程收集,首先从Twitter流中提取集群,然后通过人工标注精炼,确保数据的质量和相关性。CrisisLTLSum主要用于支持危机管理中的实时事件跟踪和摘要生成,帮助应急响应人员快速获取和理解关键信息,有效部署资源。

CrisisLTLSum is the largest local crisis event timeline dataset to date, created by Michigan State University and other institutions. It contains 1,000 event timelines covering four domains: wildfires, local fires, traffic incidents, and storms. The dataset is collected via a semi-automated pipeline: clusters are first extracted from Twitter streams, then refined through manual annotation to ensure data quality and relevance. CrisisLTLSum is mainly designed to support real-time event tracking and summary generation in crisis management, helping emergency responders quickly obtain and understand key information and effectively deploy resources.

提供机构:
密歇根州立大学
创建时间:
2022-10-26
搜集汇总
数据集介绍
CrisisLTLSum 数据集图片
构建方式
在危机事件管理与应急响应的研究背景下,社交媒体平台的实时信息流为灾情态势感知提供了宝贵的数据源。CrisisLTLSum数据集采用半自动化的'先聚类再精炼'策略进行构建,首先从公开的Twitter数据流中,通过地理位置、时间窗口与领域关键词的多重过滤机制,结合实体抽取与位置增强技术,利用在线聚类算法生成包含噪声的原始时间线簇。随后,对这些簇进行后处理,包括人工辅助合并、模糊去重以及基于BERT的噪声过滤,最终由人类标注员在Amazon Mechanical Turk平台上对选定的1000个时间线进行精细标注,确定每条推文是否构成时间线的一部分,并撰写抽象式摘要。
特点
作为目前规模最大的本地危机事件时间线数据集,CrisisLTLSum覆盖野火、局部火灾、交通与风暴四大领域,包含1000条时间线及10610条推文,其中41%的推文被标注为时间线有效内容。该数据集独树一帜地支持两项复杂下游任务:时间线提取与抽象式摘要生成,前者要求从噪声流中识别同一事件的增量更新,后者则需生成描述事件演进的凝练摘要。数据集的标注一致性高达90%以上,且通过分层抽样划分为训练、开发与测试集,为模型评估提供了可靠基准。
使用方法
研究者可借助CrisisLTLSum推动自然语言处理在危机领域的社会应用。对于时间线提取任务,可采用序列分类或序列标注范式,基于预训练语言模型(如BERT)对推文进行二分类判断;对于摘要生成任务,则适宜采用序列到序列模型(如BART)进行抽象式生成。数据集提供了明确的训练/开发/测试划分与评估指标(如准确率、ROUGE分数),并公开了代码与基线模型,便于复现与对比。此外,其标注结构与任务定义也为联合建模或细粒度事件流理解等前沿探索提供了丰富的实验土壤。
背景与挑战
背景概述
社交媒体在应急响应中扮演着日益关键的角色,第一响应者可借助公众发布的信息实时掌握危机事件动态并合理调配资源。然而,从海量嘈杂的社交媒体帖子中提取事件时间线并生成抽象摘要,是自然语言处理领域极具挑战性的任务。为此,由密歇根州立大学、纽约大学阿布扎比分校及Dataminr公司的研究人员于2022年共同构建了CrisisLTLSum数据集。该数据集聚焦于局部危机事件,涵盖野火、局部火灾、交通和风暴四个领域,包含1,000条时间线及10,610条推文,是迄今为止规模最大的局部危机事件时间线基准数据集。其核心研究问题在于如何从连续推文流中自动提取与事件进展相关的新信息,并生成凝练的抽象摘要,从而为应急决策提供时效性支持。该数据集的提出填补了该领域缺乏标准基准的空白,推动了自然语言处理技术在社会公益与危机管理中的实际应用。
当前挑战
CrisisLTLSum所解决的领域问题包括两大核心挑战。其一,时间线提取任务需从嘈杂的推文流中识别与特定危机事件相关的更新信息,这要求模型具备处理海量冗余与噪声内容的能力,同时应对社交媒体非正式语言风格带来的语义歧义。其二,时间线摘要生成任务需在提取信息的基础上,生成能够准确反映事件演化时序与关键细节的抽象摘要,这对模型的抽象概括能力与事件理解能力提出了更高要求。在数据集构建过程中,挑战同样显著。由于局部危机事件持续时间短、相关推文数量有限,传统聚类方法难以有效捕捉事件边界。此外,实体提取模块对位置和非常见实体的识别精度有限,且依赖OpenStreetMap等外部知识源进行位置增强,增加了流程的复杂性与地域依赖性。在线聚类算法的超参数需通过启发式调整,其泛化能力受限,而人工标注阶段需确保标注者一致性,并应对长时间线中信息冗余与遗漏的平衡问题。
常用场景
经典使用场景
在危机事件响应与社交媒体分析领域,CrisisLTLSum 作为首个聚焦于局部危机事件时间线提取与抽象式摘要的基准数据集,为研究者提供了从海量、嘈杂的 Twitter 流中精准识别并追踪事件演进的关键资源。该数据集涵盖了野火、火灾、交通与风暴四个典型领域,包含 1,000 条精心标注的时间线,每条时间线均以种子推文为起点,后续推文按时间顺序排列,并标注了是否属于时间线的一部分。其经典使用场景在于,给定一条初始事件推文,模型需从后续的噪声推文流中自动提取出与该事件相关、包含新信息且不冗余的更新推文,从而构建出一条干净、演进的事件时间线,为实时事件监测与应急决策提供结构化信息支撑。
衍生相关工作
CrisisLTLSum 的发布催生了一系列后续研究工作。在时间线提取任务上,研究者基于该数据集探索了序列标注与序列分类的融合方法,例如结合 BERT 与双向 GRU 的模型,以捕捉推文间的时序依赖关系。在摘要生成方面,BART 与 DistillBART 等预训练序列到序列模型被广泛用作基线,并催生了针对长时间线摘要的改进策略,如引入事件实体感知机制或层次化编码结构。此外,该数据集还启发了关于联合建模提取与摘要任务的探索,旨在通过端到端框架同时完成事件更新点的识别与信息凝练。这些衍生工作不仅丰富了危机领域 NLP 的方法论体系,也为其他时序信息密集型任务(如新闻时间线摘要、生物事件追踪)提供了可迁移的技术范式。
数据集最近研究
最新研究方向
在社交媒体驱动的应急响应领域,CrisisLTLSum的发布标志着从单一事件分类向动态事件时序提取与抽象式摘要的范式跃迁。该数据集聚焦于局部危机事件(如山火、交通事故、风暴等),通过半自动聚类与人工精炼流程构建了迄今规模最大的时序基准,涵盖1000条事件线。前沿研究正围绕两个核心方向展开:一是基于噪声社交媒体流实时提取事件演进信息的时序提取技术,二是融合时间顺序与关键细节的抽象式摘要生成模型。当前实验揭示,强基线模型在两项任务上与人类表现存在显著差距,尤其在长事件线场景中,模型对冗余信息的过滤与演进脉络的捕获能力不足。这一资源不仅推动自然语言处理面向社会公益的应用,更催生了联合优化时序提取与摘要生成的新范式,为构建高时效、低冗余的应急决策支持系统奠定基础。
相关研究论文
  • 1
    CrisisLTLSum: A Benchmark for Local Crisis Event Timeline Extraction and Summarization密歇根州立大学 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务