遇见数据集

西班牙语放射学报告标注语料库

收藏
arXiv2017-10-31 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

本研究创建了一个包含513份西班牙语放射学报告的标注语料库,旨在为命名实体识别(NER)和关系抽取(RE)算法提供评估资源。数据集由阿根廷的一家医院提供,报告内容涉及多种超声检查,如肾脏和腹部检查。创建过程中,研究人员通过多次迭代改进了标注指南,并利用自动预标注技术加速了标注过程。该数据集的应用领域主要集中在医疗文本处理,特别是帮助医生识别可能的医疗问题,从而指导手术干预等治疗决策。

This study developed an annotated corpus containing 513 Spanish radiology reports, with the aim of providing evaluation resources for named entity recognition (NER) and relation extraction (RE) algorithms. The dataset was supplied by a hospital in Argentina, and the reports cover a range of ultrasound examinations, including kidney and abdominal ultrasound scans. During the construction of this corpus, researchers refined the annotation guidelines through multiple iterative rounds and employed automatic pre-annotation techniques to expedite the annotation process. The primary application scope of this dataset lies in medical text processing, specifically aiding clinicians in identifying potential medical concerns to inform therapeutic decisions such as surgical interventions.

创建时间:
2017-10-31
搜集汇总
数据集介绍
西班牙语放射学报告标注语料库 数据集图片
构建方式
在西班牙语放射学报告标注语料库的构建过程中,研究者从阿根廷一家医院选取了513份不同类型的超声报告,涵盖肾脏、腹部等多个解剖区域。这些报告仅包含发现、结论和建议等单一章节,内容简短且常呈现电报式风格,伴有拼写错误、非标准缩写及专业术语的频繁使用。为确保隐私,报告通过正则表达式去除了研究日期、报告编号、患者标识以及医师姓名和职称等信息。标注流程历经三轮迭代,由两位西班牙语母语者基于预标注工具(如brat)进行手动修正与关系标注,预标注利用正则表达式、UMLS及自建词典自动识别实体、否定和不确定性术语,最终耗时约160小时完成语料库的生成。
特点
该语料库的核心特点在于其细粒度的多维度标注体系,涵盖了10类实体(如发现、解剖实体、位置、度量、纹理、否定术语等)和8种关系(如“发生于”、“位于”、“否定”等),尤其注重跨句子关系的捕捉,占全部关系的7.89%。标注过程中引入“多段术语”概念,如将“intra and extrahepatic”分解为独立实体。语料库中否定发现占比高达56%,不确定性术语相对稀少,体现了临床报告的语言倾向性。此外,缩写与缩略词占解剖实体和发现的约6%,进一步增加了语言复杂性。最终标注者间一致性(Cohen's Kappa)达到0.89,表明标注质量可靠。
使用方法
该语料库主要面向命名实体识别(NER)和关系抽取(RE)算法的评估与监督学习训练,尤其适用于西班牙语医学文本的自动处理任务。研究者可利用其标注的实体与关系标签,训练模型识别发现、解剖实体及其关联,并检测否定与不确定性表述。语料库的跨句子关系标注为处理长距离依赖提供了训练素材,而否定发现的高比例则适合开发专门的否定检测方法。鉴于报告的非标准语言特性,使用者需注意拼写错误和缩写处理,可参考RadLex与UMLS等本体进行消歧。该语料库的标注指南亦可作为其他语言或领域相似任务的参考框架。
背景与挑战
背景概述
在生物医学自然语言处理领域,非英语文本的标注语料库极为匮乏,这一困境源于专家知识的高昂成本与患者隐私保护的严格要求。为弥合这一鸿沟,Viviana Cotik、Darío Filippo、Roland Roller、Hans Uszkoreit与Feiyu Xu等研究人员于2017年构建了西班牙语放射学报告标注语料库,该语料库由来自阿根廷一家医院的513份匿名化超声报告组成,涵盖实体、否定与不确定术语及关系的手动标注。该语料库旨在为命名实体识别与关系抽取算法提供评估基准,并作为监督学习方法的训练数据,其发布填补了西班牙语临床文本标注资源的空白,对推动非英语医学信息抽取研究具有里程碑意义。
当前挑战
该语料库的构建面临多重挑战。首先,放射学报告语言风格独特,句子简短且常呈电报式,夹杂拼写错误、非标准缩写与医学术语,显著增加了标注的复杂度。其次,隐私保护要求严格,需通过正则表达式系统性地移除患者标识、医师信息及报告编号,确保匿名化彻底。再者,标注过程需处理跨句子关系、多片段术语(如“intra and extrahepatic”)以及否定与不确定性表达,其中56%的发现项被否定,进一步提升了标注难度。此外,预标注工具虽加速了流程,却可能引入偏差,且标注者间的一致性需经过多轮迭代优化,最终Cohen’s Kappa系数达到0.89,体现了达成共识的艰辛。
常用场景
经典使用场景
在医学自然语言处理领域,西班牙语放射学报告标注语料库为命名实体识别与关系抽取算法的评估与训练提供了稀缺的标注资源。该语料库涵盖513份匿名化超声报告,精细标注了解剖实体、发现、否定与不确定性术语及其关联关系,尤其适用于处理非英语临床文本中特有的缩写、拼写错误及电报式句法结构。研究者可借助该语料库验证模型在西班牙语医学语境下的实体边界识别、跨句关系抽取及否定范围判定的性能,从而推动多语言临床信息抽取技术的进步。
衍生相关工作
围绕该语料库衍生出多项经典工作,包括基于规则的否定检测算法(如改进NegEx适应西班牙语)、结合UMLS与RadLex的实体归一化方法,以及针对跨句关系的图神经网络模型。后续研究还扩展了其标注框架至CT与MRI报告,并探索了半监督预标注策略以降低人工成本。部分工作将语料库作为基准,对比不同语言(如英语、德语)的放射学报告处理任务,揭示了多语言临床NLP的共性挑战(如缩写歧义)与语言特异性差异。
数据集最近研究
最新研究方向
在非英语生物医学自然语言处理领域,标注资源的稀缺性长期制约着临床文本挖掘技术的发展。西班牙语放射学报告标注语料库的构建,为这一困境提供了突破性解决方案。该语料库涵盖513份匿名化超声报告,不仅标注了实体、否定与不确定性术语及其关系,还建立了适用于命名实体识别与关系抽取的评估基准。当前前沿研究方向聚焦于利用该语料库训练监督学习模型,以自动识别放射学报告中的病理发现、解剖位置及测量值,并结合否定与不确定性检测提升事实性判断的准确性。此外,该工作推动了多语言临床文本处理范式的演进,为低资源语言领域的类似研究提供了可复用的标注指南与方法论框架,具有重要的学术价值与临床转化潜力。
相关研究论文
  • 1
    Creation of an Annotated Corpus of Spanish Radiology Reports阿根廷布宜诺斯艾利斯大学计算机系,阿根廷 · 2017年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务