遇见数据集

liliya-makhmutova/medical_texts_simplification

收藏
Hugging Face2024-03-19 更新2024-03-04 收录
官方服务:

资源简介:

该数据集名为Medical texts simplification,主要用于文本生成任务,涉及医学领域的文本简化。数据集包含30个三元组(约800个句子),每个三元组包括原始文本、人工简化文本和ChatGPT简化文本。原始数据来源于Medical Notes Classification dataset,涵盖了五个临床领域的医学笔记:胃肠病学、神经学、骨科、放射学和泌尿学。数据集的语言为英语,许可证为CC-BY-NC-4.0,数据规模小于1K。数据集的结构包括文件编号、行号、原始文本、人工简化文本、ChatGPT简化文本和相关的图像文件。数据集的创建动机是为了解决患者难以理解医学文本的问题,通过简化文本帮助患者更好地理解其医疗记录。数据集的创建过程包括预处理原始文本、人工简化文本以及使用ChatGPT生成简化文本。数据集的使用建议包括不应在没有医疗专业人员监督的情况下用于患者治疗,且不应用于商业用途。

该数据集名为Medical texts simplification,主要用于文本生成任务,涉及医学领域的文本简化。数据集包含30个三元组(约800个句子),每个三元组包括原始文本、人工简化文本和ChatGPT简化文本。原始数据来源于Medical Notes Classification dataset,涵盖了五个临床领域的医学笔记:胃肠病学、神经学、骨科、放射学和泌尿学。数据集的语言为英语,许可证为CC-BY-NC-4.0,数据规模小于1K。数据集的结构包括文件编号、行号、原始文本、人工简化文本、ChatGPT简化文本和相关的图像文件。数据集的创建动机是为了解决患者难以理解医学文本的问题,通过简化文本帮助患者更好地理解其医疗记录。数据集的创建过程包括预处理原始文本、人工简化文本以及使用ChatGPT生成简化文本。数据集的使用建议包括不应在没有医疗专业人员监督的情况下用于患者治疗,且不应用于商业用途。

提供机构:
liliya-makhmutova
原始信息汇总

数据集卡片:医学文本简化

数据集描述

基本信息

  • 任务类别: 文本生成
  • 语言: 英语
  • 标签: 医学, 简化
  • 名称: 医学文本简化
  • 大小类别: n<1K
  • 许可证: CC-BY-NC-4.0

数据集结构

  • file_number (int): 原始数据集中的文件名(数字)
  • line_number (int): 原始数据集中的句子编号
  • original (str): 原始文本的句子(预处理后)
  • human_simplification (str): 人工简化的文本句子
  • chatgpt_simplification (str): ChatGPT简化的文本句子
  • images (list[str]): 与句子相关的图像文件名列表,有助于理解医学文本

数据集详情

  • 数据集组成: 包含30个三元组(约800个句子),包括原始文本、人工和ChatGPT简化的文本。
  • 原始数据集来源: 医学笔记分类数据集,包含来自五个临床领域的医学笔记:胃肠病学、神经学、骨科、放射学和泌尿学,共1239个文本。

数据集创建

  • 创建动机: 医学文本对患者来说难以理解,可能导致健康问题。患者通常无法访问或理解其医疗记录,导致患者在康复过程中的部分排除和次优结果。医学文本通常包含大量专业术语、缩写、缺乏协调和解释,使得理解因果关系变得困难。
  • 数据收集和处理: 原始文本经过预处理,包括去除HTML标签、修正小错误、按句子分割并编号。简化文本由非英语母语者手动创建,使用开放资源如医学论文、手术视频和简化解释的医学文章。ChatGPT简化文本通过OpenAI聊天接口生成,使用提示“请简化文本以便非专业人士理解”。

使用建议

  • 使用限制: 不应在无医学专业人员监督的情况下用于任何形式的病人治疗。
  • 商业用途限制: 数据集不可用于商业用途。
  • 模型训练风险: 如果模型用于简化任务,可能产生幻觉。

ChatGPT输出分析

  • 优点:
    1. 能够根据上下文披露缩写。
    2. 具有良好的重写能力,包括理解和简化医学术语。
  • 缺点:
    1. 在长文本上倾向于生成摘要而非简化。
    2. 有时会编造事实,这在医学领域非常危险。
    3. 缺乏常识推理或医学“知识”。
    4. 可能遗漏重要事实或过度简化。
    5. 倾向于以任何方式重写文本,有时会改变原意。
    6. 有时使用不恰当的词汇,频繁输出简化不足的内容。

引用

@conference{ healthinf24, author={Liliya Makhmutova and Giancarlo Salton and Fernando Perez-Tellez and Robert Ross}, title={Automated Medical Text Simplification for Enhanced Patient Access}, booktitle={Proceedings of the 17th International Joint Conference on Biomedical Engineering Systems and Technologies - Volume 2: HEALTHINF}, year={2024}, pages={208-218}, publisher={SciTePress}, organization={INSTICC}, doi={10.5220/0012466100003657}, isbn={978-989-758-688-0}, }

搜集汇总
数据集介绍
liliya-makhmutova/medical_texts_simplification 数据集图片
构建方式
在医疗信息可及性日益受到重视的背景下,该数据集旨在弥合专业医学文本与普通患者之间的理解鸿沟。其构建基于Medical Notes Classification数据集,从中精选出涵盖消化内科、神经内科、骨科、放射科及泌尿外科五个临床领域的30篇原始医学笔记,经分句处理后形成约800个句子的语料库。每一条目均包含原始文本、由非医学背景的非母语者依据信息保真、流畅性与简洁性原则人工撰写的简化版本,以及通过OpenAI ChatGPT接口以“请为非专业人士简化文本”提示生成的自动简化版本。为应对长文本的摘要化倾向,长文本被拆分为多部分依次输入。部分句子还辅以图像说明以增强理解。
使用方法
该数据集适用于文本生成任务的微调与评估,尤其聚焦于医学领域的可读性提升。用户可直接加载texts.csv文件,利用'original'列作为输入,'human_simplification'或'chatgpt_simplification'作为目标标签训练简化模型。需注意,ChatGPT简化列存在潜在幻觉风险,建议在医疗应用中辅以人工审核。数据集按CC-BY-NC-4.0许可发布,禁止商业用途。训练或推理时应避免将模型输出直接用于患者诊疗决策,而应作为辅助工具提升医患沟通效率。推荐结合GitHub仓库中的错误分析示例,对模型输出进行系统性偏差检测。
背景与挑战
背景概述
在医疗健康领域,医患之间因专业术语鸿沟导致的信息不对称已成为影响诊疗效果与患者依从性的关键障碍。医疗文本常充斥着晦涩的缩写、断裂的句法及缺乏因果解释的陈述,不仅使患者难以理解自身病情,甚至阻碍其积极参与康复过程。为弥合这一认知差距,Liliya Makhmutova、Giancarlo Salton、Fernando Perez-Tellez与Robert Ross等研究人员于2024年创建了Medical Texts Simplification数据集,该工作受爱尔兰科学基金会及ADAPT研究中心资助。数据集基于Medical Notes Classification语料,精选涵盖胃肠病学、神经学等五个临床领域的30组文本(约800个句子),构建了原始文本、人工简化版本与ChatGPT简化版本的三元组结构,旨在为自动化医疗文本简化模型提供基准资源,推动信息民主化与健康结局改善。
当前挑战
该数据集所面临的挑战体现在领域问题与构建过程两个层面。在领域问题上,医疗文本简化需在保留原始信息完整性的前提下实现术语通俗化与句法流畅化,避免因过度简化导致关键事实遗漏或产生幻觉性内容,这对模型在敏感医学场景中的可靠性提出了严苛要求。构建过程中,人工简化由非医学背景的英语非母语者借助开放性医学资源完成,虽遵循保真度、流畅性与简洁性原则,但缺乏专业医师审核可能引入潜在偏差;而ChatGPT生成的简化版本则暴露出对长文本易产生摘要化倾向、虚构事实、常识推理不足及过度改写原意等缺陷,这些局限性凸显了在医疗领域构建高保真简化数据集的复杂性与风险管控的重要性。
常用场景
经典使用场景
在自然语言处理与医学信息学交叉领域,该数据集被广泛用于训练和评估文本简化模型,旨在将复杂的医学记录转化为患者易于理解的平实语言。其经典使用场景包括监督学习下的句子级简化任务,研究者可利用原始文本与人工简化版本之间的对应关系,构建序列到序列模型,提升模型在保留医学核心信息的同时降低语言复杂度的能力。数据集还特别引入了ChatGPT生成的简化版本,为对比不同简化策略的效果提供了基准。
解决学术问题
该数据集直面医学文本可读性不足导致的患者健康信息鸿沟问题,系统性地缓解了因专业术语、缩写及非规范句法结构造成的理解障碍。它解决了学术研究中缺乏高质量、多粒度简化对齐数据的困境,使得研究者能够量化评估简化模型的忠实度、流畅性与简洁性之间的权衡。通过提供人工与自动简化双视角,该数据集推动了面向低资源领域(如医学)的文本简化方法创新,并促进了对生成模型在敏感场景下幻觉与信息丢失风险的深入分析。
实际应用
在实际应用中,该数据集支撑了面向患者的智能病历解读系统的开发,帮助非医学背景的用户快速掌握关键诊断信息与治疗建议。它可被集成至电子健康记录平台,自动生成通俗易懂的出院小结或检查报告摘要,从而提升医患沟通效率并减少因误解导致的医疗差错。此外,该数据集还可用于训练医疗聊天机器人,使其能够以平实的语言解答患者的常见疑问,并辅助跨科室的医护人员快速理解专科记录,促进临床协作。
数据集最近研究
最新研究方向
在医疗文本可读性提升的前沿研究中,数据集liliya-makhmutova/medical_texts_simplification聚焦于利用自然语言生成技术简化专业医疗记录,以弥合医患之间的认知鸿沟。该数据集基于临床笔记分类语料,涵盖胃肠病学、神经学等五个领域,通过人工与ChatGPT双重简化策略构建了高质量对照样本。当前热点方向集中于评估大语言模型在医学领域的简化能力与潜在风险,研究发现ChatGPT虽能有效解释术语并重构句式,但存在事实幻觉、过度概括及关键信息遗漏等缺陷,凸显了在敏感医疗场景中部署生成模型需谨慎平衡可理解性与信息保真度。这一工作对推动患者赋权、实现医疗信息民主化具有里程碑意义,同时为构建安全可靠的临床辅助系统提供了关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务