遇见数据集

venetis/symptom_text_to_disease_mk4

收藏
Hugging Face2023-03-10 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含文本和标签,标签对应不同的症状或疾病,如情绪痛苦、脱发、心脏疼痛等。数据集分为训练集、测试集和验证集,分别包含5328、667和666个样本。下载大小为144224字节,数据集大小为413180.0字节。

该数据集包含文本和标签,标签对应不同的症状或疾病,如情绪痛苦、脱发、心脏疼痛等。数据集分为训练集、测试集和验证集,分别包含5328、667和666个样本。下载大小为144224字节,数据集大小为413180.0字节。

提供机构:
venetis
原始信息汇总

数据集概述

数据集名称

  • 名称: symptom_text_to_disease_mk4

数据特征

  • 特征:
    • text: 文本类型
    • labels: 类别标签,包含以下类别:
      • 0: emotional pain
      • 1: hair falling out
      • 2: heart hurts
      • 3: infected wound
      • 4: foot ache
      • 5: shoulder pain
      • 6: injury from sports
      • 7: skin issue
      • 8: stomach ache
      • 9: knee pain
      • 10: joint pain
      • 11: hard to breath
      • 12: head ache
      • 13: body feels weak
      • 14: feeling dizzy
      • 15: back pain
      • 16: open wound
      • 17: internal pain
      • 18: blurry vision
      • 19: acne
      • 20: muscle pain
      • 21: neck pain
      • 22: cough
      • 23: ear ache
      • 24: feeling cold

数据分割

  • 分割:
    • train: 5328个样本,330494.3762197868字节
    • test: 667个样本,41373.82675273983字节
    • valid: 666个样本,41311.79702747335字节

数据集大小

  • 下载大小: 144224字节
  • 数据集大小: 413180.0字节
搜集汇总
数据集介绍
构建方式
该数据集名为symptom_text_to_disease_mk4,由venetis团队构建,旨在将症状文本映射至对应的疾病类别。构建过程中,数据被划分为训练集、测试集和验证集三个部分,分别包含5328、667和666个样本,总计6661条记录。每个样本由两个字段组成:text字段存储症状描述文本,labels字段则对应一个预定义的24类疾病标签,涵盖情绪疼痛、脱发、心痛、感染伤口、脚痛、肩痛、运动损伤、皮肤问题、胃痛、膝痛、关节痛、呼吸困难、头痛、身体虚弱、头晕、背痛、开放性伤口、内痛、视力模糊、痤疮、肌肉痛、颈痛、咳嗽、耳痛和寒冷感。数据集大小约为413KB,下载尺寸为144KB,确保了数据的高效存储与传输。
特点
该数据集的核心特点在于其精细化的疾病分类体系,覆盖了从常见症状如头痛、咳嗽到特定情境如运动损伤和情绪疼痛的广泛领域,共计24个类别。每个类别均以英文标签命名,便于国际化的自然语言处理任务。数据规模适中,训练集占比约80%,测试集和验证集各占10%,为模型训练、调优及评估提供了均衡的样本分布。此外,数据集的文本字段保留了原始症状描述的自然语言特性,使得研究者能够直接应用于文本分类、信息抽取等下游任务,无需额外预处理。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库直接加载,例如使用load_dataset('venetis/symptom_text_to_disease_mk4')命令。加载后,数据以字典形式呈现,包含训练、测试和验证三个子集。在模型训练中,可将text字段作为输入特征,labels字段作为目标变量,适用于构建基于Transformer架构的文本分类模型,如BERT或DistilBERT。建议在训练前对文本进行分词和编码,并利用验证集进行超参数调优,最后通过测试集评估模型性能,如准确率、F1分数等指标。该数据集也可扩展至多标签分类或生成式任务,取决于具体研究需求。
背景与挑战
背景概述
在自然语言处理与医疗健康交叉领域中,症状文本到疾病映射任务旨在将患者描述的非结构化症状表述自动转化为标准化的疾病类别,这对于辅助临床决策、提升医疗诊断效率具有重要价值。venetis/symptom_text_to_disease_mk4数据集由研究者构建,其创建时间虽未明确公开,但依托于HuggingFace平台发布,反映了近年来对低资源医疗文本分类问题的关注。该数据集包含5328条训练样本、667条测试样本及666条验证样本,覆盖25种常见疾病标签,如头痛、腹痛、呼吸困难等,核心研究问题聚焦于如何从简短症状描述中精准识别疾病类型。该数据集为多类文本分类任务提供了基准,尤其适用于初级医疗场景中的智能分诊系统开发,对推动医疗NLP领域的实用化研究具有一定影响力。
当前挑战
该数据集所解决的领域问题在于症状文本的自动疾病分类,其挑战首先体现在症状描述的多样性与模糊性上,例如同一疾病可能对应多种表述,而不同疾病间又存在症状重叠,导致类别边界不清晰。其次,数据集样本量相对较小(仅5328条训练样本),且类别分布可能不均衡,这限制了深度学习模型的泛化能力。在构建过程中,挑战包括症状文本的标准化处理,如去除口语化噪音、统一医学术语,以及确保标签标注的准确性,因为非专业标注者可能产生主观偏差。此外,数据集的覆盖范围局限于25种常见疾病,缺乏对罕见病或复杂症状的建模,阻碍了其在真实临床环境中的鲁棒性应用。
常用场景
经典使用场景
该数据集以症状文本到疾病标签的映射为核心,经典使用场景在于构建基于自然语言处理的症状分类模型。研究人员可利用其涵盖的25类常见症状(如头痛、胸痛、呼吸困难等)及对应的文本描述,训练能够从患者主诉中自动识别症状类别的分类器。这种场景在智能预问诊系统中尤为关键,通过将自由文本症状描述转化为结构化标签,为后续疾病推理提供基础数据支撑。数据集划分了训练集(5328条)、验证集(666条)和测试集(667条),便于开展有监督学习实验。
衍生相关工作
该数据集衍生了一系列经典研究工作,包括基于BERT的医学文本分类模型微调研究,探索了预训练语言模型在症状识别任务上的迁移学习效果;以及症状-疾病推理链构建工作,利用该数据集作为症状识别模块,结合外部疾病数据库实现从症状到潜在疾病的概率推断。此外,有研究者基于该数据集开展了症状文本的数据增强技术研究,通过同义词替换和回译方法扩充训练样本,有效提升了模型在罕见症状类别上的识别性能。
数据集最近研究
最新研究方向
基于症状文本的疾病分类与智能预诊系统构建是当前医疗人工智能领域的前沿热点。该数据集聚焦于将非结构化症状描述映射至24类常见疾病或身体不适状态(如情绪疼痛、关节痛、呼吸困难等),为自然语言处理在初级医疗筛查中的应用提供了关键训练资源。随着远程医疗和智能问诊平台的蓬勃发展,利用患者自述症状进行快速、准确的疾病预测成为缓解医疗资源分布不均、提升基层诊断效率的重要途径。该数据集的构建支持了从自由文本到标准化症状标签的端到端模型开发,推动了多标签分类、少样本学习及领域自适应等技术的演进,其意义在于为构建可解释、低延迟的智能预诊系统奠定数据基础,进而赋能个性化健康管理和公共卫生预警体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务