krishnareddy/icddxdescmap
收藏资源简介:
该数据集旨在帮助将临床文档中记录的ICD10诊断描述映射到CMS(Centers for Medicare & Medicaid Services)的标准ICD10诊断描述。数据集包含AnnotationString、DXCode、ShortDesc和LongDesc四个主要列,用于训练模型将自由形式的疾病文本映射到ICD代码。模型训练的目标包括生成DX Code、ShortDesc和LongDesc三种输出。
This dataset is designed to facilitate the mapping of ICD-10 diagnostic descriptions recorded in clinical documents to the standard ICD-10 diagnostic descriptions established by CMS (Centers for Medicare & Medicaid Services). The dataset comprises four core columns: AnnotationString, DXCode, ShortDesc, and LongDesc, which are utilized for training models to map free-form disease-related text to ICD codes. The training objectives of the model include generating three types of outputs: DX Code, ShortDesc, and LongDesc.
ICD10 Diagnosis Description Mapping Dataset
概述
该数据集旨在帮助将临床文档中记录的ICD10诊断描述映射到CMS(医疗保险和医疗补助服务中心)的标准ICD10诊断描述。主要目标是训练一个能够将自由形式的疾病文本映射到ICD代码的模型。
数据集详情
数据集包含以下列:
- AnnotationString: 包含患者临床文档中的疾病文本。
- DXCode: 包含与AnnotationString列描述相对应的标准DX代码。
- ShortDesc: 包含与DXCode相对应的标准ICD描述的简短形式。
- LongDesc: 包含与DXCode相对应的标准ICD描述的详细形式。
模型训练目标
该数据集的目标是训练LLAMA2 7B模型,根据提供的AnnotationString输入生成以下输出之一:
情况1:期望DX代码作为输出
- 指令: 作为ICD代码助手,模型需要为相应的疾病描述生成一个ICD 10 DX代码。
- 输入:
<Annotation String> - 输出:
<DXCode>
情况2:期望ShortDesc作为输出
- 指令: 作为ICD代码助手,模型需要为相应的临床文本生成标准ICD 10 DX代码的简短描述。
- 输入:
<Annotation String> - 输出:
<ShortDesc>
情况3:期望LongDesc作为输出
- 指令: 作为ICD代码助手,模型需要为相应的临床文本生成标准ICD 10 DX代码的详细描述。
- 输入:
<Annotation String> - 输出:
<LongDesc>
使用方法
要有效地使用此数据集训练LLAMA2 7B模型,可以按照以下步骤操作:
- 预处理您的输入数据,以匹配所需情况(1、2或3)的“指令”中指定的格式。
- 使用预处理后的数据作为模型的输入。
- 模型将根据您指定的情况生成相应的输出(DXCode、ShortDesc或LongDesc)。
示例
以下是如何使用此数据集和模型的示例:
输入
python
指令: 作为ICD代码助手,您需要为以下疾病描述生成ICD 10 DX代码
输入: "Patient presents with persistent cough and fever."
输出(情况1)
python
输出: "J44.9"
输出(情况2)
python
输出: "Chronic obstructive pulmonary disease, unspecified"
输出(情况3)
python
输出: "Chronic obstructive pulmonary disease, unspecified"
警告: 潜在的映射错误
该数据集是从另一个基于规则的NLP应用程序中获取的,重要的是要注意临床文本到标准代码或标准描述的映射可能存在错误。尽管已尽一切努力确保准确性,但在处理复杂的医学术语和临床文档的变异性时,自动化映射过程存在固有的挑战。
用户在使用生成的结果时应谨慎,并考虑以下因素:
- 临床变异: 临床文档的风格和术语可能存在显著差异,这可能导致映射不准确。
- 复杂病例: 某些医学状况或描述可能无法一对一地映射到标准代码或描述,从而导致潜在的不一致。
- 数据质量: 映射的准确性还取决于输入临床文本的质量和一致性。
- 持续改进: 正在努力提高映射的准确性,并鼓励用户提供反馈和报告任何不一致之处。
建议在关键的医疗保健应用中交叉验证此数据集生成的结果,其中准确性至关重要。
请负责任地使用此数据集,并与临床专业知识结合,以做出明智的决策。
如果您遇到任何问题或有改进建议,请联系数据集维护者。
感谢您的理解与合作。




