遇见数据集

psiddx-clinical-ddx

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

PsiDDx是一个经过脱敏和校准的临床鉴别诊断训练数据集(v5.2版本),专门为Adaption Labs AutoScientist Challenge(医疗保健赛道)开发。该数据集包含5,482条记录,每条记录将一个患者临床表现与一个排名前五的鉴别诊断列表配对。每个诊断包含ICD-10代码、校准后的置信度以及鉴别特征。数据集采用常见诊断优先的排序原则,罕见诊断仅在存在鉴别特征时排名较高,否则作为“不可遗漏”的低置信度条目保留。数据结构包括两个字段:presentation(患者临床表现描述)和ranked_ddx(排名鉴别诊断列表)。数据构成方面:约42%来自广泛临床来源(如DDXPlus、MedQA-USMLE等),33%为校准合成的罕见病例生成数据,26%为精神科病例(包含特征翻转的鉴别对)。数据集经过精心设计,具有校准平滑的置信度、去重处理、纯英文内容、原子化单标签等特点,不包含受保护的健康信息。适用于自动鉴别诊断的研究和教育用途,但明确声明非医疗设备、非医疗建议、不用于临床。许可为CC-BY-4.0,但各组件来源保留其原始许可。

PsiDDx is a de-identified and calibrated clinical differential diagnosis training dataset (version 5.2), specifically developed for the Adaption Labs AutoScientist Challenge (Healthcare Track). The dataset contains 5,482 records, each pairing a patients clinical presentation with a ranked list of top five differential diagnoses. Each diagnosis includes an ICD-10 code, a calibrated confidence score, and distinguishing features. The dataset follows a common-diagnosis-first ranking principle, where rare diagnoses are ranked higher only when distinguishing features are present; otherwise, they are retained as cannot-miss low-confidence entries. The data structure comprises two fields: presentation (description of the patients clinical presentation) and ranked_ddx (ranked list of differential diagnoses). In terms of data composition: approximately 42% is sourced from broad clinical sources (e.g., DDXPlus, MedQA-USMLE), 33% is calibrated synthetic data for rare cases, and 26% is psychiatric cases (including differential pairs with feature flipping). The dataset is meticulously designed with features such as calibrated smooth confidence, deduplication, English-only content, atomic single labels, and no protected health information. It is suitable for research and educational purposes in automated differential diagnosis but is explicitly stated not to be a medical device, not to provide medical advice, and not for clinical use. The license is CC-BY-4.0, but component sources retain their original licenses.

创建时间:
2026-06-23
原始信息汇总

数据集概览:PsiDDx Clinical Differential-Diagnosis Dataset (v5.2)

  • 标题:PsiDDx Clinical Differential-Diagnosis Dataset (v5.2),经过去污染处理。
  • 许可证:CC-BY-4.0。
  • 任务类别:文本生成、问答。
  • 语言:英语。
  • 标签:医学、临床、鉴别诊断、精神病学、ICD-10。
  • 数据规模:1,000至10,000行(实际为5,482行)。
  • 用途:用于训练鉴别诊断模型,如 shariqazeem/psiddx-clinical-ddx-gemma-3-4b

数据集结构与组成

数据模式

每条记录包含两个字段:

  • presentation:患者的临床表现描述(例如:“A 27-year-old male patient. Clinical findings: ...”)。
  • ranked_ddx:前五位的鉴别诊断列表,按常见程度排序,每个诊断包含 ICD-10 编码、校准后的置信度及鉴别特征(例如:“1. Scombroid food poisoning [ICD-10: T61.1] (confidence: 0.177)”)。

数据组成(5,482行)

分组 占比 来源
广泛临床 ~42% DDXPlus(排序鉴别诊断 + 真实ICD-10)、MedQA-USMLE、MedMCQA、PubMedQA
罕见病 ~33% 校准后的合成生成器(常见优先的罕见/常见病对)+ RareBench(真实HPO → OMIM/Orphanet)
精神病学 ~26% 匹配鉴别器生成器(相同临床表现,单一特征改变诊断)+ MentalBench(DSM-5)

数据集的独特之处

  • 去污染:v5.2版本移除了约43%来自多选题来源的污染数据(这些数据将题目答案误标为诊断),并进行了重建、校准、去重。
  • 校准的置信度:置信度经过平滑校准,而非人为构造,罕见诊断仅在存在鉴别特征时排名靠前,否则保持低置信度作为“不可遗漏”项。
  • 细心设计:常见诊断优先排序;罕见诊断不会过度强调(反“斑马”倾向);无合成事实注入;仅含英文,已去重,且每条记录只有一个 top-1 诊断标签。

预期用途与限制

  • 预期用途:用于自动化鉴别诊断的研究与教育。
  • 限制
    • 非医疗设备,不提供医疗建议,不可用于临床。
    • 仅支持英语;合成病例遵循教科书式鉴别模式,不反映按患病率加权的流行病学特征。
  • 包含的源数据集许可证:DDXPlus(CC-BY)、MentalBench(CC-BY-4.0)、MedQA/MedMCQA(CC-BY/Apache-2.0)、PubMedQA(MIT)、RareBench(Apache-2.0)。RareArena(CC-BY-NC-SA)仅用于保留评估,未包含在内。
  • 不含受保护的健康信息
搜集汇总
数据集介绍
psiddx-clinical-ddx 数据集图片
构建方式
在医疗人工智能领域,准确的鉴别诊断是临床决策支持的核心挑战之一。Psiddx-clinical-ddx数据集正是为应对这一挑战而精心构建的。该数据集包含5,482条记录,每一条均由患者临床表现与一个经过校准的、按常见度排序的前五鉴别诊断列表配对而成。其构建过程经历了严格的去污染处理:从约43%曾被医疗选择题答案污染的原始数据中清洗后,通过校准合成生成器与真实罕见病知识库相结合的方式,重建了常见病先行的鉴别诊断顺序,并平滑了人工置信度阶梯,最终形成了由通用临床、罕见病及精神科三大类组成的纯净语料库。
特点
此数据集的核心特点在于其审慎的校准机制与反常见陷阱设计。每一条鉴别诊断都附带了基于真实证据平滑处理的置信度评分,且严格遵循常见病因优先的排序原则。对于罕见疾病,仅当存在特征性鉴别特征时才赋予高置信度排名,否则仅作为低置信度的“不可遗漏”条目保留,有效规避了过度强调罕见病的倾向。此外,数据集通过去重、纯英文化处理以及单标签原子化拆分,进一步保障了训练数据的质量与纯净度。
使用方法
Psiddx-clinical-ddx数据集主要面向自动化鉴别诊断模型的训练与医疗教育研究领域。使用时,可直接将每行的患者临床表现作为模型输入,将前五鉴别诊断列表作为目标输出,适用于文本生成与问答任务。科研人员亦可基于其公开的CC-BY-4.0许可协议,结合DDXPlus、MentalBench等组件来源进行二次开发。需特别注意的是,该数据集仅适用于研究目的,不可作为医疗设备或临床诊断依据,其合成病例遵循教科书式的鉴别模式,并非基于真实患病率流行病学数据。
背景与挑战
背景概述
在临床决策支持系统中,鉴别诊断(Differential Diagnosis)是连接患者临床表现与最终确诊的关键桥梁,然而现有数据集常因标签污染、置信度失真或罕见病过度诊断等问题,难以胜任真实医疗场景的训练需求。PsiDDx临床鉴别诊断数据集(v5.2,去污染版)由Adaption Labs于2026年发布,旨在为人工智能驱动的自动鉴别诊断挑战提供高质量、校准化的训练语料。该数据集由5,482条精心构建的案例组成,每条记录包含患者主诉与按常见性排序的前五位鉴别诊断,并附有ICD-10编码、校准置信度及区分性特征。通过融合DDXPlus、MedQA-USMLE、MedMCQA、PubMedQA等公开医学题库及罕见病知识库,该数据集覆盖了广泛临床、罕见病及精神科三大领域,为提升模型在真实诊断中的可靠性奠定了坚实基础。
当前挑战
鉴别诊断研究面临的首要挑战是解决领域核心问题:临床决策中常见病与罕见病之间的概率平衡。多数模型倾向于过度预测罕见病(“斑马效应”),而PsiDDx通过校准置信度与常见病优先排序,确保罕见诊断仅在具有明确区分特征时才被高置信度列出,否则作为“不可遗漏”的低置信度条目保留,从而减少误判风险。在构建过程中,团队遭遇了严重的数据污染问题:早期版本中约43%的样本来自医学选择题,其答案(药物、病原体或实验室数值)被错误标记为诊断,导致模型性能下降。为此,研究者实施了去污染、去重、平滑人工置信度阶梯、拆分捆绑标签及剔除噪声英文文本等系统性清理,最终形成了这一干净、校准化的高质量语料库。
常用场景
经典使用场景
PsiDDx临床鉴别诊断数据集(Psychiatry & Clinical Differential-Diagnosis Dataset)在自然语言处理与医学人工智能交叉领域中,最经典的使用场景是用于训练和评估自动鉴别诊断模型。该数据集将患者临床表现(presentation)与结构化、按置信度排序的前五位鉴别诊断结果(ranked top-5 differential)进行配对,每个诊断条目均附带ICD-10编码、校准后的置信度分数以及关键鉴别特征。研究者通常利用该数据集微调大规模语言模型,生成从患者主诉到可能病因的逻辑推理链,从而模拟临床医生在复杂症状中逐步排除、锁定最可能诊断的认知过程。其独特的“常见病优先、罕见病不遗漏”校准设计,为模型提供了更贴近真实临床决策的监督信号,成为推动医学文本生成与临床问答能力迭代的重要基准资源。
解决学术问题
该数据集核心解决了自动鉴别诊断研究中长期存在的两大学术困境:一是训练语料中常见病与罕见病的分布失衡导致模型倾向过度诊断罕见病(即“斑马效应”),二是传统数据集中诊断置信度与排序逻辑的人为捏造问题。PsiDDx通过校准的置信度平滑策略和常见病优先的排序规则,使模型学会在缺乏明确判别特征时将罕见诊断保留为低置信度但不可遗漏的候选,而非强行拔高其排名。这一设计有效抑制了模型对罕见病的过度强调,同时保留了临床安全所需的警惕性。该数据集的去污染版本(v5.2)通过识别并移除来自多项选择医学来源的污染样本(约43%),显著提升了训练数据的真实性与可靠性,为社区提供了更纯净的基准,推动了鉴别诊断模型评估范式从粗粒度分类向细粒度推理的演进。
衍生相关工作
PsiDDx数据集的推出催生了一系列相关研究工作。最直接的衍生工作是基于它微调而成的鉴别诊断语言模型shariqazeem/psiddx-clinical-ddx-gemma-3-4b,该模型在Gemma基础架构上利用5,482条去污染语料进行适配,展现了在保持广泛临床覆盖的同时抑制罕见病过度诊断的效果。另一重要方向是围绕该数据集构建的评估框架,研究者将PsiDDx与外部基准(如RareArena)结合,形成了更严格的模型鲁棒性测试协议。此外,该数据集的多源融合策略(整合自DDXPlus、MedQA-USMLE、MedMCQA、PubMedQA、MentalBench等)启发了后续工作探索如何系统地组合来自不同格式、不同知识来源的医学语料以构建更加全面的训练资源。其校准置信度设计也影响了后续研究对模型输出概率的重新校准技术探索,推动了对鉴别诊断任务中置信度估计与排序质量统一优化的学术关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务