遇见数据集

cyrille-elie/CHSA-Triage-Medic-Full-Dataset

收藏
Hugging Face2025-12-15 更新2025-12-20 收录
官方服务:

资源简介:

该数据集是在AI工程师项目(CHSA项目)框架下构建的,旨在训练一个能够进行紧急分诊和提供临床推理的智能医疗助手。数据集分为三个不同的子集,对应于不同的训练阶段(监督微调和对齐)。 1. **sft_medical_dataset**:包含一般医学知识和临床案例(法语/英语),平衡为50%法语和50%英语,已通过Microsoft Presidio进行匿名化处理。 2. **sft_expert_dataset**:包含高质量的合成数据,专门用于紧急分诊教学,使用医学同义词数据增强技术以避免过拟合。 3. **dpo_dataset**:用于直接偏好优化(DPO)阶段,使模型学会偏好详细、结构化和临床准确的回答。

This dataset was created as part of an **AI Engineer** project (CHSA Project). It is designed to train an Intelligent Medical Assistant capable of performing **emergency triage** and providing clinical reasoning. The dataset is divided into **3 distinct subsets** corresponding to different training phases (Supervised Fine-Tuning and Alignment). 1. **`sft_medical_dataset`**: General medical knowledge and clinical cases (FR/EN), balanced at 50% French and 50% English, anonymized via Microsoft Presidio. 2. **`sft_expert_dataset`**: Synthetic data specialized in emergency triage (FR), using medical synonym data augmentation techniques to avoid overfitting. 3. **`dpo_dataset`**: Preference pairs for alignment (Direct Preference Optimization), favoring detailed, structured, and clinically accurate responses.

提供机构:
cyrille-elie
搜集汇总
数据集介绍
构建方式
该数据集专为训练具备急诊分诊能力的智能医疗助手而构建,其设计紧密围绕模型训练的两大核心阶段——监督微调与偏好对齐。数据集由三个精心划分的子集组成:sft_medical_dataset融合了来自FrenchMedMCQA、MediQAl和MedQuAD等权威来源的学术与临床数据,涵盖法语与英语各半,并经由Microsoft Presidio完成匿名化处理;sft_expert_dataset则基于急诊分诊专家模板,通过同义词增强技术生成高质量合成数据,强制采用思维链结构以教授分诊逻辑;dpo_dataset源自UltraMedical-Preference,经筛选与适配后形成偏好对,用于引导模型学习结构化且临床精准的应答。
特点
该数据集的核心特色在于其多层次、多阶段的设计理念。sft_medical_dataset提供了均衡的双语医学知识基础,覆盖广泛临床场景;sft_expert_dataset专注于法国急诊分诊标准(CHSA),通过强制性的分析-裁决思维链结构,确保模型输出具有条理清晰的临床推理过程;dpo_dataset则通过精心构建的偏好对,使模型能够区分并偏好详细、精准的医学回答,从而抑制模糊或幻觉性输出。整体而言,数据集在规模上介于一万至十万条之间,兼具通用医学知识与专科分诊技能,为医疗自然语言处理任务提供了高质量的监督信号与对齐基准。
使用方法
借助Hugging Face的datasets库,用户可以便捷地加载该数据集的各个子集以适配不同训练阶段。通过指定配置名称,例如使用load_dataset函数加载'sft_medical_dataset'以获取包含训练与验证分片的一般医学数据,或加载'sft_expert_dataset'以获取纯分诊逻辑的合成数据,亦或加载'dpo_dataset'以获取用于偏好优化的选择-拒绝对。每个子集均以标准化的列结构存储,如指令-回答对或提示-选择-拒绝三元组,便于直接接入监督微调、直接偏好优化等训练流程,从而高效构建具备急诊分诊能力的智能医疗模型。
背景与挑战
背景概述
CHSA-Triage-Medic-Full-Dataset是由AI工程师培训项目团队于近期构建的多语言医学数据集,专注于急诊分诊与临床推理任务。该数据集由Cyrille Elie等人主导开发,旨在训练具备紧急分诊能力的智能医疗助手。其核心研究问题围绕如何通过监督微调与偏好对齐,使语言模型掌握基于症状与生命体征的急诊严重程度分级逻辑。数据集整合了FrenchMedMCQA、MediQAl等公开医学资源,并引入专家模板生成的高质量合成数据,覆盖法语与英语双语场景。凭借结构化的Chain-of-Thought推理范式与DPO对齐策略,该数据集为临床自然语言处理领域提供了从知识注入到决策优化的完整训练范式,对推动低资源语言下的急诊AI应用具有显著示范意义。
当前挑战
该数据集面临的核心挑战首先在于急诊分诊领域本身的复杂性:症状描述的高度变异性与生命体征的临界值判定需要模型具备严谨的临床逻辑,而非简单的模式匹配。构建过程中,数据来源的异质性带来了显著困难——公开医学问答集(如MedQuAD)需经匿名化处理并统一格式,而合成数据的生成需避免过拟合,依赖医学同义词增强技术平衡多样性与真实性。此外,偏好对齐阶段(DPO)要求区分细微的临床正确性差异,例如区分详尽结构与模糊回答,这对标注质量与过滤策略提出了严苛要求。多语言混合(法英各占50%)进一步加剧了术语对齐与跨文化诊断逻辑的适配挑战。
常用场景
经典使用场景
CHSA-Triage-Medic-Full-Dataset最经典的使用场景在于训练面向急诊分诊的智能医疗助手。该数据集融合了来自FrenchMedMCQA、MediQAl和MedQuAD等权威来源的临床知识与病例,并特别设计了包含链式思维推理结构的专家级分诊数据,使模型能够模拟医护人员对患者症状与生命体征进行系统性分析,从而精准判定紧急程度。通过监督微调与直接偏好优化两阶段训练,该数据集为构建具备临床推理能力的对话式分诊系统提供了坚实的基础。
实际应用
在实际应用中,该数据集驱动的模型可部署于医院急诊科、基层诊所及远程医疗平台,作为辅助分诊工具。系统接收患者主诉与关键体征后,能快速生成结构化分析报告,并给出紧急程度建议(如最高、中等或暂缓),帮助医护人员优化资源调配与接诊顺序。此外,该模型还可嵌入健康咨询类应用,为公众提供初步的病情评估指引,缓解急诊拥堵压力,提升医疗系统的响应效率与服务质量。
衍生相关工作
围绕该数据集已衍生出多项经典工作,包括基于链式思维蒸馏的轻量化分诊模型研究,以及利用DPO偏好对提升模型在罕见症状场景下的鲁棒性探索。研究者进一步将其与多模态数据结合,尝试融合影像与文本信息以增强分诊准确性。此外,该数据集催生了针对法语医疗场景的大模型评估基准,推动了跨语言临床推理能力的比较研究。这些工作共同丰富了医疗AI在急诊决策支持领域的技术谱系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务