遇见数据集

ChatCoach

收藏
arXiv2024-02-08 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

ChatCoach数据集是由新加坡国立大学创建的,旨在通过模拟医疗咨询环境,帮助医学学习者提升沟通技巧。该数据集包含3500个对话,总计13666条语句,分为训练、验证和测试集。数据集的创建过程采用了多代理数据生成框架,利用外部资源如医疗对话数据库和医疗知识数据库来合成训练数据。ChatCoach数据集特别适用于评估大型语言模型在医疗沟通辅导任务中的有效性,旨在解决医疗专业人员沟通技能培训的需求。

The ChatCoach dataset was developed by the National University of Singapore to help medical learners enhance their communication skills by simulating medical consultation environments. It contains 3500 conversations totaling 13666 utterances, and is split into training, validation, and test subsets. The dataset was created using a multi-agent data generation framework, leveraging external resources such as medical dialogue databases and medical knowledge bases to synthesize training data. The ChatCoach dataset is particularly suitable for evaluating the effectiveness of Large Language Models (LLMs) in medical communication coaching tasks, and aims to address the demand for communication skill training among medical professionals.

提供机构:
新加坡国立大学
创建时间:
2024-02-08
搜集汇总
数据集介绍
ChatCoach 数据集图片
构建方式
鉴于医学沟通辅导领域公开数据的稀缺性,ChatCoach数据集采用了一种创新的多智能体数据生成框架进行构建。该框架集成了基于大型语言模型的患者、医生和教练三种智能体,通过调用外部医学知识库与真实医疗对话语料库,模拟出包含常见错误的医患对话场景。具体而言,医生智能体会刻意引入典型术语误用,而教练智能体则依据权威医学知识提供纠正性反馈与建设性指导。最终,经人工严格筛选与标注,从初始的500段对话中保留了291段高质量对话,形成了涵盖检测与修正任务的基准测试集。
特点
ChatCoach数据集具有鲜明的领域针对性与结构层次性。其核心亮点在于首次将大型语言模型的能力引入医学沟通辅导这一交叉领域,构建了包含检测与修正两大核心任务的评估体系。数据集不仅模拟了医生在术语使用上的常见错误,还涵盖了非语言性建议的生成场景,使得评估维度更为丰富。此外,通过人工精细标注与GPT-4一致性校验,确保了数据的高质量与可靠性,为衡量模型在医学沟通辅导中的语义理解、错误识别与精准修正能力提供了坚实的基准。
使用方法
ChatCoach数据集主要用于评估与提升大型语言模型在医学沟通辅导任务中的表现。研究者可采用提示工程方法(如指令提示、思维链提示)或基于指令微调的训练方法,在数据集的训练集上对开源模型(如Llama2)进行调优,并在人工标注的测试集上评估其检测与修正医学术语误用的能力。评估指标涵盖BLEU-2、ROUGE-L与BERTScore,分别从词汇精确度、结构连贯性与语义相似性三个维度衡量生成反馈的质量。该数据集为开发面向初级医师的智能沟通教练系统提供了标准化的训练与评测平台。
背景与挑战
背景概述
自然语言处理技术在医疗领域的应用长期聚焦于以患者为中心的服务,如医疗对话系统与临床决策支持,然而,针对医学从业者沟通技能培养的智能化工具仍属空白。为弥合这一鸿沟,新加坡国立大学与罗格斯大学的研究团队于2024年提出ChatCoach系统,开创性地将大型语言模型引入医学沟通辅导领域。该系统构建了一个人机协作框架,通过患者智能体模拟真实问诊场景,并由教练智能体对初诊医生的术语使用与沟通策略提供实时反馈。研究团队基于MedDialog真实医疗对话数据,结合疾病知识库,采用多智能体数据生成方法构建了包含3500段对话的基准数据集,旨在评估语言模型在医学沟通辅导中的检测与纠错能力,为医疗教育与人工智能的交叉研究树立了重要标杆。
当前挑战
ChatCoach面临的核心挑战源于医学沟通辅导领域的双重复杂性。在领域问题层面,传统对话系统多服务于患者,而针对医生沟通技能训练的场景化辅导任务缺乏先例,要求模型不仅要精准检测术语误用,还需生成上下文敏感的纠正建议,这对语义理解与知识推理能力构成严峻考验。在数据集构建层面,医疗数据的隐私属性与高昂标注成本导致公开数据匮乏,研究团队不得不设计多智能体协同生成框架,通过引入模拟医生错误与教练反馈机制来合成训练数据,但合成数据与真实临床场景间的偏差、教练反馈的开放性与可量化评估难题,以及标注者间一致性控制,均成为制约数据集质量与模型泛化能力的关键瓶颈。
常用场景
经典使用场景
在医疗教育与人工智能的交叉领域中,ChatCoach数据集为构建模拟医患沟通训练系统提供了核心支撑。该数据集基于真实医疗咨询语料,通过多智能体生成框架构建了包含患者、医生和教练角色的对话场景,专门用于训练和评估大语言模型在医学沟通辅导任务中的表现。其经典使用场景是作为基准测试平台,研究者可借此衡量模型在检测和纠正医学术语使用错误方面的能力,从而推动智能辅导系统的发展。
解决学术问题
该数据集解决了医疗NLP研究中长期存在的关键学术问题:缺乏面向初级医生沟通技能训练的标准化评估资源。传统研究多聚焦于患者服务,而忽视了医学生专业沟通能力的培养。ChatCoach首次提供了包含术语误用检测与纠正的双任务基准,填补了该领域的空白。其意义在于为量化评估大语言模型的医学辅导效能确立了客观标准,促进了教育、医疗与人工智能的深度融合,为后续研究奠定了方法论基础。
衍生相关工作
基于ChatCoach数据集,衍生了一系列开创性工作。一方面,研究者探索了指令微调与提示学习策略在医学辅导任务中的效能对比,证实了微调方法在术语误用检测上的显著优势。另一方面,该数据集启发了多智能体协作框架的优化研究,例如改进患者智能体的行为多样性以增强训练场景的真实性。此外,后续工作还拓展了评估维度,从术语纠错延伸至非语言性建议生成,推动了医学沟通辅导系统的全面进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务