ChatDoctor
收藏资源简介:
ChatDoctor数据集的发布主要旨在解决现有大型语言模型在医学知识领域的局限性。该数据集包含了11.5万条英文对话样本,其中包括从网站上获取的真实患者与医生之间的对话,以及模型生成的对话和疾病数据库信息。通过使用该数据集进行微调,模型在理解患者需求和提供建议方面的能力得到了显著提升。
The release of the ChatDoctor dataset primarily aims to address the limitations of existing large language models in the medical knowledge domain. The dataset contains 115,000 English conversation samples, including real dialogues between patients and doctors obtained from websites, as well as generated dialogues and disease database information. By fine-tuning models with this dataset, their ability to understand patient needs and provide recommendations has been significantly enhanced.
ChatDoctor 数据集概述
数据集基本信息
- 名称: ChatDoctor
- 类型: 医疗对话数据集
- 开发者: Yunxiang Li, Zihan Li, Kai Zhang, Ruilong Dan, Steve Jiang, You Zhang
- 机构:
- UT Southwestern Medical Center, USA
- University of Illinois at Urbana-Champaign, USA
- Ohio State University, USA
- Hangzhou Dianzi University, China
- 许可证: Apache 2.0
- 编程语言: Python 3.9+
- 相关论文: ChatDoctor: A Medical Chat Model Fine-Tuned on a Large Language Model Meta-AI (LLaMA) Using Medical Domain Knowledge
数据集内容
1. 医疗对话数据
- HealthCareMagic-100k: 来自HealthCareMagic.com的10万条真实医患对话。
- 下载链接: HealthCareMagic-100k
- icliniq-10k: 来自icliniq.com的1万条真实医患对话。
- 下载链接: icliniq-10k
- GenMedGPT-5k: 由ChatGPT生成的5千条医患对话。
- 下载链接: GenMedGPT-5k
- 疾病数据库: format_dataset.csv
- 基础对话能力数据: Stanford Alpaca数据。
- 下载链接: Alpaca link
2. 模型权重
- 下载链接: ChatDoctor Checkpoints
数据集特点
- 数据来源: 真实医患对话和生成对话相结合。
- 数据处理: 手动和自动过滤,去除身份信息,纠正语法错误。
- 多样性: 包含多种疾病和症状的描述,提高模型的泛化能力。
应用场景
- 医疗问答: 患者可以通过ChatDoctor模型获取医疗建议。
- 学术研究: 用于医疗对话生成和自然语言处理研究。
使用限制
- 禁止商业用途: 由于基于LLaMA的非商业许可证,禁止任何商业用途。
- 禁止临床用途: 模型未获得医疗相关许可,不保证医疗诊断的完全正确性。
相关资源
参考文献
bibtex @article{li2023chatdoctor, title={ChatDoctor: A Medical Chat Model Fine-Tuned on a Large Language Model Meta-AI (LLaMA) Using Medical Domain Knowledge}, author={Li, Yunxiang and Li, Zihan and Zhang, Kai and Dan, Ruilong and Jiang, Steve and Zhang, You}, journal={Cureus}, volume={15}, number={6}, year={2023}, publisher={Cureus} }




