遇见数据集

MedSP1000

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

MedSP1000是一个基于标准化患者(SP)的交互式临床代理评估基准,将同行评审的SP教学案例转化为可执行场景,包含患者脚本、临床环境上下文和人工验证的结构化评分标准。它包含1,638个交互式案例,涵盖17个临床专业,使用24,602个评分项进行评分,用于评估大型语言模型在动态临床决策中的表现。

MedSP1000 is an interactive clinical agent evaluation benchmark based on standardized patients (SP). It converts peer-reviewed SP teaching cases into executable scenarios, which include patient scripts, clinical environment contexts, and manually validated structured scoring rubrics. The benchmark contains 1,638 interactive cases covering 17 clinical specialties, utilizes 24,602 scoring items for assessment, and is designed to evaluate the performance of large language models in dynamic clinical decision-making.

创建时间:
2026-06-02
原始信息汇总

MedSP1000 数据集概述

MedSP1000是一个基于标准化病人(Standardized Patients, SP)的交互式临床决策基准数据集,用于动态评估大语言模型(LLMs)在多轮临床诊疗中的表现。

核心特点

  • SP驱动:基于同行评审的MedEdPORTAL教学材料构建,涵盖1,073篇源文章和22,244个附件。
  • 交互式多轮评估:采用闭环交互模式,临床医生代理、患者代理和环境控制器之间进行标准化状态转换的多轮对话。
  • 规模与覆盖面:包含1,638个交互式病例,覆盖17个临床专科,配有24,602个评分项
  • ACGME对齐评分:每项行为均依据6项ACGME核心能力(PC、MK、SBP、ICS、PBLI、PROF)的冻结评分表进行评分。
  • 人工验证:病例和诊疗轨迹由12名临床医生验证(每人独立双重评分)。

评估框架

数据集包含三个阶段:

  1. 数据处理:将异构的MedEdPORTAL材料转化为角色特定的场景包。
  2. 多代理评估循环:在多个临床状态下进行多轮评估。
  3. 评估代理评分:依据ACGME六大核心能力对完整诊疗轨迹进行评分。

主要结果

在静态基准测试中的表现不能可靠地转化为交互式临床护理中的表现。最佳通用模型(GPT-5.5)的总体评分表完成率为60.4%,而最强的医学专用模型仅为40.0%

数据获取

数据集托管在Hugging Face Hub:

  • https://huggingface.co/datasets/byrLLCC/MedSP1000

数据布局

每个场景包含各角色代理的材料文件夹,冻结评分表位于仓库的 rubrics/ 目录中:

data/MedSP1000/<case_id>/<scenarioN>/ examinee/ # 临床医生代理可见材料 sp_actor/ # 患者(标准化病人)脚本 environment_controller/ # 实验室/影像/环境状态 evaluator/ # 源评分材料 rubrics/<case_id>_<scenarioN>.json # 用于评分的冻结ACGME评分表

许可证

数据集采用 MIT License 许可。

搜集汇总
数据集介绍
MedSP1000 数据集图片
构建方式
医学教育领域长期依赖标准化病人(Standardized Patients, SP)进行临床技能评估,但大语言模型在动态诊疗决策中的交互能力尚缺乏系统性评测。MedSP1000数据集由此应运而生,其构建过程融合了权威学术资源与自动化数据处理技术。研究团队从MedEdPORTAL平台上筛选了1073篇经过同行评审的教学案例及22244份附件材料,通过一个由智能体驱动的数据流水线,将异构的原始文档转化为结构化的角色专属场景包。每个场景均包含供临床医师智能体使用的材料、标准化病人脚本、环境控制器信息以及评分源材料,并由12位临床专家独立双盲校验,确保场景质量与临床真实性。
特点
该数据集的核心特色在于其交互式、多轮次的评估范式,彻底突破了传统静态基准测试的局限。它涵盖了17个临床专科的1638个交互式案例,配备24602个基于美国毕业后医学教育认证委员会六项核心能力(患者护理、医学知识、系统实践、沟通技能、基于实践的学习、职业素养)的冻结评分条目。每个案例均设定了标准化的状态转换协议,由临床医师智能体与病人智能体、环境控制器在闭环中持续交互,其全轨迹行为均被记录并依据专家预定义标准进行自动评分。数据集还包含一个经过质量控制的100场景子集,便于快速验证。
使用方法
使用者可通过简洁的命令行流程快速部署该基准测试。首先需配置Python环境并安装依赖,随后设置OpenAI等大语言模型的API密钥。运行数据下载脚本即可自动获取所有场景材料并生成运行清单。主评估脚本支持指定被评估的临床医师模型与评判模型,并允许设置并发场景数以加速测试。每个场景运行后会自动生成包含按六项ACGME能力逐项评分的评估文件,且系统支持断点续跑。此外,数据集中还集成了测试时计算策略的可选参数,允许研究者探索不同推理增强手段对临床决策能力的提升效果。
背景与挑战
背景概述
大型语言模型(LLM)在临床决策支持领域的应用日益广泛,然而现有基准多局限于静态单轮评测,难以模拟医生在真实诊疗过程中动态收集信息、制定治疗方案及长期管理患者的能力。为弥补这一空白,上海交通大学与上海人工智能实验室的梁程、邱鹏程、张娅、王艳峰、吴朝毅、谢卫迪等研究团队于近年推出了MedSP1000数据集。该数据集基于MedEdPORTAL上逾千篇同行评审的标准化病人教学材料,构建了涵盖17个临床专科的1638个交互式病例,并配备由12名临床医生双重验证的评估标准。MedSP1000旨在全面评测LLM在多轮闭环诊疗中的表现,其面世为临床智能体的能力评估提供了前所未有的广度与深度,对推动语言模型在真实医疗场景中的应用具有里程碑意义。
当前挑战
MedSP1000数据集的核心挑战在于其交互式、多轮次的评估设计。首先,传统静态基准无法捕捉模型在动态诊疗中表现出的信息收集、治疗规划与适应性管理能力,而MedSP1000要求模型在闭环环境中与患者智能体及环境控制器持续互动,这对模型的理解、推理与决策能力提出了更高要求。其次,数据集构建过程面临技术挑战:需将异构的标准化病人教学材料转化为角色特定的场景脚本,并设计标准化的状态转移协议,确保评估的公平性与可复现性。此外,临床实践要求模型具备跨专科知识整合能力,而当前最优通用模型仅完成60.4%的专家定义评估项,医学专用模型更是低至40.0%,凸显了模型在复杂临床场景中表现出的显著瓶颈。
常用场景
经典使用场景
在动态临床决策评估领域,MedSP1000被设计为一个基于标准化病人(Standardized Patient)的交互式基准测试平台,专门用于评估大型语言模型在多轮临床对话中的表现。它通过将经过同行评审的标准化病人教学案例转化为可执行场景,包含患者脚本、临床环境上下文及专家验证的结构化评分表,使得模型需要作为临床医生代理,与患者代理和环境控制器进行闭环交互,从而衡量其在采集病史、制定诊疗计划及管理长期病程等连续临床环节中的综合能力。这一设计突破了传统静态单轮基准测试的局限,为临床智能体的动态评估提供了更贴近真实医疗实践的标准化框架。
衍生相关工作
基于MedSP1000的框架,学术界已衍生出一系列具有代表性的后续工作。一方面,研究者借鉴其多智能体闭环交互架构,将标准化病人评估范式拓展至其他临床亚专科领域,如急诊分诊、慢性病管理和精神卫生评估,构建了更具领域特异性的交互式基准。另一方面,该数据集的测试时计算策略分析(如MedAgents框架的适配)催生了对模型推理资源分配与临床决策质量之间关系的研究,推动了‘放缩计算而非放缩模型’这一思路在医疗AI场景中的探索。此外,MedSP1000对ACGME能力的细粒度评分体系也被广泛应用于临床执业考试自动化评分系统的设计,成为连接生成式AI与医学教育评估的重要桥梁。
数据集最近研究
最新研究方向
MedSP1000针对大型语言模型在动态临床决策中的表现评估,填补了静态基准测试无法捕捉模型在持续医患交互中信息收集、治疗方案制定及长期管理能力的空白。该数据集基于同行评审的标准化病人教学材料,构建了覆盖17个临床专科的1638个交互式病例,并采用ACGME六大核心能力框架进行评分。研究发现,在静态基准中表现优异的模型在交互式诊疗场景中完成率仅达60.4%,而医学专用模型更降至40.0%,且增加测试时计算未带来显著提升。这一结果揭示了当前语言模型在动态临床推理中的根本性局限,为开发真正具备临床实用性的智能诊疗系统提供了关键评估工具与改进方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务