MedMASLab_dataset
收藏资源简介:
MedMASLab是一个专为医学视觉语言多智能体系统设计的统一、全面的基准测试平台。该数据集旨在解决医学AI领域的关键挑战,提供标准化的基础设施、严格的评估指标和广泛的实证分析。数据集规模涵盖11个器官系统和473种疾病,整合了11种异构多智能体架构,涉及24种医学模态(包括放射影像、视频帧和临床文本)。包含的基准测试包括医学文献推理(PubMedQA)、医学问答(MedQA, MedBullets, MMLU)、医学视觉理解与推理(VQA-RAD, SLAKE-En, MedVidQA, MedCMR, MedXpertQA-MM)、诊断决策(DxBench)和医学推理链评估(M3CoTBench)。数据集适用于医学视觉语言模型和多智能体系统的研究与评估。
MedMASLab 数据集概述
数据集基本信息
- 数据集名称: MedMASLab Dataset
- 发布平台: Hugging Face
- 许可证: MIT
- 任务类别: 问答、视觉问答
- 相关标签: 视觉语言模型、基准测试、医疗多智能体系统
数据集简介
MedMASLab 是一个专为医疗视觉语言多智能体系统设计的统一、综合性基准测试平台。它通过提供标准化的基础设施、严格的评估指标和广泛的实证见解,应对医疗人工智能领域的关键挑战。
数据集规模与范围
- 规模: 整合了来自 11 个临床基准测试的数据,是目前最广泛的医疗视觉语言智能体基准测试。
- 覆盖范围: 涵盖 11 个器官系统和 473 种疾病。
- 模态: 协调了 11 种异构的多智能体系统架构,跨越 24 种医疗模态(包括放射影像、视频帧和临床文本)。
包含的基准测试
该平台对以下任务和数据集进行标准化评估:
- 医学文献推理: PubMedQA
- 医学问答: MedQA, MedBullets, MMLU
- 医学视觉理解与推理: VQA-RAD, SLAKE-En, MedVidQA, MedCMR, MedXpertQA-MM
- 诊断决策: DxBench
- 医学推理链评估: M3CoTBench
性能对比
数据集详情页面提供了通用任务方法与医学专用方法在 11 个医疗基准测试上的性能对比表格。对比基于两个模型:Qwen-2.5VL-7B-Instruct 和 LLaVA-v1.6-mistral-7b-hf。评估了包括 Single、Debate、MDAgents、MDTeamGPT、Discussion、Reconcile、Meta-Prompting、AutoGen、DyLAN、MedAgents、ColaCare 在内的多种方法。性能以平均准确率(Avg-V)衡量。
使用指南
前提条件
- Python 3.11
- PyTorch: 2.6.0+cu124
- Transformers: 4.57.6
- vLLM: 0.8.0
- gradio: 4.44.1
数据集下载
MedMASLab 基准测试数据集可在 Hugging Face 公开获取: 数据集下载地址: https://huggingface.co/datasets/qyhhhhh/MedMASLab_dataset/tree/main
运行医疗基准测试
- 启动基础模型 vLLM 服务。
- 启动评判模型 vLLM 服务。
- 在特定任务(如 MedQA)上运行 Debate 等方法。
用户可视化与交互操作界面
MedMASLab 提供了一个全面、直观的基于网络的图形用户界面。可通过运行 python web.py 启动。
引用
如果研究中使用 MedMASLab,请引用相关论文。



