SMMILE
收藏资源简介:
SMMILE是一个由专家驱动的多模态医疗领域内情境学习(ICL)基准数据集,由11位医疗专家共同打造,包含111个问题(517个问题-图像-答案三元组),涵盖了6个医疗专业和13种成像模式。该数据集旨在评估多模态大型语言模型在医疗任务中的情境学习能力,揭示了当前模型在处理医疗领域多模态任务时的局限性和偏差。
SMMILE is an expert-driven multimodal benchmark dataset for in-context learning (ICL) in the medical domain. Co-constructed by 11 medical experts, it includes 111 questions (517 question-image-answer triplets) covering 6 medical specialties and 13 imaging modalities. This benchmark aims to evaluate the in-context learning capabilities of multimodal large language models (LLMs) on medical tasks, and reveals the limitations and biases of current models when processing multimodal tasks in the medical field.
SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning
数据集概述
- 名称: SMMILE (Stanford Multimodal Medical In-Context Learning)
- 类型: 专家驱动的多模态医学上下文学习基准
- 规模:
- 111个问题(517个问题-图像-答案三元组)
- 增强变体SMMILE++包含1038个排列问题
- 创建机构: 苏黎世联邦理工学院、斯坦福大学等11家国际机构合作开发
数据特点
- 专业性: 由11名平均6.4年临床经验的医学专家参与创建
- 覆盖范围:
- 6个医学专科: 放射学、病理学、皮肤病学、眼科学、外科学、普通医学
- 13种成像模态: X射线、CT、MRI、超声、照片、染色、ECG、EEG、乳腺X光、眼底摄影等
- 任务类型: 分类问题、诊断问题、推理任务和需要各种认知过程的定量分析
数据结构
- 问题组成:
- 上下文示例: 专家策划的上下文学习问题
- 查询: 模型必须根据学习模式回答的最终图像-问题对
- 真实答案: 专家验证的评估答案
评估结果
- 评估模型: 15个最先进的多模态大语言模型(包括开源和闭源模型)
- 关键发现:
- ICL效益有限: SMMILE平均仅提高8%,SMMILE++提高9.4%
- 模型表现: GPT-4o在SMMILE领先,Qwen2.5-VL-72B在SMMILE++表现更优
- 识别偏差:
- 近因偏差: 模型过度重视最后一个示例
- 示例质量敏感性: 一个不相关示例可导致性能下降高达9.5%
- 特定困难: 数值答案(0%准确率)、定量推理任务、MRI和医学插图等模态
引用信息
bibtex @misc{rieff2025smmileexpertdrivenbenchmarkmultimodal, title={SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning}, author={Melanie Rieff and Maya Varma and Ossian Rabow and Subathra Adithan and Julie Kim and Ken Chang and Hannah Lee and Nidhi Rohatgi and Christian Bluethgen and Mohamed S. Muneer and Jean-Benoit Delbrouck and Michael Moor}, year={2025}, eprint={2506.21355}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2506.21355}, }




