遇见数据集

ClinHallu

收藏
arXiv2026-06-13 更新2026-06-16 收录
官方服务:

资源简介:

ClinHallu是由阿里巴巴集团达摩院与多所高校联合构建的医学多模态大语言模型幻觉诊断基准数据集,旨在精细化定位推理过程中的幻觉来源。该数据集包含7,031个经过验证的医学视觉问答实例,每个实例均标注了结构化的推理轨迹,涵盖视觉识别、知识回忆和推理整合三个关键阶段,数据来源于VQA-RAD、PathVQA、MedFrameQA和MedXpertQA四个代表性医学VQA数据集。其构建过程通过参考轨迹生成、格式验证与答案一致性过滤,确保了数据的高质量与可靠性。该数据集主要应用于医学人工智能领域,用于诊断和缓解医学MLLM在推理各阶段产生的幻觉问题,从而提升临床决策支持系统的可信度。

ClinHallu is a benchmark dataset for hallucination diagnosis in medical multimodal large language models, jointly constructed by DAMO Academy of Alibaba Group and multiple universities, aiming to precisely locate the sources of hallucinations during the reasoning process. This dataset contains 7,031 validated medical visual question answering (VQA) instances, each annotated with a structured reasoning trajectory covering three key stages: visual recognition, knowledge recall, and reasoning integration. It is compiled from four representative medical VQA datasets, namely VQA-RAD, PathVQA, MedFrameQA, and MedXpertQA. Its construction process ensures high data quality and reliability through reference trajectory generation, format verification, and answer consistency filtering. This benchmark is primarily applied in the field of medical artificial intelligence to diagnose and mitigate hallucinations generated by medical multimodal large language models (MLLMs) at each stage of reasoning, thereby enhancing the trustworthiness of clinical decision support systems.

创建时间:
2026-06-13
原始信息汇总

数据集概述

CLINHALLU 是一个用于诊断医学多模态大语言模型(MLLM)推理中阶段性幻觉的基准测试与评估流程。它旨在系统性地评估模型在视觉识别、知识召回和推理整合三个阶段的幻觉表现。

核心特性

  • 基准测试:提供包含多模态问题、结构化思维链(CoT)标注和细粒度步骤追踪的医学 MLLM 幻觉诊断基准。
  • 评估流程:整合了模型CoT生成、替换实验、答案正确性评估和步骤级幻觉率评估的完整流水线。
  • 幻觉分类:将推理过程中的幻觉来源分为三类:
    • 视觉幻觉($H^V$):模型对图像中医学特征的错误识别。
    • 知识幻觉($H^K$):模型对医学知识的错误回忆。
    • 推理幻觉($H^R$):模型在基于已有信息进行逻辑推理时的错误。

数据集构成

基准数据集源于以下四个医学视觉问答(VQA)数据集,经过重新标注和结构化处理构建而成:

子数据集 来源
VQA-RAD flaviagiammarino/vqa-rad
PathVQA flaviagiammarino/path-vqa
MedFrameQA SuhaoYu1020/MedFrameQA
MedXpertQA-MM TsinghuaC3I/MedXpertQA

主要结果

在 ClinHallu 基准上,报告了模型的答案正确率(Acc)以及三个阶段的幻觉率($H^V$, $H^K$, $H^R$)。整体表现最佳的模型为 Gemini-3-Flash,其在平均正确率(80.1%)和所有阶段的幻觉率($H^V$: 25.8%, $H^K$: 4.0%, $H^R$: 2.3%)上均取得了最优结果。所有模型的详细结果(包括各子数据集上的细分表现)已在其页面中列出。

使用方式

  1. 环境配置:安装依赖(openai, pyyaml, datasets, huggingface_hub, pyarrow, vllm)并编辑 configs/config.yaml 配置文件。
  2. 数据准备:从 Hugging Face 下载 ClinHallu 基准包(Alibaba-DAMO-Academy/ClinHallu),并使用提供的脚本准备对应子数据集的图像文件。
  3. 模型评估:按顺序执行脚本,依次进行模型 CoT 生成、替换实验、答案正确性评估和步骤级幻觉率评估。
搜集汇总
数据集介绍
ClinHallu 数据集图片
构建方式
ClinHallu数据集从VQA-RAD、PathVQA、MedFrameQA和MedXpertQA四个医学视觉问答数据集中整合而来,共包含7,031个经过验证的实例。每个实例均被增广了一个结构化的推理轨迹,该轨迹被分解为视觉识别、知识召回和推理整合三个阶段。数据构建过程中,先通过一个参考轨迹生成器为每个样本自动生成三阶段轨迹,再借助大语言模型作为评判器,对轨迹的格式有效性和答案一致性进行严格筛选,仅保留同时满足两项标准的样本,从而确保参考轨迹的可靠性与准确性。
特点
ClinHallu的核心特点在于实现了细粒度的阶段级幻觉诊断能力。不同于仅判断最终答案正确性的传统基准,该数据集通过构建结构化的推理轨迹,首次能够在医学多模态大模型的推理过程中精准定位幻觉的源头,区分其源自视觉误识别、医学知识错误回忆还是推理整合缺陷。此外,数据集设计了阶段替换干预机制,通过分别替换模型生成的视觉、知识或两个阶段为参考标准,量化纠正特定阶段对最终答案准确率的提升效果,从而揭示不同数据集和模型上的主导性幻觉瓶颈。
使用方法
ClinHallu的使用方法分为评估与训练两方面。评估时,首先让待评测的多模态大模型针对每个医学VQA样本生成结构化的三阶段推理轨迹和最终答案,然后通过阶段替换干预和阶段级幻觉评判,分别计算各阶段的幻觉率以及替换后的准确率增益,从而诊断模型在推理各环节的薄弱点。在训练方面,数据集提供的结构化轨迹可作为监督信号用于微调模型,实验表明,采用完整轨迹(视觉+知识+推理)进行监督的微调能最有效地提升答案准确率并降低各阶段幻觉率,优于仅使用答案或部分轨迹的微调策略。
背景与挑战
背景概述
ClinHallu数据集由阿里巴巴达摩院与香港科技大学(广州)于2026年联合创建,旨在解决医学多模态大模型(MLLMs)在临床推理中产生的幻觉问题。现有医学幻觉基准大多聚焦于最终答案的正确性,却忽视了推理过程中错误的源头。ClinHallu从VQA-RAD、PathVQA、MedFrameQA和MedXpertQA四个公开医学VQA数据集出发,经过严格筛选与验证,最终构建了包含7,031个实例的高质量基准。每个实例均被精心注解为视觉识别、知识回忆和推理整合三个阶段的结构化推理轨迹,为揭示模型在医学多模态推理中不同阶段的失败模式提供了精细化的诊断平台。该数据集不仅推动了医学MLLM评估从答案导向向过程导向的转变,也为构建更可靠的临床决策支持系统奠定了基础。
当前挑战
ClinHallu面临的领域挑战在于,医学MLLM的幻觉问题极为复杂且具有隐蔽性:模型可能在视觉识别阶段误读影像特征,在知识回忆阶段调用错误的医学事实,或在推理整合阶段做出不合逻辑的推断——而这三种截然不同的错误源头均可能导致相同的错误终答。现有的以终答正确性为唯一维度的评估体系无法区分这些失效模式,从而难以定位模型的具体薄弱环节。在构建过程中,挑战则在于如何大规模、高质量地为每个VQA实例生成并验证符合三阶段格式的结构化推理轨迹,确保轨迹既严格遵循医学事实,又能忠实支持标准答案。此外,还需设计巧妙的分阶段替换干预机制,通过精确控制某个阶段的输入来量化其对最终答案准确率的影响,从而真正实现对模型推理过程中幻觉起源的细粒度诊断。
常用场景
经典使用场景
ClinHallu作为首个面向医学多模态大模型推理过程的阶段性幻觉诊断基准,其最经典的使用场景在于对模型在视觉问答任务中的推理链路进行细粒度剖析。研究者通过将医学VQA样本的结构化推理轨迹分解为视觉识别、知识召回与推理整合三个阶段,从而精准定位幻觉产生的源头。该基准使得学术界能够超越传统的仅评估最终答案正确性的范式,转而从过程层面揭示模型在视觉感知、医学知识运用以及逻辑融合等环节的失效模式,为理解医学MLLM的推理缺陷提供了系统性的诊断工具。
实际应用
在实际临床场景中,ClinHallu可直接应用于医学影像辅助诊断系统的可靠性验证环节。例如,在放射科医生使用基于MLLM的影像解读工具时,该基准能够针对特定病例的推理过程进行安全性筛查,自动识别模型是否在视觉描述中虚构病灶、调用了不准确的病理知识或在逻辑整合中出现偏差。此外,它还可作为模型部署前的质量监控工具,通过对不同疾病类型和影像模态的阶段性幻觉率统计分析,帮助开发团队针对性地优化视觉编码器、医学知识库或推理模块,从而降低临床误诊风险。
衍生相关工作
基于ClinHallu提供的结构化推理轨迹,衍生了一系列关于医学多模态模型幻觉缓解的经典工作。其中最具代表性的是轨迹监督微调方法,通过利用基准中验证过的三阶段参考轨迹作为训练目标,引导模型在视觉识别、知识召回和推理整合各个阶段生成更准确的中间表示。实验表明,完整的轨迹监督相较于仅使用标准答案微调,能更显著地降低各阶段的幻觉率并提升最终答案准确性。此外,该基准还启发了阶段级知识蒸馏、可解释性注意力分析以及多阶段对抗训练等后续研究,形成了医学MLLM可靠性增强的系统化方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务