MTBBench
收藏资源简介:
MTBBench是由苏黎世联邦理工学院等机构联合构建的多模态肿瘤学临床决策基准数据集。该数据集整合了来自HANCOCK和MSK-CHORD项目的66例患者数据,包含573个专业标注的问答对,涵盖数字病理切片、免疫组化图像、血液学报告和基因组数据等多维度信息。数据集通过GPT-4o生成问题并结合临床专家验证流程,确保临床准确性与时效性。该基准主要应用于精准肿瘤学领域,旨在评估人工智能系统在模拟分子肿瘤董事会工作流程中的多模态时序推理能力,解决现有模型在整合异质医疗数据和时序推理方面的技术瓶颈。
MTBBench is a multimodal oncology clinical decision-making benchmark dataset jointly developed by ETH Zurich and other institutions. This dataset integrates 66 patient cases from the HANCOCK and MSK-CHORD projects, and contains 573 professionally annotated question-answer pairs, covering multi-dimensional information including digital pathological slides, immunohistochemical images, hematology reports, and genomic data. The dataset generates questions via GPT-4o and incorporates a clinical expert validation process to ensure clinical accuracy and timeliness. This benchmark is mainly applied in the field of precision oncology, aiming to evaluate the multimodal temporal reasoning ability of artificial intelligence systems when simulating the workflow of molecular tumor boards, and to address the technical bottlenecks of existing models in integrating heterogeneous medical data and temporal reasoning.
MTBBench数据集概述
基本信息
- 数据集名称: MTBBench
- 创建者: EeshaanJain
- 许可证: MIT
- 模态: 图像、文本
- 格式: imagefolder
- 数据量: 1K - 10K
- 库支持: Datasets、Croissant
数据集规模
- 下载数据集文件大小: 1.41 GB
- 自动转换Parquet文件大小: 1.4 GB
- 数据行数: 1,012行
- 最近月下载量: 192次
数据结构
子集划分
- 默认子集: 1.01k行
数据分割
- 训练集: 1.01k行
数据特征
列信息
- image: 图像数据
- imagewidth: 图像宽度(像素),示例值:240
- label: 类别标签,包含32个类别
- 示例标签值:0104、1116、2120等
数据集描述
MTBBench是一个用于评估多模态大语言模型在复杂临床决策场景中推理能力的基准测试。该基准专注于肿瘤学中的两个核心挑战:多模态整合(如病理学、基因组学、放射学)和跨患者时间线的纵向推理。基准包括需要与外部基础模型工具和数据集交互的代理任务。
基准结构
数据集包含两个JSON文件,包含问题、答案、每个问题的相关文件以及用于生成问题的上下文信息。这适用于HANCOCK和MSK-CHORD两个队列。
HANCOCK队列
每个HANCOCK患者的病例文件夹通常包括:
- 各种免疫组织化学标记的组织微阵列图像
- 原发肿瘤和淋巴结的苏木精-伊红染色图像
- 临床和病理数据
MSK-CHORD队列
每个MSK-CHORD患者的病例文件夹通常包括:
- 临床事件时间线
- 基因组数据
- 样本元数据

- 1通过苏黎世联邦理工学院、洛桑联邦理工学院、日内瓦大学医院 · 2025年



