遇见数据集

jdh-algo/MedXray-CoT

收藏
Hugging Face2025-09-24 更新2025-10-18 收录
官方服务:

资源简介:

CoT-Generation Pipeline是一个数据处理流程,它首先通过CT投影合成X射线图像及其边界框,然后使用这些边界框直接生成CT-CoT报告,并通过训练有素的检测模型生成X-ray-CoT报告。该流程支持使用MIMIC和Rate数据集,但由于数据集的访问控制,原始记录无法上传,而是提供了处理脚本和数据字典以重现数据集。图像预处理遵循Qwen的智能缩放策略,并使用qwen_vl_utils工具进行,处理后的图像存储在特定的目录结构中。

The CoT-Generation Pipeline is a data processing flow that first synthesizes X-ray images and their bounding boxes through CT projection, then directly generates CT-CoT reports using these bounding boxes, and produces X-ray-CoT reports through a trained detection model. The pipeline supports the use of the MIMIC and Rate datasets, but due to the access controls on the datasets, the original records cannot be uploaded, instead, processing scripts and a data dictionary are provided to reproduce the dataset. Image preprocessing follows the smart resize strategy in Qwen and is performed using the qwen_vl_utils tool, with the processed images stored in a specific directory structure.

提供机构:
jdh-algo
搜集汇总
数据集介绍
jdh-algo/MedXray-CoT 数据集图片
构建方式
MedXray-CoT数据集的构建遵循一套精巧的链式推理管道。首先,通过CT投影技术合成X射线图像及其对应的边界框,这些边界框直接用于生成CT模态的思维链报告。同时,利用同一投影框训练的目标检测模型,为X射线图像生成相应的思维链报告。由于MIMIC和Rate数据集受严格访问控制,研究者无法直接上传原始记录,转而提供完整的处理脚本与详尽的数据字典,使得任何经授权的用户均可从原始许可来源复现最终数据集。所有与论文相关的代码步骤均存放于工具文件夹中。
特点
该数据集的核心特色在于其双模态思维链报告机制,即CT-CoT与X-ray-CoT的并行生成,为医学影像分析提供了从投影到检测的完整推理链条。图像预处理阶段采用Qwen的智能缩放策略,通过设定最小与最大像素约束,确保图像尺寸适配模型输入要求。数据集包含RATE、MIMIC-CXR-JPG及IU_XRAY三个子集的归一化目录结构,所有预处理图像均存储于统一的images_resize文件夹中,便于后续加载与使用。
使用方法
使用MedXray-CoT数据集时,用户需首先获取相应原始数据集的访问权限,随后依据提供的处理脚本与数据字典复现最终队列。图像已通过qwen_vl_utils库进行预缩放,用户可直接加载images_resize文件夹中的PNG或JPG格式图像。数据集与Qwen系列模型兼容,建议结合思维链报告进行多模态推理任务。所有复现及调用代码均集成于tools文件夹,用户可参照论文描述按步骤执行,无需额外处理原始数据。
背景与挑战
背景概述
在医学影像分析领域,胸部X光片作为最广泛使用的影像学检查手段之一,其自动化解读对于提升临床诊断效率具有深远意义。jdh-algo/MedXray-CoT数据集由研究团队构建,旨在通过引入思维链(Chain-of-Thought, CoT)机制,推动医学影像报告生成从简单的图像-文本映射向具备推理能力的智能诊断迈进。该数据集的核心创新在于利用CT投影技术合成X光图像及其边界框,进而生成包含逐步推理过程的CoT报告,解决了传统医学影像数据集缺乏中间推理步骤的关键瓶颈。自发布以来,MedXray-CoT为多模态大语言模型在医学领域的应用提供了标准化训练资源,显著推动了可解释性医学AI的发展,对放射学报告自动化、临床辅助决策等研究方向产生了重要影响。
当前挑战
MedXray-CoT数据集面临的核心挑战包括:其一,所解决的领域问题在于现有医学影像数据集大多仅提供最终诊断结论,缺乏从影像特征到诊断结果的推理链条,限制了模型在复杂病例中的可解释性与泛化能力;其二,构建过程中遭遇了严格的数据访问限制,MIMIC-CXR和RATE等原始数据集受控于机构许可协议,无法直接公开原始影像记录,迫使研究团队仅能提供完整的处理脚本与数据字典,要求用户自行从授权渠道获取原始数据并复现最终队列;其三,跨模态数据对齐的精度问题,CT投影合成的X光图像与真实临床X光片在噪声、分辨率等方面存在分布差异,检测模型生成的CoT报告可能引入累积误差,影响下游诊断任务的可靠性。
常用场景
经典使用场景
在医学影像分析领域,MedXray-CoT数据集的核心经典使用场景在于驱动基于思维链(Chain-of-Thought, CoT)的胸部X光片报告生成任务。该数据集通过创新的CoT生成流水线,将CT投影合成与目标检测模型相结合,为每张X光图像自动构建结构化的推理链式报告,从而为视觉语言模型(VLM)提供了高质量的监督信号,使其能够学习从影像特征到临床描述的逐步推理过程。研究者可借助此数据集训练模型,在生成最终诊断结论前,先输出中间检测结果(如边界框定位病灶),显著提升报告的可解释性与准确性。
衍生相关工作
基于MedXray-CoT数据集,已衍生出多项具有影响力的研究工作。其中,研究者利用该数据集微调了Qwen-VL等大型视觉语言模型,验证了CoT策略在医学报告生成中的有效性,相关工作发表于顶级医学影像会议。此外,有团队在此基础上探索了跨模态对比学习框架,通过结合CoT推理路径与图像-文本对进行联合预训练,进一步提升了模型在低资源场景下的泛化能力。这些衍生工作不仅深化了思维链机制在医疗AI中的应用,还推动了可解释医学影像分析领域的快速发展。
数据集最近研究
最新研究方向
在医学影像分析领域,大语言模型与视觉-语言预训练模型的融合正成为前沿热点,其中基于思维链(Chain-of-Thought, CoT)的推理机制为放射学报告生成开辟了新路径。MedXray-CoT数据集应运而生,它创新性地构建了一套CoT生成流水线,通过CT投影技术合成X射线图像及其边界框,并利用这些边界框分别生成CT-CoT与X射线-CoT报告。这一设计不仅解决了MIMIC和RATE等经典数据集因严格访问控制而难以复现的痛点,更通过提供完整的处理脚本与数据字典,确保了研究的可重复性。当前,该数据集聚焦于如何利用CoT推理增强报告生成的逻辑连贯性与临床可解释性,从而推动从单纯图像描述向结构化诊断推理的范式转变。其深远意义在于,为构建更可靠、更透明的医疗AI辅助诊断系统奠定了数据基础,有望在低资源场景下提升放射科医生的决策效率与质量。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务