遇见数据集

FreedomIntelligence/XMedbench

收藏
Hugging Face2025-02-15 更新2024-04-19 收录
官方服务:

资源简介:

Apollo是一个包含英语、中文、法语、西班牙语、印地语和阿拉伯语的多语种医疗问题回答数据集。它包括针对每种语言的多个子数据集,如MedQA-USMLE、MedMCQA、PubMedQA等。该数据集是Apollo项目的一部分,该项目还包括一个轻量级的多语种医疗LLM模型、基准测试和代码。数据集和相关资源可在HuggingFace上获取。

Apollo is a multilingual medical question answering dataset covering English, Chinese, French, Spanish, Hindi, and Arabic. It includes several sub-datasets for each language such as MedQA-USMLE, MedMCQA, PubMedQA, etc. The dataset is part of the Apollo project, which also includes a lightweight multilingual medical LLM model, benchmark, and code. The dataset and related resources are available on HuggingFace.

提供机构:
FreedomIntelligence
原始信息汇总

数据集语言覆盖范围

  • 英语
  • 中文
  • 法语
  • 印地语
  • 西班牙语
  • 阿拉伯语
搜集汇总
数据集介绍
构建方式
XMedbench数据集由FreedomIntelligence团队构建,旨在为多语言医学领域提供全面的评估基准。其构建过程整合了来自多个公开医学问答数据集的高质量样本,覆盖英语、中文、法语、西班牙语、阿拉伯语和印地语六种语言。英语部分融合了MedQA-USMLE、MedMCQA、PubMedQA及MMLU-Medical中的医学子集;中文部分则囊括MedQA-MCMLE、CMB-single、CMMLU-Medical和CExam的精选题目;西班牙语和法语分别采用Head_qa和Frenchmedmcqa;印地语与阿拉伯语则基于MMLU的医学子集进行翻译与适配。最终,所有数据被统一整理为JSON格式,并按照语言划分为独立的测试集文件,以支持多语言场景下的模型性能评估。
特点
该数据集的核心特点在于其显著的多语言覆盖性与医学领域的专精性。它横跨六大语系,尤其包含印地语和阿拉伯语等低资源语言,致力于推动医疗AI的全球普惠。数据来源多元且权威,均来自经过临床验证的医学考试题库(如USMLE、MCMLE)及专业问答集,确保了评估的可靠性与专业性。此外,XMedbench不仅提供完整的测试集,还通过论文和代码仓库公开了详细的构建方法与评估结果,为研究者提供了可复现的基准。其设计兼顾了选择题与开放问答形式,能够全面检验模型在医学知识推理与跨语言理解方面的能力。
使用方法
使用XMedbench时,研究者可直接从HuggingFace页面下载压缩包或按语言分列的JSON文件。数据集通过HuggingFace Datasets库加载,配置项包含english、chinese、french等六个子集,便于按需选择特定语言进行评估。典型的应用流程包括:首先加载对应语言的测试集,随后输入至待评估的医学语言模型,并基于标准答案计算准确率等指标。该基准特别适合用于对比不同多语言模型在医学领域的表现,或检验模型在跨语言迁移学习中的效果。论文中提供了详细的实验结果作为参考,建议用户遵循其评估协议以确保结果的可比性。
背景与挑战
背景概述
在全球化背景下,医疗人工智能的发展长期受限于语言与地域的壁垒,现有医学大语言模型多聚焦于英语环境,难以覆盖全球数十亿非英语人口的健康需求。为弥合这一鸿沟,香港中文大学(深圳)与上海交通大学等机构的研究团队于2024年2月发布了XMedBench数据集,隶属于Apollo项目。该数据集由王希东、陈诺等人主导构建,旨在为多语言医学大语言模型提供标准化的评估基准,核心研究问题在于衡量模型在英语、中文、法语、西班牙语、阿拉伯语和印地语六种语言上的临床知识掌握程度。XMedBench整合了MedQA-USMLE、MedMCQA、CMB、Head_qa等十余个权威医学问答资源,覆盖解剖学、临床知识、遗传学等多元科目,其发布为跨语言医学AI的公平性与泛化能力研究奠定了重要基石,推动了医疗人工智能从单语种向多语种民主化迈进的进程。
当前挑战
XMedBench所面临的挑战首先体现在多语言医学领域的固有复杂性上:不同语言的医学知识体系、术语表达与临床实践存在显著差异,模型需在缺乏统一跨语言对齐数据的情况下,同时应对英语、中文等六种语言中专业问答的准确性要求。其次,数据集构建过程中遭遇了多重困难,例如各源数据集(如PubMedQA、CExam)因结果波动过大或样本不均衡而被部分舍弃,需通过随机采样与人工筛选保证测试集的代表性;此外,对印地语和阿拉伯语等低资源语言,缺乏现成的高质量医学评测数据,研究团队不得不将MMLU中的医学子集进行翻译与适配,这一过程极易引入文化适应性与翻译偏差问题,对评估的公正性构成潜在挑战。
常用场景
经典使用场景
XMedBench作为多语言医学推理的标准化评估基准,其最经典的使用场景在于系统性评测大语言模型在多语种医学知识问答中的表现。该数据集整合了英语、中文、法语、西班牙语、阿拉伯语和印地语六种语言的医学多选题,涵盖MedQA-USMLE、MedMCQA、PubMedQA、MMLU-Medical等权威英文资源,以及中文的MedQA-MCMLE、CMMLU-Medical、CMB和CExam,同时纳入西班牙语Head_qa、法语FrenchMedMCQA及印地语与阿拉伯语的MMLU变体。研究者可通过统一的测试框架,横向对比模型在跨语言临床知识、解剖学、遗传学等专业领域的推理能力,从而揭示语言对医学认知的潜在影响。
解决学术问题
该数据集有效解决了多语言医学自然语言处理中评估标准碎片化与语言覆盖不足的学术困境。传统医学基准多集中于英语或单一高资源语言,导致非英语医学知识推理能力的评估存在盲区。XMedBench通过构建涵盖六大语系的标准化测试集,为跨语言医学模型性能对比提供了可复现的度量标尺,使得研究者能够系统分析语言迁移对临床问答准确率的影响。其意义在于推动了多语种医疗AI的公平性研究,揭示了低资源语言环境中模型认知偏差的根源,并为构建真正普惠全球的医学语言模型奠定了实证基础。
衍生相关工作
XMedBench的发布催生了多项具有影响力的衍生工作。其配套的Apollo模型以轻量化多语言医学LLM为定位,首次将六语医学推理能力集成于单一架构,通过多任务学习与跨语言蒸馏技术显著提升了低资源语言的问答效果。此外,基于XMedBench的评测结果,研究者提出了语言自适应提示策略(LAPS),通过动态调整输入模板的语言特征来缓解跨语言性能差异。该基准还启发了多语言医学知识图谱的构建工作,例如利用其错误案例分析模型在阿拉伯语解剖学问题上的推理缺陷,进而开发了针对性的语义对齐训练方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务