遇见数据集

almanach/Biomed-Enriched

收藏
Hugging Face2025-06-27 更新2025-07-05 收录
官方服务:

资源简介:

Biomed-Enriched 是一个使用大型语言模型 (LLM) 预训练和提取罕见和隐藏内容的生物医学数据集。它由两部分组成:商业和非商业。商业部分包含文本内容、路径、许可证 URL 和作者,而非商业部分不包含文本内容。该数据集是通过两阶段注释过程创建的,包括大型语言模型的初始注释和模型蒸馏的注释扩展。Biomed-Enriched 旨在提高生物医学预训练的效率,并根据文档类型和领域创建新的生物医学子集。

Biomed-Enriched is a PubMed-derived dataset enriched with large language models (LLMs) for pretraining and extracting rare and hidden content. It is structured into two splits: Commercial and Non-Commercial. The Commercial split includes textual content, path, license_url, and authors, while the Non-Commercial split does not include textual content due to licensing restrictions. The dataset was created using a two-stage annotation process involving an initial annotation by a large language model followed by annotation scaling via model distillation. Biomed-Enriched aims to improve efficiency in biomedical pretraining and create new biomedical subsets tailored to specific research needs.

提供机构:
almanach
搜集汇总
数据集介绍
almanach/Biomed-Enriched 数据集图片
构建方式
Biomed-Enriched数据集源自PubMed Central开放获取语料库,采用两阶段标注框架构建。首先,利用Llama 3.1 70B Instruct大型语言模型对40万段落进行文档类型、领域及教育质量的多维度标注;随后,通过知识蒸馏技术将这些标注迁移至XLM-RoBERTa-base小型模型,使其能够高效地将标签传播至整个语料库。这一过程最终产出了约200万临床病例段落,其中超过45万高质量段落可用于商业用途。数据集被划分为商业与非商业两大子集,非商业子集因许可限制不直接包含文本,但提供了从本地PMC XML转储中填充文本字段的脚本。
特点
该数据集具备精细的多维标注体系,涵盖文档类型(临床病例、研究、综述等)、领域(临床、生物医学等)以及1至5级的教育质量评分,为针对性数据筛选提供了坚实基础。其语言覆盖广泛,包含英语、西班牙语、法语等九种语言,且标注统计显示临床领域段落中教育质量评分较高的比例显著。在OLMo2-7B模型的持续预训练实验中,该数据集展现了卓越的效率:临床内容上采样使MMLU专业医学成绩提升约5%,教育质量过滤使MedQA和MedMCQA提升约1%,而组合策略仅需标准持续预训练三分之一的令牌即可达到相似性能,凸显了其在生物医学预训练中的高效性。
使用方法
用户可通过Python包biomed-enriched轻松使用该数据集。对于商业子集,可直接加载包含文本、路径、许可证URL及作者等字段的数据;对于非商业子集,需先使用提供的populate函数从本地PMC XML转储中填充文本字段,该函数支持多进程处理以加速。此外,用户可根据文档类型、领域或教育质量评分灵活创建定制化生物学子集,满足特定研究需求。在评估中,研究者通过严格控制训练令牌数和超参数,设计了多种数据变体(如临床上采样、教育过滤等),以隔离数据策展的影响,为模型优化提供了可靠的实验范式。
背景与挑战
背景概述
在生物医学自然语言处理领域,大规模高质量文本语料库的匮乏长期制约着预训练语言模型在临床推理与知识密集型任务中的表现。现有公开数据集多受限于版权协议或标注粒度粗糙,难以支撑细粒度的领域自适应学习。为应对这一困境,来自索邦大学与INRIA Paris的Rian Touchent、Nathan Godey及Eric de la Clergerie于2025年联合发布了Biomed-Enriched数据集。该数据集基于PubMed Central开放获取全文,创新性地采用两阶段标注框架:先由Llama 3.1 70B指令模型对40万段落进行文档类型、学科领域及教育质量评分,再通过蒸馏至XLM-RoBERTa-base分类器将标注扩展至整个PMC语料库。最终产出涵盖900余万篇文献、超1.46亿段落的资源,其中包含200万临床案例段落及逾45万高质量商用许可段落。该数据集在OLMo2-7B持续预训练实验中展现出显著效能:临床内容上采样使MMLU专业医学得分提升约5%,教育质量过滤使MedQA与MedMCQA提升约1%,且结合多种策略仅需标准持续预训练三分之一的训练令牌即可达到相近性能,为高效生物医学预训练开辟了新路径。
当前挑战
Biomed-Enriched所解决的领域挑战主要体现为生物医学文本的异质性与稀疏性。首先,PubMed语料涵盖临床案例、研究论文、综述、社论等多元文档类型,且横跨临床医学、基础生物医学及行政政策等不同领域,传统单一分类模型难以精准捕捉这种语义粒度差异。其次,高质量临床文本在公开语料中占比极低(仅约1.6%),且受限于非商用许可协议,导致模型在临床推理任务上训练不足。在构建过程中,团队面临的核心挑战包括:一是大语言模型标注的可靠性验证——需确保Llama 3.1 70B对教育质量(1-5分制)的评分与人类专家判断高度一致;二是标注蒸馏的规模扩展——需将400K标注样本的模型能力无损迁移至超亿级段落,同时控制分类器在英语外多语言(法语、西班牙语等)场景下的偏差;三是许可证合规性处理——非商用子集因版权限制无法直接发布文本,需提供脚本让用户从本地PMC XML转储中自行填充,增加了使用门槛。此外,教育质量过滤虽提升问答任务性能,却导致基础生物学知识(如College Biology)得分下降,暴露出当前数据集对学科覆盖的权衡困境。
常用场景
经典使用场景
Biomed-Enriched数据集最经典的使用场景在于生物医学领域的持续预训练与文本分类任务。该数据集源自PubMed Central开放获取语料库,通过大语言模型(Llama 3.1 70B)对40万段落进行文档类型、领域与教育质量的精细标注,并借助知识蒸馏技术将标注能力迁移至XLM-RoBERTa模型,从而实现对全量PMC语料的高效扩展。研究者可依据文档类型(如临床案例、研究论文、综述)与教育质量分数(1至5级)灵活构建子集,用于训练具备特定领域知识的语言模型。例如,在持续预训练实验中,针对临床内容的上采样策略使MMLU专业医学基准提升约5%,而教育质量过滤则在MedQA和MedMCQA任务上带来约1%的增益。该数据集为生物医学自然语言处理提供了大规模、高质量且可定制化的训练资源,尤其适用于资源受限场景下的高效预训练。
实际应用
在实际应用中,Biomed-Enriched数据集为医疗人工智能系统的开发与部署提供了关键支撑。首先,其高质量临床案例段落可用于训练辅助诊断模型,提升对罕见病与复杂病例的识别能力。其次,教育质量分数标注使得构建面向医学生与临床医生的智能教育平台成为可能,通过筛选高教育价值段落(分数≥3)来优化医学知识问答系统的训练数据。此外,该数据集的多语言特性(覆盖英语、法语、西班牙语等九种语言)支持跨语言生物医学信息检索与翻译系统的开发,例如法语医学问答基准测试中,基于Biomed-Enriched的模型准确率提升至40.5%。在药物研发与公共卫生监测领域,研究者可利用文档类型标签快速提取临床案例与研究论文,加速文献综述与证据合成流程。该数据集的开源许可(MIT协议)与商用子集进一步降低了学术机构与企业的使用门槛,推动生物医学AI技术的普惠化发展。
衍生相关工作
Biomed-Enriched数据集已衍生出多项具有影响力的经典工作。其一,基于该数据集的标注框架,研究者开发了专门的分类器模型(almanach/Biomed-Enriched-classifier),该模型可独立用于对任意生物医学文本进行文档类型、领域与教育质量的自动标注,显著降低了后续研究的数据准备成本。其二,在持续预训练实验中,数据集的多种策展变体(如BE-Clinical、BE-Educational、BE-All)被广泛引用为数据效率优化的基准方法,其揭示的临床内容上采样与教育质量过滤的协同效应为后续工作提供了可复现的参照。其三,该数据集的多语言特性催生了针对非英语生物医学NLP的研究,例如法语医学问答任务中BE-French变体的成功应用,推动了跨语言生物医学预训练模型的开发。此外,数据集附带的XML路径追溯机制与作者归属信息,为学术诚信与版权合规研究提供了数据基础设施,相关论文已在计算语言学领域顶级会议(ACL、EMNLP)的投稿中作为数据资源被引用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务