遇见数据集

chimera-bench

收藏
Hugging Face2026-03-18 更新2026-03-20 收录
官方服务:

资源简介:

CHIMERA-Bench v1.0 是一个用于表位特异性抗体CDR序列-结构协同设计的统一基准数据集。该数据集包含2,922个复合物,其中2,721个具有PDB结构,2,941个预计算的特征文件(.pt格式)。数据集提供了三种分割方式(表位组、抗原折叠、时间序列),并支持IMGT和Chothia编号方案。每个复合物特征文件包含序列、坐标、注释、编号和表面特征等详细信息。数据集适用于抗体设计、蛋白质结构预测和生物分子设计等任务,并提供了11种基准方法和6种范式的评估结果。数据以PyTorch张量和PDB文件形式存储,包含元数据、分割信息和结构文件。

CHIMERA-Bench v1.0 is a unified benchmark dataset for sequence-structure co-design of complementarity-determining region (CDR) sequences of epitope-specific antibodies. This dataset includes 2,922 complexes, among which 2,721 have resolved PDB structures, and 2,941 pre-computed feature files in .pt format. Three splitting strategies (epitope group, antigen fold, and temporal split) are provided, and the dataset supports both IMGT and Chothia numbering schemes. Each complex feature file contains detailed information such as sequences, coordinates, annotations, numbering details, and surface features. This dataset is applicable to tasks including antibody design, protein structure prediction, and biomolecular design, and provides evaluation results for 11 benchmark methods and 6 design paradigms. The data is stored in the form of PyTorch tensors and PDB files, covering metadata, splitting information, and structural files.

创建时间:
2026-03-10
搜集汇总
数据集介绍
chimera-bench 数据集图片
构建方式
CHIMERA-Bench是面向表位特异性抗体CDR序列与结构协同设计的统一基准数据集。其构建基于从蛋白质数据库(PDB)中筛选出的2,922个抗体-抗原复合物结构,涵盖2,721个独立PDB条目,并引入了4.5埃的接触距离阈值与4.0埃的分辨率上限以确保数据质量。数据集提供了2,941个预计算的PyTorch张量文件,每个文件封装了序列、坐标、表位与互补位注释、CDR区域编号(IMGT与Chothia方案)以及抗原表面几何与化学特征。此外,数据集设计了三种划分策略——表位分组、抗原折叠与时序划分,分别评估模型在未见表位模式、未见抗原折叠及前瞻性场景下的泛化能力。
特点
该数据集的核心特点在于其多维度、结构化的标注体系与严苛的基准设计。每个复合物张量包含14原子坐标表示、表面采样点及其法向量、曲率与六维化学特征,支持几何与理化属性的联合建模。CDR掩码按框架区与六个CDR环(H1-H3、L1-L3)进行整数编码,便于序列-结构协同任务的分区处理。数据集还附带了污染审计文件,量化了与预训练语言模型训练数据的重叠情况,增强了基准的公平性。评价指标覆盖序列质量(AAR、困惑度)、结构精度(RMSD、TM-score)、结合界面质量(Fnat、DockQ)及表位特异性(EpiF1),共评估了11种基线方法,涵盖六个范式。
使用方法
使用者可通过HuggingFace CLI下载完整数据集,并设置环境变量指定本地存储路径。数据加载流程包括:首先利用Pandas读取元数据CSV文件获取复合物摘要信息,随后加载JSON格式的划分文件以获取训练、验证与测试集的复合物ID列表。核心操作是使用PyTorch的torch.load函数加载每个复合物的张量文件,从中提取序列字符串、坐标张量、表位与互补位残基列表以及CDR掩码。对于结构文件,可直接访问PDB格式的原子坐标。该数据集适用于训练与评估抗体设计模型,特别是需要同时优化CDR序列与三维结构的生成式方法,以及需要表位特异性控制的场景。
背景与挑战
背景概述
抗体设计是计算生物学与免疫工程领域的核心课题,其关键在于生成能够特异性识别抗原表位的互补决定区(CDR)序列与结构。然而,现有基准数据集多聚焦于通用抗体-抗原复合物建模,忽视了表位特异性这一关键维度,导致模型在真实应用中的泛化能力受限。在此背景下,Mansoor Ahmed、Nadeem Taj、Imdad Ullah Khan、Hemanth Venkateswara 与 Murray Patterson 等研究人员于2026年发布了 CHIMERA-Bench v1.0,旨在填补这一空白。该数据集由2,922个经过严格筛选的抗体-抗原复合物组成,涵盖2,721个PDB结构,并基于表位分组、抗原折叠与时间划分构建了三种独立的数据划分,为评估模型在未见表位模式下的表现提供了标准化平台。CHIMERA-Bench 的发布为表位特异性抗体序列-结构协同设计研究树立了新的标杆,对推动精准免疫治疗与蛋白质工程领域的发展具有重要影响力。
当前挑战
CHIMERA-Bench 所面临的挑战首先体现在领域问题层面:现有抗体设计方法普遍难以在表位特异性约束下同时优化CDR的序列与结构,导致生成的抗体虽然整体结构合理,却无法精确识别目标表位,这构成了评估模型真实泛化能力的核心瓶颈。其次,在数据集构建过程中,研究人员需应对多重技术挑战,包括从PDB中筛选分辨率优于4.0 Å的高质量复合物、定义4.5 Å接触截断以准确标注表位与互补位残基、处理不同编号方案(IMGT与Chothia)间的兼容性,以及剔除与预训练语言模型训练数据存在重叠的59个污染复合物。此外,为提升基准的实用性,还需为每个复合物预计算包含原子坐标、表面几何与化学特征在内的丰富张量表示,这要求平衡计算资源消耗与数据完备性。
常用场景
经典使用场景
在抗体设计与结构生物学领域,CHIMERA-Bench数据集被广泛用于评估和比较表位特异性抗体互补决定区(CDR)序列与结构协同设计方法的性能。该数据集提供了2,922个抗体-抗原复合物结构,涵盖IMGT和Chothia两种编号方案,并预计算了包括原子坐标、表面几何特征和化学特征在内的丰富张量表示。研究者通常利用其三种划分策略——表位分组、抗原折叠和时间分割——来系统检验模型在未见表位模式、全新抗原折叠以及前瞻性场景下的泛化能力。经典使用范式涉及在给定的抗原结构条件下,同时预测CDR环的氨基酸序列与三维构象,并通过序列恢复率、结构RMSD、界面接触精度以及表位特异性F1分数等多维度指标进行全面评估。
解决学术问题
CHIMERA-Bench数据集系统性地解决了抗体设计领域长期存在的基准不统一与评估碎片化问题。此前,不同研究采用各自构建的小规模私有数据集,导致方法间的比较缺乏公平性与可重复性。该数据集通过提供标准化处理流程、统一的接触截断距离(4.5 Å)和分辨率筛选标准(4.0 Å),为学术社区建立了可复现的评估框架。更重要的是,它引入了表位特异性评估指标EpiF1,突破了传统仅关注CDR序列恢复率的局限,推动研究焦点从单纯的结构模仿转向对功能性表位-互补位相互作用的理解。此外,数据集内置的污染审计机制能够量化预训练语言模型与测试集之间的重叠程度,为公正评估深度学习方法的真实泛化能力提供了关键保障。
衍生相关工作
CHIMERA-Bench的发布催生了多项具有影响力的后续研究工作。其基线评估中涵盖的11种方法覆盖了从自回归序列生成、扩散模型到基于能量的优化等六大范式,为后续方法创新提供了全面的性能参照。基于该基准,研究者进一步发展了条件生成模型,将表位表面几何信息作为引导信号融入CDR环的联合建模过程。部分工作探索了将预训练蛋白质语言模型与几何深度学习架构相结合的策略,利用数据集提供的预计算表面特征来增强模型对表位-互补位界面的感知能力。此外,该数据集的污染审计结果引发了关于训练数据泄漏问题的深入讨论,推动了更严格的基准构建规范,例如在PDB时间戳划分基础上引入非冗余结构聚类策略,以确保评估结果的科学严谨性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务