遇见数据集

LiteFold/InterPro

收藏
Hugging Face2026-05-27 更新2026-06-21 收录
官方服务:

资源简介:

InterPro Entries数据集整合了来自多个成员数据库的蛋白质家族、结构域、重复序列和功能位点特征,用于对蛋白质序列进行分类和注释。该数据集包含了InterPro数据库中的条目信息,涵盖不同类型的蛋白质特征分类,如家族、结构域、同源超家族、保守位点、重复序列、活性位点、结合位点以及翻译后修饰位点等。数据集还提供了与基因本体(GO)的映射关系、蛋白质数据库(PDB)结构链接、相关出版物信息以及分类学分布数据,支持生物信息学研究和蛋白质功能分析。

InterPro integrates protein family, domain, repeat, and functional-site signatures from multiple member databases to classify and annotate protein sequences.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/InterPro 数据集图片
构建方式
InterPro数据集整合了多个成员数据库中的蛋白质家族、结构域、重复序列及功能位点特征,以对蛋白质序列进行分类与注释。该数据集基于InterPro条目构建,采用确定性分割策略,即通过SHA-256哈希函数对InterPro标识符进行哈希运算后取模10,结果0划分为测试集,1至9划分为训练集。数据集包含51,489个条目,涵盖InterPro 108.0版本(2026年1月29日发布),并存储为Parquet格式文件,便于高效读写。
使用方法
用户可通过Hugging Face Datasets库便捷加载数据,使用`load_dataset`函数即可获取训练集与测试集。支持流式加载以处理大规模数据,避免一次性下载全部表格。此外,用户可利用`filter`功能高效筛选具有GO映射或PDB结构的特定条目。对于底层数据库元数据,可通过`huggingface_hub`库直接下载Parquet格式的元数据文件,结合Pandas进行解析与分析,支持灵活的数据探索与定制化研究。
背景与挑战
背景概述
蛋白质家族与结构域的分类与功能注释是后基因组时代计算生物学的一项核心任务。InterPro作为国际知名的蛋白质序列分类与注释资源,整合了来自Pfam、SMART、PROSITE等18个成员数据库的家族、结构域、重复序列及功能位点特征信息,为蛋白质功能的系统化理解提供了统一且可靠的语义框架。该数据集由LiteFold团队于2026年1月发布,基于InterPro 108.0版本,收录了51,489条条目,涵盖了从家族、结构域到超家族、保守位点及结合位点等多种条目类型。作为连接序列与功能的桥梁,InterPro数据集在蛋白质功能预测、进化分析及结构基因组学研究中发挥着不可替代的作用,其影响力已延展至基因本体(GO)映射与蛋白结构注释等多个前沿领域。
当前挑战
在当前蛋白质大数据爆炸式增长的背景下,InterPro数据集面临的核心挑战在于如何持续提升注释质量与覆盖广度。其一,跨膜蛋白、固有无序蛋白等复杂区域的识别仍高度依赖人工校验,现有自动流程难以捕捉精细功能位点。其二,来自不同成员数据库的签名信息在特异性与灵敏度上存在显著差异,整合过程需应对语义冲突与冗余。此外,构建过程中需从庞大的XML文件中高效解析层次关系、GO映射、PDB结构及文献引用等多维元数据,保证数据一致性与版本可追溯性。同时,随着ILM(大语言模型)生成条目逐步纳入数据库,如何自动化评估并审核这些条目的可靠性,亦成为亟待解决的难题。
常用场景
经典使用场景
在蛋白质组学与计算生物学研究中,InterPro数据集作为统一的蛋白质家族、结构域及功能位点注释资源库,被广泛用于蛋白质序列的自动功能分类与结构解析。研究者通过加载该数据集的训练与测试分割,可高效获取包含跨膜域、激酶结构域等特征的标注条目,并结合基因本体映射与蛋白质计数等统计信息,开展大规模蛋白质功能预测模型的构建与评估。其标准化的条目标识符与确定性划分方式,为可重复性实验设计提供了坚实基础。
解决学术问题
该数据集有效解决了蛋白质功能注释碎片化与跨数据库整合困难的核心学术问题。通过整合来自多个成员数据库的家族、结构域、重复序列及功能位点签名,InterPro将分散的蛋白质特征信息统一为层次化本体结构,使得研究者能够系统性地分析蛋白质间的进化关系与功能趋同现象。它支撑了自动功能推断、结构域组合规律发现以及跨物种蛋白质比较基因组学等前沿方向,为解析未表征蛋白质的生物学角色提供了关键数据桥梁,显著推动了后基因组时代功能基因组学的进展。
实际应用
在实际应用中,InterPro数据集被深度嵌入到药物靶点发现与生物工程改造的流程中。科研人员利用其丰富的蛋白质-结构映射与公开出版物链接,筛选特定疾病相关的家族与结构域作为候选靶标,加速抗体设计与小分子抑制剂开发。同时,在合成生物学领域,通过查询该数据集的结构域组合与功能位点信息,工程师能够理性设计具有新活性的嵌合蛋白,优化工业酶催化效率。此外,结合GO功能注释,该数据集还服务于农作物的抗逆性改良与微生物代谢通路重构等应用场景。
数据集最近研究
最新研究方向
在蛋白质组学与计算生物学的前沿交叉领域,InterPro数据集的最新研究方向聚焦于利用大规模蛋白质家族与结构域的本体注释体系,推动深度学习模型在蛋白质功能预测与结构解析中的应用。随着2026年发布的第108版整合了超过5.1万个条目并关联3万余个PDB结构,该数据集已成为连接序列、结构与功能的关键桥梁,尤其支撑了基于语言模型(LLM)的蛋白质注释策略的革新。当前热点包括利用其丰富的GO映射与出版物信息,训练可解释的蛋白功能分类器,并探索层级化的家族关系如何提升同源超家族与保守位点的识别精度,进而加速药物靶点发现与酶工程改造。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务