遇见数据集

geneb-tasks

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

GENEB(基因组嵌入基准)是一个用于评估DNA序列编码器的多任务基准测试数据集,旨在通过预计算的表示和逻辑回归(无需在任务标签上对编码器进行微调)来评估模型在基因组功能预测任务上的性能。该数据集包含13个功能类别共计100个不同的分类任务,涵盖组蛋白修饰、启动子、增强子、DNA甲基化、剪接位点、长链非编码RNA、小鼠增强子、转录因子结合、物种分类、调控元件、病毒/噬菌体、编码/非编码区以及染色质可及性等多个基因组功能领域。每个数据样本包含一个DNA核苷酸序列(由A、C、G、T组成)和一个对应的离散类别标签。数据集严格按照基准测试协议组织,仅提供训练集和测试集划分,用于模型表示能力的离线和少样本评估,评估采用统一的协议,使用逻辑回归作为探针分类器,以马修斯相关系数(MCC)为主要评估指标,并报告准确率(Acc)和F1分数。

GENEB (Genomic Embedding Benchmark) is a multi-task benchmark dataset for evaluating DNA sequence encoders. It aims to assess model performance on genomic function prediction tasks through pre-computed representations and logistic regression (without fine-tuning the encoder on task labels). The dataset includes 100 distinct classification tasks across 13 functional categories, covering various genomic function domains such as histone modifications, promoters, enhancers, DNA methylation, splice sites, long non-coding RNAs, mouse enhancers, transcription factor binding, species classification, regulatory elements, viruses/phages, coding/non-coding regions, and chromatin accessibility. Each data sample consists of a DNA nucleotide sequence (composed of A, C, G, T) and a corresponding discrete class label. The dataset is strictly organized according to benchmark protocols, providing only training and test splits for offline and few-shot evaluation of model representation capabilities. Evaluation follows a unified protocol using logistic regression as a probe classifier, with Matthews Correlation Coefficient (MCC) as the primary metric, and reports accuracy (Acc) and F1 score.

创建时间:
2026-06-04
原始信息汇总

数据集概述

GENEB (Genomic Embedding Benchmark) 是一个多任务基准数据集,用于评估DNA序列编码器。其核心评估协议基于预计算表示和逻辑回归(不对任务标签进行编码器微调),涵盖100个任务,分属13个功能类别

基本信息

  • 语言:英语
  • 许可证:Apache-2.0
  • 任务类别:文本分类
  • 标签:生物学、基因组学、DNA、基准、DNA语言模型

数据记录结构

每条记录包含两个字段:

  • text:核苷酸序列(DNA,碱基为{A, C, G, T}),具体长度和窗口定义由源任务决定。
  • label:对应检测或预测目标的离散类别标签。

每个任务的数据分为训练集和测试集,分别存储在 train.csvtest.csv 文件中。

评估协议

项目 规范
任务数量 100
功能类别 13
报告机制 full(全样本)、10shot(10样本)、1shot(1样本)
评估指标 MCC(主要指标)、准确率(Acc)、F1分数
探针模型 逻辑回归(max_iter=1000
随机种子 13, 17, 42, 123, 997(取多次运行的平均值)

参与者需直接使用已发布的数据集划分,不允许重新标注、重新划分或在测试集上进行训练。

任务类别与分布

类别 任务数
组蛋白修饰 (Histone Mod.) 30
启动子 (Promoters) 22
增强子 (Enhancers) 8
DNA甲基化 (DNA Methyl.) 8
剪接位点 (Splice Sites) 7
长链非编码RNA (lncRNA) 6
小鼠增强子 (Mouse Enh.) 5
转录因子结合 (TF Binding) 5
物种分类 (Species Clf.) 3
调控元件 (Regulatory) 2
病毒/噬菌体 (Virus/Phage) 2
编码/非编码 (Coding/NC) 1
染色质可及性 (Chromatin Acc.) 1

主要配置(子集)示例

数据集包含多个配置(config_name),以下为部分配置及其对应的任务标识符和类别:

配置名称 任务标识符 类别
NT_H3 InstaDeepAI_nucleotide_transformer_downstream_tasks_H3 组蛋白修饰
NT_promoter_all InstaDeepAI_nucleotide_transformer_downstream_tasks_promoter_all 启动子
NT_enhancers InstaDeepAI_nucleotide_transformer_downstream_tasks_enhancers 增强子
4mC_A.thaliana_4mC deep4mc_A.thaliana_4mC DNA甲基化
NT-rev_splice_sites_all InstaDeepAI_nucleotide_transformer_downstream_tasks_revised_splice_sites_all 剪接位点
GB_human_ensembl_regulatory katarinagresova_Genomic_Benchmarks_human_ensembl_regulatory 调控元件
GUE_human_tf_0 leannmlindsey_GUE_human_tf_0 转录因子结合

任务分类说明

数据集中的任务根据其生物学功能进行分类,例如:

  • 组蛋白修饰:包括不同类型的组蛋白修饰任务,如 NT_H3NT_H3K4me3 等。
  • 启动子:包括不同生物体或不同特征的启动子预测任务,如 NT_promoter_alliPro_Arabidopsis_NonTATA 等。
  • 增强子:包括预测增强子及其类型的任务。
  • DNA甲基化:包括预测不同位点(如4mC、5mC、6mA)甲基化状态的任务。
  • 其他类别:还包括剪接位点、长链非编码RNA、转录因子结合位点、物种分类等多种基因调控相关任务。
搜集汇总
数据集介绍
geneb-tasks 数据集图片
构建方式
geneb-tasks数据集是Genomic Embedding Benchmark(GENEB)基准测试的核心组成部分,旨在系统评估DNA序列编码器的性能。该数据集汇聚了来自多个上游开源资源的100项标准分类任务,涵盖组蛋白修饰、启动子、增强子、DNA甲基化、剪接位点、长链非编码RNA、转录因子结合等13个功能类别。每项任务均提供独立的训练集和测试集,样本以核苷酸序列(text)与离散类别标签(label)成对呈现,序列长度和窗口设定遵循源任务原始规范。数据按config_name组织为多个子集,方便用户按需加载特定任务。
特点
该数据集最显著的特征在于其广泛的任务覆盖度和标准化的评估协议。100项分类任务均匀分布于13个功能基因组学领域,从经典的组蛋白修饰检测到前沿的长链非编码RNA分类,实现了对DNA语言模型多维度能力的全面检验。评估采用逻辑回归作为探针模型,直接利用预计算表征进行训练,无需对编码器进行微调,从而剥离了下游任务对模型权重的影响。报告指标以马修斯相关系数(MCC)为主,辅以准确率(Acc)和F1分数,并涵盖全样本、10样本和1样本三种数据稀疏性场景,通过多次随机种子的均值结果确保评测稳健性。
使用方法
用户可通过HuggingFace Datasets库按config_name和split(train/test)加载对应子集,或借助官方提供的同步脚本将数据批量下载至本地。每项任务的数据以CSV格式存储,包含text和label两列,便于快速集成至各种DNA编码器的评估管线。基准测试推荐使用指定的逻辑回归参数(max_iter=1000)和五个固定随机种子(13, 17, 42, 123, 997)进行多次重复实验,并禁止对测试集进行重新标注或分割,以确保结果可复现且可比。详细评估框架和提交规则已托管于GENEB的GitHub仓库。
背景与挑战
背景概述
GENEB(Genomic Embedding Benchmark)是由DeepPavlov研究团队于2024年创建的多任务基因组序列分类基准数据集,旨在系统评估DNA序列编码器的表征学习能力。其核心研究问题在于:如何在不对编码器进行下游任务微调的前提下,仅通过预计算表征和逻辑回归分类器,统一衡量编码器在100个序列分类任务上的泛化性能,覆盖组蛋白修饰、启动子、增强子、DNA甲基化、剪接位点等13个功能类别。该数据集融合了Nucleotide Transformer、GUE、Plant Genomic Benchmark等多个权威来源的任务数据,为基因组语言模型的公平对比提供了标准化协议(包括全量、10样本和1样本三种评估设置)。GENEB的出现填补了该领域缺乏大规模跨任务统一评估基准的空白,对推动DNA语言模型的设计与选型具有深远影响。
当前挑战
该数据集面临的挑战涵盖领域问题和构建过程两个层面。在领域问题方面,GENEB专注于解决基因组序列编码器的可迁移性评估难题,现有方法多依赖微调范式,难以孤立度量编码特征本身的质量,而GENEB采用固定表征加逻辑回归的评估策略,对编码器在低资源场景(如1样本或10样本学习)下的泛化能力提出了严苛考验。在构建过程中,面临的主要挑战包括:聚合来自不同来源、不同格式和不同标签体系的已有任务,需要统一32位序列标识片段与标签映射,同时排除原始发布中可能存在的验证集和开发集,以避免数据泄露;此外,确保100个任务在训练/测试划分上与原协议保持一致,并设计跨源任务(如Histone Modification涵盖NT、NT-rev和GUE-emp三个子集)的标准化集成,其复杂性和协调工作构成了技术与非技术层面的双重困难。
常用场景
经典使用场景
在功能基因组学与计算生物学的交汇地带,GENEB数据集以其跨越13个功能类别、涵盖100项分类任务的庞大规模,成为评估DNA序列编码器性能的权威基准。其经典使用场景聚焦于对预训练的DNA语言模型进行无微调评估,即通过逻辑回归探针在预先计算的序列表示上完成转录起始位点鉴定、组蛋白修饰状态判别、剪接位点识别等核心任务。研究者利用该数据集可直接比较不同模型在相同协议下的表示质量,从而衡量模型对基因组调控语法的理解深度。
衍生相关工作
围绕GENEB数据集已涌现出一系列开创性工作。Nucleotide Transformer系列模型率先在此基准上完成系统性评估,揭示了DNA语言模型在不同组蛋白修饰任务上的表示差异。随后,植物基因组基准(PGB)中的多个任务被纳入GENEB框架,使得跨物种调控元件预测成为可能。iPro-WAEL与iDNA-ABF等深度学习方法的提出,进一步将注意力机制与进化信息融合,在启动子与DNA甲基化位点识别任务上刷新了纪录。该数据集亦催生了GUE(Genomic Understanding Evaluation)系列,其通过对小鼠增强子与人类转录因子结合位点的精细评估,完善了基因组编码器的评估生态。
数据集最近研究
最新研究方向
在基因组学与深度学习交叉的前沿领域,DNA序列编码器的评估正迈向标准化与多任务化。GENEB(Genomic Embedding Benchmark)作为一项突破性工作,汇聚了涵盖组蛋白修饰、启动子、增强子、DNA甲基化、剪接位点等13个功能类别的100项分类任务,构建了迄今为止最为全面的DNA序列表示学习评测体系。其核心创新在于采用预计算表征结合逻辑回归的零样本/少样本评估协议,杜绝了针对特定任务微调带来的信息泄漏,极大地提升了模型泛化能力的可比性。该基准的建立正值DNA语言模型(如Nucleotide Transformer、GUE等)蓬勃发展的关键时期,通过统一的MCC指标和在完整、十样本、一样本三种数据丰度下的严苛测试,GENEB为定量解析不同预训练策略在非编码调控元件识别、表观遗传修饰预测等热点问题上的真实效能提供了权威标尺,对推动计算基因组学从模型竞赛迈向科学发现具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务