CGBENCH
收藏资源简介:
CGBENCH是一个大规模基准测试,用于评估语言模型在临床遗传学中识别和分类科学证据的能力。它源自ClinGen的证据存储库,其中包含数千个基因和变异注释的专家审核。CGBENCH汇集了来自ERepo、VCI标准规范注册表和GCI实践标准中的元素,并将其汇集为LM提示的单一输入。CGBENCH由三个主要任务组成:证据评分、证据验证和证据提取,旨在帮助变异和基因的审查过程。
CGBENCH is a large-scale benchmark developed to evaluate the capacity of language models to identify and classify scientific evidence in clinical genetics. It is derived from the ClinGen evidence repository, which houses expert-curated annotations for thousands of genes and variants. CGBENCH integrates elements from ERepo, the VCI Standard Specification Registry, and the GCI Practice Standards, and unifies these components into a single input for LM prompting. Comprising three primary tasks: evidence scoring, evidence validation, and evidence extraction, CGBENCH aims to facilitate the review process for genetic variants and genes.
CGBench数据集概述
数据集基本信息
- 数据集名称:CGBench
- 主要用途:用于评估语言模型在科学推理方面的能力
- 数据来源:基于ClinGen(clinicalgenome.org)临床遗传学知识库
核心功能
- 评估语言模型从科学文献中提取、解释和说明细粒度结果的能力
- 包含三个独立任务:
- VCI证据评分
- VCI证据验证
- GCI证据提取
评估方法
- 基于分类的指标
- 语言模型作为评判者的方法
- 全面评估语言模型性能
数据获取
- 下载地址:https://huggingface.co/datasets/owencqueen/cgbench_data
任务对应脚本位置
- VCI证据评分:
clingen_vci/evidence_scoring/ - VCI证据验证:
clingen_vci/evidence_sufficiency/ - GCI证据提取:
clingen_gci/

- 1CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research斯坦福大学 · 2025年



