ATLAS
收藏资源简介:
ATLAS是一个高难度、多学科的基准测试,旨在评估大型语言模型的前沿科学推理能力。它包含800多个原创高质量问题,涵盖数学、物理、化学、生物、计算机科学、地球科学和材料科学等7个核心科学领域,由25+领先机构的博士级专家贡献,具有高保真答案和防污染特性。
ATLAS is a high-difficulty, multi-disciplinary benchmark designed to evaluate the cutting-edge scientific reasoning capabilities of large language models (LLMs). It includes over 800 original, high-quality questions spanning seven core scientific disciplines: mathematics, physics, chemistry, biology, computer science, earth science, and materials science. These questions are contributed by doctoral-level experts from more than 25 leading institutions, and the benchmark features high-fidelity answers and contamination-resistant properties.
ATLAS 数据集概述
基本信息
- 数据集名称: ATLAS (AGI-Oriented Testbed for Logical Application in Science)
- 许可证: CC BY-NC-SA 4.0
- 访问地址: https://huggingface.co/datasets/opencompass/ATLAS
- 论文地址: https://arxiv.org/abs/2511.14366
核心特征
- 问题数量: 800+ 原创高质量问题
- 学科领域: 数学、物理、化学、生物、计算机科学、地球科学、材料科学等7个核心科学领域
- 贡献机构: 25+ 领先机构,由顶尖大学和研究机构的博士级专家贡献
- 答案质量: 高保真答案,包含多步推理和LaTeX表达式
- 防污染设计: 通过多轮专家同行评审和对抗性测试进行严格质量控制
数据集结构
数据字段
subject_name: 学科名称(英文)question: 科学问题/问题陈述answer_ideas: 解决问题的推理思路和方法refined_standard_answer: 标准答案列表(可能包含多个子答案)sub_subject_name: 具体子学科
数据划分
| 划分 | 数量 | 用途 |
|---|---|---|
| 验证集 | ~300 | 公开评估,可复现结果 |
| 测试集 | ~500 | 隐藏评估,防污染 |
评估协议
评估框架
- 评估方法: LLM-as-Judge 评估框架
- 默认评估模型: OpenAI-o4-mini
- 可定制性: 支持使用自定义评估模型
评估流程
- 模型推理:生成结构化JSON格式的答案
- 答案提取:从模型输出中解析最终答案
- LLM评判:比较候选答案与标准答案
- 评分计算:计算准确率和pass@k指标
评估指标
- 平均准确率: 所有问题的平均正确率
- mG-Pass@2: 使用2个样本的多数投票准确率
- mG-Pass@4: 使用4个样本的多数投票准确率
性能表现
排行榜亮点(使用OpenAI-o4-mini评估)
| 排名 | 模型 | 机构 | 平均准确率 |
|---|---|---|---|
| 1 | OpenAI GPT-5-High | OpenAI | 42.9% |
| 2 | Gemini-2.5-Pro | 35.3% | |
| 3 | Grok-4 | xAI | 34.1% |
| 4 | OpenAI o3-High | OpenAI | 33.8% |
| 5 | DeepSeek-R1-0528 | DeepSeek AI | 26.4% |
快速开始
安装
bash pip install opencompass
加载数据集
python from datasets import load_dataset dataset = load_dataset("opencompass/ATLAS")
测试集提交
完整测试集提交地址:https://huggingface.co/spaces/opencompass/ATLAS




