遇见数据集

colabfit/OC22-IS2RE-Train

收藏
Hugging Face2025-11-18 更新2025-10-25 收录
官方服务:

资源简介:

OC22-IS2RE-Train是一个用于初始结构到松弛总能量的训练配置数据集,它是Open Catalyst 2022数据库的一部分,包含预测氧化物表面催化反应的训练轨迹。

Training configurations for the initial structure to relaxed total energy (IS2RE) task, part of the Open Catalyst 2022 database containing training trajectories for predicting catalytic reactions on oxide surfaces.

提供机构:
colabfit
搜集汇总
数据集介绍
colabfit/OC22-IS2RE-Train 数据集图片
构建方式
OC22-IS2RE-Train数据集专为初始结构到弛豫总能量(IS2RE)任务而构建,旨在弥补OC20数据集未涵盖氧化物表面的不足。该数据集源自Open Catalyst 2022(OC22)项目,通过收集氧化物表面催化反应的训练轨迹生成。数据以Parquet格式存储,包含约786万种独特的分子构型,总计超过6.33亿个原子,涵盖Ag、Al、Au、C、H、O等57种元素。构建过程中,每条构型记录均包含完整的结构信息、计算出的能量与原子受力属性,并按照ColabFit Exchange标准进行格式化与整理,确保数据的一致性与可复用性。
特点
该数据集的核心特点在于其专注于氧化物表面的催化反应预测,为机器学习原子间势能(MLIP)和分子动力学模拟提供高质量训练数据。数据集规模宏大,构型数量与原子总数均达到百万级,元素覆盖广泛,能够支持多组分复杂体系的研究。每个构型均提供能量与原子受力两项关键物理属性,便于直接用于回归与力场训练任务。此外,数据集采用Parquet格式存储,支持高效读取与处理,并配套提供了聚合信息文件(ds.parquet)与构型集映射,便于用户按需筛选与分组分析。
使用方法
用户可通过HuggingFace平台直接加载该数据集,默认配置(default)读取co/目录下的所有Parquet文件,每个文件包含构型的结构、属性与元数据。info配置则提供ds.parquet中的聚合数据集信息。对于高级使用,ColabFit Exchange提供了详细的Parquet解析示例代码与模式文档,涵盖数据集信息、构型、构型集及其映射的读写方法。用户可依据文档中的schema定义,灵活提取特定元素或属性子集,或利用构型集映射进行分组训练与验证。建议结合PyTorch、TensorFlow等框架进行模型开发,并参考OC22原始文献以复现基准实验。
背景与挑战
背景概述
在催化科学领域,氧化物表面上的反应机制研究对于清洁能源和化工过程至关重要。OC22-IS2RE-Train数据集由Richard Tran、Janice Lan、Muhammed Shuaibi等研究人员于2023年创建,作为Open Catalyst 2022(OC22)项目的一部分,旨在填补OC20数据集中氧化物表面数据的空白。该数据集专注于初始结构到弛豫总能量(IS2RE)预测任务,包含超过780万种独特分子构型和6.3亿个原子,覆盖57种元素,为机器学习原子间势(MLIP)和分子动力学模拟提供了丰富资源。其发布依托于ColabFit平台,通过CC-BY-4.0许可开放共享,显著推动了催化反应预测领域的发展,成为连接计算化学与人工智能的关键桥梁。
当前挑战
OC22-IS2RE-Train数据集面临的核心挑战在于解决氧化物表面催化反应预测的复杂性,相较于金属表面,氧化物表面存在更多样的吸附位点和电荷转移效应,使得能量和原子力的精确建模极具难度。构建过程中,研究人员需从海量密度泛函理论(DFT)计算中提取高质量训练轨迹,应对数据异构性(如不同氧化物晶相和缺陷结构)带来的标注一致性难题。此外,数据规模庞大(近800万构型)对存储、索引和分布式处理提出技术挑战,而Parquet格式的分区设计虽优化了访问效率,但如何确保子集(如co/目录)在模型训练中的代表性,仍是平衡计算资源与预测精度的关键障碍。
常用场景
经典使用场景
OC22-IS2RE-Train数据集的核心用途在于为初始结构到弛豫总能量(IS2RE)任务提供大规模、高质量的机器学习训练配置。该数据集作为Open Catalyst 2022(OC22)项目的重要组成部分,专门聚焦于氧化物表面催化反应的预测,弥补了其前身OC20未涵盖氧化物表面的空白。研究者常利用该数据集训练图神经网络或等变模型,以学习从初始原子构型到最终弛豫态能量的映射关系,从而高效筛选具有潜在催化活性的材料。由于数据集包含近八百万个独特的分子配置和超过六亿个原子,覆盖了57种元素,其多样性和规模使其成为开发通用型原子间势函数(MLIP)的理想基准。经典应用包括训练用于催化反应模拟的力场模型,以及验证能量预测的精度与泛化能力。
衍生相关工作
OC22-IS2RE-Train衍生了一系列具有影响力的研究工作,推动了计算催化与机器学习交叉领域的发展。其中,基于该数据集训练的GemNet-OC等图神经网络模型在OC22基准测试中取得了领先性能,验证了等变消息传递机制在能量预测中的有效性。此外,研究者利用该数据集开发了多任务学习框架,同时预测能量、力和弛豫路径,显著提升了模型效率。该数据集也被用于构建迁移学习基线,探索从OC20到OC22的跨数据集知识迁移策略。在方法论层面,相关工作围绕不确定性量化、主动学习以及构型采样优化展开,进一步提升了机器学习势函数的鲁棒性与数据利用效率。
数据集最近研究
最新研究方向
在催化科学与计算材料学的前沿交叉领域,OC22-IS2RE-Train数据集的推出标志着对氧化物表面催化反应机理的探索迈入新阶段。该数据集聚焦于从初始结构到弛豫总能量的预测任务,通过包含超过780万种独特的分子构型和近6.34亿个原子,系统性地覆盖了56种元素,为机器学习原子间势能模型的训练提供了前所未有的数据基础。当前研究热点集中于利用该数据集开发高精度、可迁移的机器学习力场,以加速氧化物催化剂的设计与筛选。特别是在应对能源转化与环境保护的关键挑战中,如电化学水分解、二氧化碳还原等反应,OC22-IS2RE-Train有效弥补了此前OC20数据集缺乏氧化物数据的空白,推动了从理论计算到实验验证的闭环优化。其大规模、高质量的训练配置和能量-力信息,正成为推动多尺度模拟与人工智能驱动催化研究范式变革的核心引擎。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务