遇见数据集

OmniMatBench

收藏
arXiv2026-05-29 更新2026-06-02 收录
数据链接:
官方服务:

资源简介:

OmniMatBench是由中国科学技术大学、上海人工智能实验室等机构联合构建的多模态材料科学推理基准数据集,旨在系统评估人工智能模型在跨学科材料科学领域的知识应用与工程推理能力。该数据集包含3,171条专家精心策划的问答与计算问题,覆盖19个材料学子领域,数据来源于经典材料学知识资源,并经过多阶段专家验证流程确保科学严谨性。数据集构建过程采用知识-结构-加工-应用(KSPA)框架,通过专家提取、人工标注与自动验证相结合的方式,形成包含问题、证明记录和评分要点的结构化数据。该数据集主要应用于评估多模态大语言模型在材料科学领域的推理能力,解决现有基准在工程应用、公式计算和跨领域知识整合方面的不足,为开发可靠的材料科学研究助手提供关键基准。

OmniMatBench is a multimodal materials science reasoning benchmark dataset jointly constructed by institutions including the University of Science and Technology of China and the Shanghai AI Laboratory, aiming to systematically evaluate the knowledge application and engineering reasoning capabilities of AI models across interdisciplinary materials science fields. This dataset contains 3,171 expert-curated question-answering and computational questions covering 19 sub-fields of materials science. Its data is sourced from classic materials science knowledge resources, and has undergone a multi-stage expert validation process to ensure scientific rigor. The dataset construction follows the Knowledge-Structure-Processing-Application (KSPA) framework, combining expert extraction, manual annotation and automatic verification to form structured data including questions, proof records and scoring rubrics. This dataset is primarily used to evaluate the reasoning capabilities of multimodal large language models in the materials science domain, addressing the shortcomings of existing benchmarks in engineering applications, formula-based calculations and cross-domain knowledge integration, providing a critical benchmark for developing reliable materials science research assistants.

创建时间:
2026-05-28
原始信息汇总

数据集名称

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

核心概述

OmniMatBench 是一个针对材料科学领域设计的多模态推理基准测试集,旨在评估多模态大语言模型(MLLMs)在材料科学中的综合推理能力,填补了现有基准在从材料知识到应用推理方面的空白。

数据集组成

  • 规模与来源:包含 3,171 个由专家精选的问答与计算问题。
  • 覆盖范围:横跨 19 个材料科学子领域,涵盖四大类别:
    • 基础材料知识
    • 结构材料与工程材料
    • 材料加工与制造
    • 功能材料与应用材料

评估结果与发现

  • 模型表现:对 13 个开源和闭源 MLLMs 进行了评估,最佳模型的总体得分仅为 0.372,揭示了当前模型在材料科学推理方面存在显著差距。
  • 具体问题
    • 不同子领域间的表现差异很大。
    • 模型表现出固定的推理启发式策略,材料知识分布不均。
    • 在辅以公式、检索和代码的情况下,对高层知识的应用能力有限。

意义与目的

该基准为评估当前多模态大语言模型在材料科学研究中的能力与局限性提供了关键洞察,并为开发可靠的 AI 助手奠定了基础。

搜集汇总
数据集介绍
OmniMatBench 数据集图片
构建方式
OmniMatBench的构建遵循了一条严谨的多阶段专家协作流程。研究团队首先从经典与常用材料科学知识资源中精选素材,由材料科学专家进行问题提取、领域适配与难度划分。针对每一道候选问题,专家会识别其核心公式、常见错误类型与关键概念,并提炼为评分导向的关键点,同时将问题溯源、改编逻辑与求解过程整理为证明文件。随后,通过大语言模型自动化验证器对题目进行格式一致性、逻辑正确性、冗余控制与质量筛选,仅保留通过自动验证的样本。最终,由材料领域教授与博士研究员组成的人工专家组对幸存题目进行学科相关性、公式准确性、推理有效性与答案一致性的逐项复核,确保每一道纳入基准的题目都具备最高的科学严谨性。
特点
OmniMatBench的核心特点在于其广度与深度的有机结合。该基准覆盖了19个材料科学子领域,横跨基础材料科学、结构与工程材料、材料加工与制造以及功能与应用材料四大范畴,尤其囊括了粉末材料、宝石材料与宝石学、焊接技术与工程、纳米材料与技术等工程应用导向强烈但现有基准普遍缺失的子领域。数据集中包含1,261道开放性问答题与1,910道计算题,问答题配有专家标注的关键点与评分准则,计算题则设计了结构化答案插槽,涵盖公式轨迹、单位要求、数值精度约束与输出格式规范。这种精细化评估设计使得模型在概念识别、公式选择、多模态理解、单位感知计算与答案格式遵从等维度的表现得以被系统性揭露。
使用方法
在OmniMatBench的使用中,问答题采用基于专家标注关键点的精确率、召回率与F1分数进行评分,计算题则严格解析模型输出至结构化插槽并通过精确插槽准确率进行评估,最终综合分数为两者等权平均。研究者可依据评估目标选择零样本推理、公式辅助检索或代码增强推理等不同协议,其中公式辅助设置进一步分为提供真实公式计划的标准上下文与混入干扰公式的检索场景,用以剖析模型在方法级材料知识应用上的能力边界。该基准适用于评测前沿多模态大语言模型在材料科学推理中的知识广度与执行精度,并可靠地揭示了模型在概念理解与科学执行之间的显著鸿沟。
背景与挑战
背景概述
OmniMatBench诞生于多模态大语言模型在科学研究中日益重要的时代背景下,由上海人工智能实验室联合中国科学技术大学、复旦大学等多家机构的研究人员于2026年共同创建。该数据集聚焦于材料科学这一天然具有跨学科、多模态与应用驱动特性的领域,旨在系统评估当前模型在材料科学推理中的真实能力。其核心研究问题在于,现有基准多局限于属性预测、知识问答或表征理解,未能覆盖从材料基础知识到工程应用的完整推理链条。为此,OmniMatBench精心构建了涵盖19个材料学子领域的3,171道专家审核问题,横跨基础材料科学、结构材料、材料加工与制造以及功能材料四大板块,为多模态科学推理研究树立了新的标杆,对推动AI在材料科学领域的可靠应用具有深远影响。
当前挑战
OmniMatBench所面临的挑战首先体现在领域问题的复杂性上:材料科学推理要求模型不仅能回忆知识,还需理解结构-性能关系、掌握加工制造流程并做出应用决策,现有模型在此完整推理链条上表现不佳,最佳模型整体得分仅为0.372。其次,数据集的构建过程本身亦充满挑战,需要汇聚8位博士、60名标注员和5位材料学教授的知识与经验,从经典教材和最新文献中提取并改编问题,确保每一道题目的难度、来源、解答逻辑和评分标准都经过严谨验证。更为棘手的是,评测设计需兼顾开放问答与结构化计算两类任务,前者依赖细粒度评分要点,后者则需精确匹配公式、单位与数值精度,这要求数据集在保持科学严谨性的同时,实现可重复且自动化的评估机制。
常用场景
经典使用场景
OmniMatBench作为材料科学领域首个覆盖知识-结构-加工-应用全链条的多模态推理基准,其最经典的使用场景在于系统评估前沿多模态大语言模型在19个材料学子领域上的综合推理能力。该基准精心设计了3171道专家验证的开放问答与计算题目,横跨基础材料科学、结构工程材料、材料加工制造及功能应用材料四大领域,尤其涵盖了粉末材料、宝石学、焊接技术等传统评估中易被忽视的工程关键方向。研究者通过该数据集可全面度量模型在概念识别、公式选择、多模态定位、单位感知计算及格式化输出等多维度的表现,从而揭示当前模型从科学流畅性到可靠执行之间的真实鸿沟。
实际应用
在实际应用中,OmniMatBench为材料研发智能化提供了关键的验证基石。材料科学领域跨学科、多模态、强应用驱动的特性,使得AI辅助系统必须具备从理论理解到工程决策的连贯推理能力。该数据集模拟了科研人员在材料筛选、工艺优化、性能评估及失效分析等真实工作流中的典型问题,例如基于Ashby图选材、理解双螺杆挤出-注射装置的操作机理、从电阻-时间曲线计算空位迁移活化能等。通过这种贴近工程实践的评估,OmniMatBench能够有效筛选出具备专业材料推理能力的大模型,为材料数据库智能查询、工艺参数推荐、教学辅助系统及跨学科材料设计平台等实际场景部署可信赖的AI引擎提供科学参考。
衍生相关工作
OmniMatBench的提出催生了一系列旨在弥合材料科学推理鸿沟的重要后续工作。基于其揭示的'知识-执行'差距,研究者开始探索公式辅助推理策略,通过向模型提供正确公式计划或含有干扰项的检索增强方案,检验模型从方法层面应用材料知识的能力。与此同时,代码执行增强的研究揭示了单纯提供计算工具无法解决根本瓶颈——模型在将材料问题转化为正确计算程序时仍会失败于参数映射或多模态信息误解。此外,针对该基准中表现出的子领域性能差异,研究者开始构建专门化工科小模型,以期在特定材料场景超越通用模型。这些衍生工作共同推动了从仅关注答案准确率到强调推理过程正确性的评估范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务