RoboBench
收藏资源简介:
RoboBench是一个全面的评估基准,用于评估多模态大型语言模型(MLLM)作为机器人操作中的认知核心。该数据集涵盖了指令理解、感知推理、泛化规划、可利用性预测和故障分析五个维度,共包含14个能力和25个任务,以及6092个问答对。数据集来源于大规模真实机器人数据集和内部收集,确保了任务的现实性和多样性。
RoboBench is a comprehensive evaluation benchmark for assessing multimodal large language models (MLLMs) as the cognitive core in robotic manipulation. This dataset encompasses five core dimensions: instruction understanding, perceptual reasoning, generalized planning, affordance prediction and failure analysis, comprising a total of 14 capabilities, 25 tasks and 6092 question-answer pairs. The dataset is sourced from large-scale real-world robotic datasets and internally curated data, ensuring the realism and diversity of the included tasks.
RoboBench 数据集概述
数据集简介
RoboBench 是一个针对多模态大语言模型作为具身大脑的综合性评估基准,系统性地评估模型在机器人操作任务中的认知能力。
核心维度
- 指令理解:评估模型对显式和隐式指令的理解能力
- 感知推理:涵盖机器人中心、物体中心、场景中心和任务中心的推理能力
- 泛化规划:评估跨具身、跨物体、跨视角和跨任务的规划能力
- 功能预测:包括静态、动态和导航功能预测
- 失败分析:分析执行失败和规划失败的原因
数据集规模
- 5个核心维度
- 14种能力
- 25种任务类型
- 6092个高质量问答对
数据来源
- 基于最新的开源真实机器人数据集
- 专有真实世界数据
- 涵盖多样化的具身配置、属性丰富的物体、多视角场景和记忆驱动的导航
评估方法
- 所有问题都经过人工验证以确保质量和一致性
- 长时程任务规划采用有向无环图引导的方法进行评估
- 规划评估使用基于MLLM的世界模拟器来评估具身可行性
数据构建流程
- 预处理开源和自收集的机器人数据
- 工具辅助和人在回路的标注
- 统一模式下的自动生成问答
- 构建五个维度的数据集
数据格式
- 遵循统一模式
- 渲染为二元选择、单选和多步多选问答格式
- 适用于开源和闭源MLLMs的评估
相关资源
- 论文地址:https://arxiv.org/abs/2510.17801
- 数据集和代码已发布

- 1Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain北京大学 · 2025年



