ManipBench
收藏资源简介:
ManipBench 是一个用于评估视觉语言模型(VLMs)在机器人低级操作推理能力方面的新颖开源基准。该数据集包含 12617 个多项选择题,涵盖从抓取和放置、关节对象操作、可变形对象操作到动态操作等各种任务。数据集来源于现有的现实世界数据集、内部织物操作设置和模拟数据。该数据集旨在帮助研究者评估 VLMs 在预测机器人动作方面的能力,并确定哪些 VLMs 是机器人代理的最佳选择。
ManipBench is a novel open-source benchmark for evaluating the low-level manipulation reasoning capabilities of vision-language models (VLMs) in robotics. This dataset contains 12,617 multiple-choice questions covering a wide range of tasks, including grasping and placing, articulated object manipulation, deformable object manipulation, and dynamic manipulation. The dataset is sourced from existing real-world datasets, an in-house fabric manipulation setup, and simulated data. This benchmark aims to help researchers evaluate the ability of VLMs to predict robotic actions and determine which VLMs are the optimal choices for robotic agents.
ManipBench 数据集概述
数据集基本信息
- 名称: ManipBench
- 开发目的: 评估视觉语言模型(VLMs)在机器人低层操作推理能力
- 主要特点:
- 专注于机器人精确运动决策的低层推理能力
- 评估对象间交互理解和可变形物体操作能力
- 包含多类别、多维度的评估任务
数据集规模与组成
- 总问题数: 12,596个多选题
- 问题来源分布:
- 公共机器人操作数据集: 9,240题
- 布料操作评估(人工标注): 2,762题
- 现有仿真环境: 775题
问题分类详情
公共机器人操作数据集问题
- 类型1:
- DROID抓取放置任务: 2,020题
- DROID关节操作任务: 1,640题
- Bridge任务: 2,500题
- 类型2:
- DROID抓取放置任务: 1,010题
- DROID关节操作任务: 820题
- Bridge任务: 1,250题
布料操作评估问题
- 任务规划理解: 240题
- 布料状态理解: 234题
- 空间推理能力: 325题
- 关键点映射能力: 312题
- 动作序列时序理解: 240题
- 动作长度理解: 240题
- 逆向动力学理解: 240题
- 布料-刚体交互理解: 282题
- 布料-布料交互理解: 280题
- 反事实理解: 269题
现有仿真环境问题
- 放置胡萝卜(抓取放置任务): 277题
- 关闭抽屉(关节操作任务): 83题
- 拉直绳子(可变形操作任务): 140题
- 清扫物体(工具操作任务): 194题
- 球射击(动态操作任务): 81题
评估范围
- 测试模型: 10个模型家族的33个代表性VLM
- 评估维度: 包含不同模型规模的变体

- 1ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation南加州大学计算机科学系 · 2025年



