遇见数据集

jellyho/droid_merged_skills_picking

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Merged DROID Skill Dataset: picking 是一个合并的机器人技能数据集,专门针对拾取(picking)任务。它整合了经过语言筛选的DROID技能子集和针对同一技能新收集的环境数据。数据集包含来自两个来源的301个episodes(其中300个来自droid_subsets_picking,1个来自droid_pick_carrot),总计58869帧和302个唯一任务。数据格式标准化为8维向量:观测状态包括7个关节位置和夹爪位置,动作包括7个关节速度和夹爪位置。数据集提供视频数据(如手腕左侧和侧视图视频),并包含多种拾取任务示例,例如拾取胡萝卜、从盒子中取出紫色标记并放在柜台上等。文件结构包括元数据JSON文件、Parquet数据文件、MP4视频文件以及汇总文件,适用于机器人学习和技能训练。

The Merged DROID Skill Dataset: picking is a merged robotics skill dataset focused on the picking task. It combines a language-filtered DROID skill subset with newly collected environment data for the same skill. The dataset includes 301 episodes (300 from droid_subsets_picking and 1 from droid_pick_carrot), totaling 58,869 frames and 302 unique tasks. The data format is standardized as 8-dimensional vectors: observation state includes 7 joint positions and gripper position, while action includes 7 joint velocities and gripper position. The dataset provides video data (e.g., wrist left and side view videos) and contains examples of various picking tasks, such as Pick up the carrot, Remove the purple marker from the box and put it on the counter, etc. The file structure includes metadata JSON files, Parquet data files, MP4 video files, and summary files, suitable for robotics learning and skill training.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/droid_merged_skills_picking 数据集图片
构建方式
在机器人操作领域,技能特定数据集的构建对于提升模型的表现至关重要。droid_merged_skills_picking数据集通过将经过语言筛选的DROID技能子集与针对同一技能新采集的环境数据进行合并,形成了一个更为丰富和专注的数据集合。具体而言,该数据集融合了来自jellyho/droid_subsets_picking的300个演示片段和jellyho/droid_pick_carrot的1个演示片段,共计301个演示片段。所有数据均经过标准化处理,确保状态和动作信息以统一的8维向量形式呈现,从而便于下游模型的训练与应用。
特点
该数据集的核心特点在于其针对“拾取”(picking)这一特定技能的专注性。数据集包含301个演示片段,共计58,869帧图像,覆盖302个独特的任务指令,展现了多样化的拾取场景。每个演示片段均包含8维的状态和动作向量,其中状态由7个关节位置和1个夹爪位置组成,动作则由7个关节速度和1个夹爪位置构成。此外,数据集提供了两个视角的视频记录,即左腕相机和左侧侧视相机,共计602个视频文件,为算法提供了丰富的视觉信息。这种多模态的数据结构使得模型能够同时学习运动控制和视觉感知能力。
使用方法
研究人员可以方便地利用该数据集进行机器人拾取技能的学习与评估。数据集以LeRobot框架支持的标准格式存储,包含元数据、任务、演示片段统计以及Parquet格式的数据文件和MP4格式的视频文件。使用时,用户可通过加载相应的配置文件(如default)来访问数据。由于动作空间被定义为关节速度和夹爪位置的组合,模型能够直接学习低层的控制指令。同时,数据集中保留的详细列信息,如关节位置、关节速度和夹爪位置,允许研究者根据需求灵活选择不同的表示方式,从而支持从运动规划到端到端模仿学习等多种研究范式。
背景与挑战
背景概述
在具身智能与机器人操作领域,大规模、多模态数据集的构建是推动技能泛化与策略学习的关键。DROID数据集是由纽约大学、谷歌DeepMind等机构合作开发的大规模机器人操作数据集,收集了数千小时的真实遥操作数据,覆盖广泛的物体与场景。droid_merged_skills_picking数据集创建于2024年,由研究员Jelly Ho主导,隶属于LeRobot开源机器人学习框架。该数据集融合了语言过滤后的DROID拾取技能子集与自采集的特定环境数据,旨在提升机器人拾取动作的泛化能力与数据多样性。通过标准化8维动作空间和统一的状态表征,该数据集为基于视觉-动作联合建模的机器人学习提供了高质量的数据基础,对推动少样本技能迁移和任务自适应策略研究具有重要价值。
当前挑战
该数据集面临的核心挑战在于解决领域问题与构建过程的双重复杂性。领域层面,拾取任务虽看似基础,却需应对物体形状、材质、光照及背景的极大变化,现有数据驱动方法在跨场景泛化上仍显不足,且传感器噪声与机械臂动力学差异易导致策略失效。构建层面,原始DROID子集与新增数据的动作空间定义存在差异(前者使用joint_velocity和gripper_position,后者需从观测中推导),需精心对齐以确保一致性;此外,新采集数据仅包含1个episode,显著加剧了数据不平衡问题,对小样本学习与长尾分布的鲁棒性提出更高要求。多源数据的融合、标注的标准化以及视频与状态信息的同步校准,也构成了工程落地的关键瓶颈。
常用场景
经典使用场景
在机器人学习领域,droid_merged_skills_picking数据集专为抓取操作技能的学习与泛化而设计。其经典使用场景涵盖基于视觉的机器人抓取策略训练,利用包含301个示范片段、58869帧的多视角视频与状态-动作序列,研究者可构建从图像输入到关节速度与夹爪位置输出的端到端映射模型。数据集统一了8维状态与动作空间,支持模仿学习与强化学习范式,尤其适用于学习复杂环境下的精准抓取动作,如从容器中拾取物件、移除盖子或转移物体等多样化任务。
衍生相关工作
该数据集衍生出多项开创性研究工作,包括基于扩散策略的抓取轨迹生成模型,利用其多示范数据学习随机性动作分布;以及结合视觉语言模型的指令跟随技能学习框架,将任务字符串直接映射至动作序列。后续工作还探索了技能融合方法,将‘拾取’动作与其他技能如‘放置’‘旋转’相结合,构建层次化操作库。在数据效率提升方面,衍生出基于预训练表征的少样本模仿学习算法,仅需该数据集的少量示范即可泛化至新物体与新场景。
数据集最近研究
最新研究方向
该数据集聚焦于机器人技能学习中的“拾取”(picking)任务,通过融合来自DROID子集(300条数据)与新采集环境数据(1条数据,如“捡起胡萝卜”),构建了一个包含301条示范轨迹的高质量训练集。在具身智能与模仿学习的前沿探索中,这种跨来源、跨环境的技能数据整合策略,旨在提升机器人对拾取动作的泛化能力,特别是应对复杂场景下的细粒度操作需求。数据集标准化了8维联合速度与夹爪位置的动作表示,便于主流算法直接微调。其发布标志着社区从大规模静态数据集向零样本或少样本适应新物体的动态技能库演变,为家庭服务、工业分拣等真实世界应用提供了关键基础,推动了机器人从特定任务执行向通用操作能力的跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务