遇见数据集

rollout_stackblocks_iter1_rollout

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操作数据集,专注于机器人学任务。数据集包含50个完整的情节(episodes),共计41092个数据帧,涵盖单一任务。数据以Parquet文件格式存储,总数据量约为100MB,视频文件约200MB。数据集的核心内容包括机器人动作指令(6维关节位置:肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、观测状态(与动作相同的6维关节位置)、以及来自顶部摄像头和腕部摄像头的视觉观测(均为480x640分辨率、3通道的RGB视频,以30fps采集,使用AV1编码)。此外,数据集还记录了干预标志、下一时刻任务成功标志、时间戳、帧索引、情节索引、全局索引和任务索引等元数据。机器人平台类型为so_follower。所有数据均被划分为训练集。该数据集适用于机器人模仿学习、强化学习、视觉运动策略学习等研究场景。

This dataset is a robot manipulation dataset created using the LeRobot framework, focusing on robotics tasks. It contains 50 complete episodes, totaling 41092 data frames, covering a single task. The data is stored in Parquet file format, with a total data size of approximately 100MB and video files of about 200MB. The core content of the dataset includes robot action commands (6-dimensional joint positions: shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, gripper position), observation states (the same 6-dimensional joint positions as actions), and visual observations from top and wrist cameras (both 480x640 resolution, 3-channel RGB video, captured at 30fps and encoded with AV1). Additionally, the dataset records metadata such as intervention flags, next-step task success flags, timestamps, frame indices, episode indices, global indices, and task indices. The robot platform type is so_follower. All data is divided into a training set. This dataset is suitable for research scenarios such as robot imitation learning, reinforcement learning, and visual-motor policy learning.

创建时间:
2026-07-13
原始信息汇总

数据集概览

  • 数据集名称: rollout_stackblocks_iter1_rollout
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot

数据集结构

  • 代码基础版本: v3.0
  • 帧率 (FPS): 30
  • 总集数 (Episodes): 50
  • 总帧数 (Frames): 41,092
  • 总任务数 (Tasks): 1
  • 机器人类型: so_follower
  • 数据分割: 训练集 (train) 包含全部 50 个片段(索引 0:50)

特征详情

该数据集包含以下特征,均为浮点型或视频/图像数据:

  • action: 6维浮点数组,表示机器人关节动作(肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)。
  • observation.state: 6维浮点数组,表示机器人关节状态,与动作空间一致。
  • observation.images.top: 顶部摄像头的视频数据,分辨率 480×640,3通道,编码为 AV1,帧率 30 FPS。
  • observation.images.wrist: 腕部摄像头的视频数据,分辨率 480×640,3通道,编码为 AV1,帧率 30 FPS。
  • intervention: 布尔值,表示是否有人工干预。
  • next.success: 布尔值,表示下一个时间步是否成功。
  • timestamp: 浮点数时间戳。
  • frame_index: 帧索引(int64)。
  • episode_index: 片段索引(int64)。
  • index: 全局索引(int64)。
  • task_index: 任务索引(int64)。

数据文件

  • 数据格式: Parquet 文件(路径:data/*/*.parquet
  • 视频格式: MP4 文件(路径:videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 200 MB
  • 分块大小: 1000

创建工具

该数据集使用 LeRobot 创建。

引用信息

当前暂无引用信息(BibTeX 待补充)。

搜集汇总
数据集介绍
rollout_stackblocks_iter1_rollout 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操作任务设计,聚焦于堆叠方块(StackBlocks)的滚动策略。数据通过模拟或真实环境中的So_Follower机器人平台采集,以30帧每秒的频率记录50个完整回合,总计超过4万帧时序数据。每个回合包含机器人6维关节状态(如肩部、肘部、腕部及夹爪位置)作为观察量,并同步记录对应的动作指令,同时提供顶部和腕部两个视角的640×480像素RGB视频流。数据以Parquet格式存储结构化的状态与动作序列,视频则采用AV1编码压缩为MP4文件,最终按训练集(全部50回合)划分,便于离线训练与评估。
特点
本数据集的核心特色在于其多模态对齐与任务专注性。它不仅录有机器人关节的连续状态(shoulder_pan, shoulder_lift, elbow_flex, wrist_flex, wrist_roll, gripper)与动作序列,还通过bool型字段标记“干预”信号和“任务成功”标志,便于分析人机协作或自主策略的成败。双摄像头配置(顶部全局视角与腕部局部视角)提供了丰富的空间上下文,而高度结构化的特征命名(如.wrist_flex.pos)和统一的数据字典(包括dtype、shape与命名空间)使其易于被模仿学习或强化学习算法直接解析。此外,固定帧率(30 FPS)与完整的episode_index索引保证了时序连贯性,非常适合训练基于状态的策略网络。
使用方法
研究人员可借助LeRobot工具包或通用深度学习框架(如PyTorch)加载该数据集。首先通过lerobot.datasets.LeRobotDataset接口指定数据集路径和配置名(default),即可自动读取Parquet文件中的状态、动作与元数据,并流式解码关联的MP4视频帧。数据集已预置“train”划分,用户可直接用于训练行为克隆(Behavior Cloning)或扩散策略(Diffusion Policy)模型。对于需要固定视窗长度的序列模型,建议按episode_index分组采样,并将动作空间归一化至[-1,1]区间。也可利用next.success标记筛选成功回合,以提升策略学习的样本质量,并通过intervention字段分析人为修正对模型的影响。
背景与挑战
背景概述
在机器人学习领域,模仿学习通过专家示教数据驱动策略习得,已成为解决复杂操作任务的关键范式。rollout_stackblocks_iter1_rollout数据集由Hugging Face LeRobot社区于2025年发布,由研究团队lilkm基于仿人机器人平台so_follower构建,旨在研究机器人堆叠积木任务中的行为克隆与泛化能力。该数据集包含50个完整回合、逾4万帧时序数据,以30帧每秒的采样率记录6维关节动作、顶置与腕部摄像头RGB图像及任务状态变量,为多模态机器人策略学习提供了标准化训练资源。其开放的Apache-2.0许可促进了机器人学习社区的数据共享与基准测试,为从单任务示教到多技能泛化的研究奠定了数据基础。
当前挑战
该数据集所解决的领域挑战聚焦于机器人精细操作中的状态动作映射与长时序依赖建模。在堆叠积木任务中,机器人需处理高维视觉输入与连续关节控制的异构融合问题,同时应对物体位姿不确定性及物理交互中的瞬时动态变化。数据集构建过程面临多重困难:通过遥操作采集高质量示教数据需精确校准机械臂运动学参数以减小动作噪声,多视角视频同步与压缩编码(AV1格式)在保证时序对齐的同时需平衡存储开销(视频文件达200 MB),且标注单元回合内任务成功状态需依赖人工验证以剔除失败轨迹,最终确保数据集的可靠性与策略学习效率。
常用场景
经典使用场景
在机器人学习与操作领域,rollout_stackblocks_iter1_rollout数据集专为模仿学习算法设计,记录了单台so_follower机器人执行积木堆叠任务的完整演示。每一轮包含50个回合、总计4万余帧高保真数据,涵盖了从肩部到夹爪的六维关节状态序列、顶部与腕部双视角视频流,以及任务成功标签。研究者以此为基准,训练端到端的视觉运动策略,如行为克隆或隐式策略拟合,使机器人从初始构型出发,逐步精准抓取、搬运并堆叠积木,直至达成目标构型。该数据集凭借其结构化动作空间与多模态观测,成为验证模仿学习方法在精密装配任务中泛化能力与鲁棒性的理想测试床。
实际应用
在智能制造与仓储物流的前沿场景中,该数据集驱动的模型可部署于自适应机器人工作站。例如,学习后的策略能引导机器人完成电子元件的精密码放、药瓶的自动装盒,或物流分拣中的异形箱体堆叠。其双摄像头配置模拟了常见的工业视觉系统,使算法能够直接迁移至现有流水线。该数据集还支持了人机协作场景的仿真预训练,通过融合干预标签(intervention),可训练机器人感知人类实时校正意图,从而在动态生产环境中实现柔性操作。数据集的低延迟需求(30fps)和开源许可(Apache-2.0)也加速了其向教学与科研外骨骼等低成本硬件平台的扩散。
衍生相关工作
该数据集催生了多项经典派生工作。在算法层面,研究者基于其中的状态时序与视觉帧,开发了时序组合扩散模型(TCD),将任务解耦为子目标序列,提升长步操作的成功率。在表征学习领域,该数据集的成功标签被用于训练逆动态模型,通过预测专家恢复动作来增强策略的抗干扰能力。此外,还有工作利用其双视觉流,构建了跨视角对比学习框架,使机器人能从单一视角泛化至未观测机位。全部派生研究均遵循LeRobot开源生态,并将训练管线整合进同一框架,例如在统一评估基准上对比行为克隆与原型网络性能,大幅降低了新方法验证的重复造轮成本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务