遇见数据集

PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_165115

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot项目创建,属于机器人领域。数据集包含机器人执行任务时的动作和观测数据:动作数据为6维浮点数组,对应肩部平移、肩部抬升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置;观测数据包括机器人状态(同样为6维关节位置)以及三个视角的图像(顶部、手腕和侧面),图像为480x640分辨率的RGB视频,帧率30fps。数据集总共有1个任务、1个episode和1343帧数据,采用parquet和mp4格式存储,机器人类型为so_follower。

This dataset was created using the LeRobot project and belongs to the robotics domain. It contains action and observation data from robot task execution: actions are 6-dimensional float arrays corresponding to shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions; observations include robot state (also 6-dimensional joint positions) and images from three perspectives (top, wrist, and side), which are RGB videos with 480x640 resolution at 30fps. The dataset consists of 1 task, 1 episode, and 1343 frames, stored in parquet and mp4 formats, with the robot type being so_follower.

提供机构:
PhilippEngelmann
搜集汇总
数据集介绍
PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_165115 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的演示数据。数据采集过程使用So-Follower机器人,通过远程操作或预设策略生成一系列动作序列。数据以30帧每秒的速率记录,包含1343帧完整轨迹,覆盖单一任务场景。结构上,数据集将原始传感器读数、关节指令与多视角视频流同步存储,采用Parquet格式压缩数值数据,AV1编码压缩视频文件,确保存储效率与数据完整性。
特点
数据集的核心特点在于其多模态融合与高保真重现能力。它同时记录了机器人6维关节空间的状态与动作指令(包括肩部、肘部、腕部及夹爪),并收纳来自顶部、腕部与侧方的三个RGB摄像头画面,分辨率为640×480像素。这种设计既支持纯状态输入的策略学习,也兼容视觉-动作联合建模。此外,数据以完整剧集(episode)组织,附带时间戳与帧索引,便于序列化建模与时序分析。
使用方法
研究者可通过LeRobot库直接加载与回放该数据集。推荐使用Hugging Face Spaces提供的可视化工具交互式浏览视频与状态序列。在训练流程中,可依据`episode_index`划分训练集(默认已按0:1比例分割),利用`observation.state`与`action`字段构造模仿学习或离线强化学习样本。视频数据需通过LeRobot内建的编解码器实时解码,支持动态批处理与数据增强,适用于行为克隆、逆强化学习等范式。
背景与挑战
背景概述
该数据集由Philipp Engelmann等人于2026年5月创建,依托LeRobot开源框架构建,聚焦于机器人操作领域的模仿学习研究。核心研究问题在于如何通过多视角视觉观测与关节状态数据,使机器人能够精准复现复杂的物理交互动作,例如从肩部到腕部及夹爪的六自由度运动控制。数据集包含单条演示片段,记录了1343帧以30帧/秒采样的高分辨率视觉信息(顶部、腕部、侧面三视角)及同步的关节动作序列,为学习机器人从感知到执行的闭环策略提供了基础资源。其采用Apache-2.0许可证发布,旨在推动低成本机器人平台上的可复现研究,对解决精细操作任务中的数据稀缺问题具有潜在影响力。
当前挑战
该数据集面临的核心领域挑战在于机器人模仿学习中的泛化难题:单条演示数据难以覆盖真实世界中因物体位置、光照、摩擦力等变化带来的多样性,导致学习到的策略易过拟合于特定场景。构建过程中,数据采集需同步三路高清摄像头与高精度关节编码器的时序,任何微小的延迟或标定误差都会破坏状态-动作对的对应关系;同时,采用AV1编码压缩视频以控制存储至200 MB,却可能引入视觉伪影,影响后续模型对细粒度操作特征的提取。此外,机器人末端夹爪的脆弱接触力反馈缺失,进一步限制了数据对复杂装配或易碎物体操作任务的表征能力。
常用场景
经典使用场景
在机器人学习与具身智能领域,rollout_smolvla_blau335oben_v1_20260527_165115 数据集为模仿学习与行为克隆提供了宝贵的训练资源。该数据集记录了单个机械臂在30帧每秒的采样率下完成的完整操作流程,包含顶部、腕部和侧方三个视角的640×480像素视频,以及机械臂六个关节的连续动作与状态轨迹。研究者可将其用于训练视觉运动策略,使机器人能够从高维观测中学习精准的操控行为,完成如抓取或装配等任务。该数据集的单任务多视角结构,适合验证小样本模仿学习算法的有效性。
衍生相关工作
该数据集衍生的相关工作主要集中在基于 LeRobot 开源平台的策略蒸馏与多任务学习。例如,研究人员可能利用此单任务轨迹,结合其他公开数据集训练跨场景的通用操作模型;或通过数据增强与域随机化技术,提升策略在新视角下的泛化能力。另一个方向是基于视频预测的预训练,使用观测图像序列学习时空表征,再微调至下游动作决策。此类工作有助于理解视觉运动表示的内在结构,并推动形成机器人基础模型的数据标准。
数据集最近研究
最新研究方向
在机器人学习领域,数据驱动的行为克隆与模仿学习正成为突破传统编程局限的关键路径。该数据集以smolvla模型为基础,通过真实机器人rollout采集了包含多视角视觉观测(顶部、腕部、侧方)与6自由度关节动作序列的高频轨迹数据,共计1343帧单一任务演示。其前沿价值体现在:一方面,它支持构建具备精细操作能力的视觉-运动控制策略,尤其在未知场景泛化中发挥作用;另一方面,采用AV1视频编码与LeRobot标准化流程,推动了开放机器人数据生态的建设。此类数据资源为具身智能与多模态大模型在物理世界的落地提供了可复现的基准,呼应了当前将基础模型嵌入机器人系统的研究热潮。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务