遇见数据集

aboardman/record-test_20260529_122057

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人任务的数据集,使用LeRobot创建。数据集包含一个episode,总共有1728帧,帧率为30fps。特征包括动作(action)和观测(observation),其中动作由6个浮点数值组成,代表机器人关节位置(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)。观测包括状态(state)和图像(images),状态同样由6个浮点数值表示关节位置;图像分为前视(front)和俯视(overhead)两种视角,均为视频格式,分辨率480x640,3通道(RGB),使用AV1编解码器。此外,数据集还包含时间戳、帧索引、episode索引、索引和任务索引等元数据。机器人类型为so_follower,数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集仅包含训练分割(train split)。

This is a robotics task dataset developed using LeRobot. It consists of one episode with a total of 1728 frames at a frame rate of 30 fps. The dataset includes two core feature categories: action and observation. The action is composed of 6 floating-point values, representing the robot's joint positions including shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position. The observation comprises two sub-components: state and images. The state is also represented by 6 floating-point values corresponding to the robot's joint positions. The images are available in two perspectives: front view and overhead view, both in video format with a resolution of 480 × 640, 3-channel RGB, and encoded using the AV1 codec. Additionally, the dataset contains various metadata fields such as timestamps, frame indices, episode indices, sample indices, and task indices. The robot platform for this dataset is so_follower. The data is stored in Parquet file format, with a total data file size of 100 MB and a video file size of 200 MB. The dataset only includes the training split.

提供机构:
aboardman
搜集汇总
数据集介绍
aboardman/record-test_20260529_122057 数据集图片
构建方式
该数据集基于LeRobot框架构建,源自对机器人实际操作的记录与采集。数据采集过程中,机器人执行特定任务,其关节状态、动作指令及多视角视觉影像被同步记录。数据集包含一个完整的操作回合(episode),共计1728帧,采样频率为30帧/秒。机器人状态信息以6维浮点数向量表示,涵盖肩部、肘部、腕部及夹爪等关键关节的位置参数。视觉数据通过前置与俯视两个摄像头获取,每个摄像头以分辨率480×640、编码格式为AV1的视频流形式存储,为机器人控制提供了丰富的环境感知信息。
特点
该数据集具有鲜明的多模态融合特性,同时包含动作指令、机器人状态观测以及高分辨率视频影像,为机器人学习算法提供了完整的输入-输出映射。所有数据均以30Hz的高频率同步采集,确保了时序上的精确对齐。数据结构设计严谨,采用序列化的Parquet文件存储数值型数据,而视觉信息则以压缩视频形式独立保存,兼顾了存储效率与数据完整性。数据集仅包含单一任务与单一操作实例,规模小巧精炼,适合于快速原型验证、算法调试及教学演示等场景。
使用方法
用户可通过LeRobot库便捷地加载和使用该数据集。加载时,数据集自动识别并解析其内部结构,将动作、状态与图像数据组织成统一的迭代器或数据集对象。视觉数据在加载过程中会实施解码,并依据配置参数进行必要的预处理。用户既可在本地环境通过运行LeRobot的可视化工具来探索数据内容,如查看图像帧序列与对应机器人状态,也可将其直接导入模仿学习或强化学习训练流程,利用其完整的时序数据训练机器人控制策略。
背景与挑战
背景概述
该数据集由Hugging Face团队基于LeRobot框架创建,旨在为机器人学习领域提供标准化的操作数据。研究聚焦于机器人模仿学习与行为克隆,通过记录关节角度、末端执行器状态及多视角视觉信息,为训练机器人执行精细操控任务奠定基础。数据集包含了单次完整交互过程中从真实机器人平台采集的1728帧序列,采用Apache-2.0许可发布,推动了开源的机器人学习数据生态建设。
当前挑战
机器人操作数据的采集面临硬件标定与动态环境干扰的挑战,需要同步处理高精度关节位置、多摄像头RGB图像及时间戳等多模态信息。数据清洗中需剔除异常帧并解决传感器延迟导致的时空错位问题,同时保证训练集分布能覆盖复杂操作下的长尾动作。此外,小样本场景下的泛化能力与仿真到现实的迁移偏差,构成了机器人学习领域亟待突破的关键瓶颈。
常用场景
经典使用场景
在机器人学习领域,record-test_20260529_122057数据集专为模仿学习与行为克隆任务而设计,其核心价值在于提供从人类远程操作或预编程轨迹中采集的关节空间动作序列。该数据集包含6维关节动作向量(如肩部旋转、肘部弯曲、腕部调整及夹爪开合)与同步的视觉观测(前视及俯视RGB图像),以30Hz的帧率记录了一段持续约57.6秒的完整操作片段。经典使用流程是将观测状态与图像输入至基于Transformer或扩散策略的神经网络,以端到端方式预测动作分布,从而泛化至未见过的初始条件,实现柔顺的机械臂操控。
解决学术问题
该数据集直面的核心学术问题在于小样本条件下的机器人技能习得与多模态感知-运动耦合。传统强化学习方法在大规模虚拟环境中有效,却难以迁移至真实物理世界;而本数据集通过提供1个完整轨迹(1728帧),使研究者得以探索数据效率极高的一阶模仿学习算法,如利用扩散模型直接学习状态到动作的映射,规避了奖励函数设计与环境交互的难题。其影响深远,证明了即便在仅有单条演示的情况下,结合预训练视觉编码器与轻量级策略网络,仍能完成精细操作任务,为机器人终身学习与跨场景适应提供了新的理论支撑。
衍生相关工作
围绕该数据集结构(含6维关节动作与双视角视频),衍生出若干重要研究方向。一方面,研究者基于其‘单集演示+多模态观测’的特性,探索了数据增强技术如时间序列抖动、视角随机化以及动作噪声注入,以提升策略鲁棒性。另一方面,该数据集的LeRobot生态兼容性推动了跨数据集迁移学习实验,例如利用预训练的视觉-动作编码器在其他机器人平台(如Aloha或Kortex)上进行零样本微调。此外,其规范的parquet存储格式激励了社区开发高效的轨迹回放与可视化工具,为机器人行为建模中的世界模型预训练提供了基准数据管道。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务