遇见数据集

seriintan/rollout_testing_robotic_vision_02_20260526_160443

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - robotics tags: - LeRobot configs: - config_name: default data_files: data/*/*.parquet --- This dataset was created using [LeRobot](https://github.com/huggingface/lerobot). <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=seriintan/rollout_testing_robotic_vision_02_20260526_160443"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## Dataset Description - **Homepage:** [More Information Needed] - **Paper:** [More Information Needed] - **License:** apache-2.0 ## Dataset Structure [meta/info.json](meta/info.json): ```json { "codebase_version": "v3.0", "fps": 30, "features": { "action": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.state": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.images.front": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false } }, "timestamp": { "dtype": "float32", "shape": [ 1 ], "names": null }, "frame_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "episode_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "task_index": { "dtype": "int64", "shape": [ 1 ], "names": null } }, "total_episodes": 1, "total_frames": 9472, "total_tasks": 1, "chunks_size": 1000, "data_files_size_in_mb": 100, "video_files_size_in_mb": 200, "data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "video_path": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "robot_type": "so_follower", "splits": { "train": "0:1" } } ``` ## Citation **BibTeX:** ```bibtex [More Information Needed] ```

This dataset is a robotics dataset created using LeRobot. It includes robot actions and state observations, both comprising six float values for shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions. Observations also include video images from a front camera (resolution 480x640, 3 channels, 30fps), along with metadata such as timestamps, frame indices, and episode indices. The dataset contains 1 episode and 9472 frames in total, stored in Parquet files for data and MP4 files for videos, with a robot type of so_follower. It is designed for robotic vision-related tasks and is licensed under Apache 2.0.

提供机构:
seriintan
搜集汇总
数据集介绍
seriintan/rollout_testing_robotic_vision_02_20260526_160443 数据集图片
构建方式
在机器人视觉与具身智能研究中,高质量演示数据集的构建往往决定了策略学习的上限。该数据集依托LeRobot框架完成采集与封装,以so_follower机器人本体为平台,通过遥操作或自动控制方式记录单次任务执行过程,总帧数达9472帧,采样频率为30Hz。数据以分块Parquet文件存储低维状态与动作序列,同时将前视相机采集的480×640分辨率视频以AV1编码独立归档,形成结构化的多模态时间序列,元信息集中于meta/info.json中统一管理。
特点
该数据集的核心特质在于其模态对齐的精细性与元数据的完备性。动作与观测状态均为6维浮点向量,涵盖肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转及夹爪位置等关节量,与30fps前视视频帧严格同步。所有视频流采用yuv420p像素格式且不含音频,便于视觉编码器直接处理。数据规模精简,仅含1个回合与1项任务,适用于快速验证与调试场景,而非大规模训练。
使用方法
使用该数据集时,可借助LeRobot提供的可视化空间在线浏览数据分布与视频回放,亦可直接读取Parquet文件获取动作与状态张量,并按video_path规则索引对应视频片段。在训练环节中,可将观测图像与关节状态作为输入、动作序列作为监督信号,用于模仿学习或视觉-动作映射建模。由于采用标准Apache-2.0许可,研究者可在合规前提下自由使用、修改与分发数据,并依据data_path与video_path模板灵活加载分块数据。
背景与挑战
背景概述
机器人视觉操作领域长期面临真实世界数据稀缺与标准化不足的双重困境,致使策略模型难以泛化至动态非结构化场景。为回应这一需求,LeRobot社区构建了rollout_testing_robotic_vision_02_20260526_160443数据集,基于Apache-2.0协议发布,采用so_follower机械臂平台,以30帧每秒的同步频率,采集了单一任务下9472帧多模态示范,涵盖六自由度关节位置、夹爪状态及前视640×480视频流。该数据集以统一的v3.0代码库框架封装,形成视觉-状态-动作严格对齐的时序样本,为机器人视觉运动策略的端到端训练与离线评估提供了基础设施。其结构设计呼应了当前具身智能研究对“感知-决策-执行”闭环数据的迫切诉求,并为后续跨任务、跨本体的数据复用奠定基础。
当前挑战
该数据集所对应的领域问题在于:如何在视觉观测与高维连续动作之间建立鲁棒的映射,使机器人策略能够在真实物理约束下完成精细操作。这一问题的困难体现于视觉信息的冗余性与动态性,以及动作序列的时序依赖与累积误差。在构建过程中,数据采集面临多传感器时间戳对齐与视频编解码一致性的压力,尤其需确保30帧每秒下关节状态与图像帧的精确同步;同时,单一任务与单次示范的规模限制,使得数据多样性不足,难以覆盖光照、视角与物体位姿的变化。此外,真实机器人平台固有的机械噪声、标定误差与不可重复性,进一步加剧了数据质量的管控难度。
常用场景
经典使用场景
在机器人学习与具身智能研究中,该数据集最经典的用途是支撑视觉-动作策略的端到端训练与仿真到现实的迁移验证。其收录了单一任务下9472帧、30帧每秒的同步记录,涵盖六自由度机械臂的关节位置与夹爪开合动作,并配以480×640分辨率的前置视觉观测。研究者可借此构建以原始图像为输入、以连续动作为输出的模仿学习或强化学习模型,在统一的LeRobot格式下开展策略回放、开环评估与闭环控制实验,进而检验视觉表征对操作任务的引导效能。
解决学术问题
该数据集直面机器人视觉操作研究中数据稀缺与复现困难两大症结。通过提供标准化、带时间戳与回合索引的真实机械臂运动轨迹,它缓解了学术社区在视觉-语言-动作模型训练中普遍缺乏高质量同步多模态数据的问题。其精细的动作与状态标注使研究者得以系统探究动作分块、时序对齐与视觉泛化等核心议题,为模仿学习算法的鲁棒性评估提供了可复现的基准,对推动具身智能从仿真走向真实场景具有实证意义。
衍生相关工作
围绕该数据集,已衍生出若干与LeRobot生态紧密关联的经典工作方向。其一为基于视觉编码器与动作解码头联合优化的模仿学习框架,借助该数据集验证跨视角表征迁移能力;其二为面向低数据量场景的扩散策略与动作分块方法,利用其连续轨迹评估时序建模效果;其三为仿真到现实的自适应微调研究,将该数据集作为真实域校准集,检验策略在物理系统中的泛化边界,并催生了一系列开源基准与模型卡。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务