遇见数据集

kurah/newah-s2-soft-v2

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot框架创建,专注于newah机械臂(仅机械臂部分)。数据集包含30个总集数,6374个总帧数,以30帧每秒的速率采集。数据特征包括:观测状态(5维浮点数组,代表肩部平移、肩部提升、肘部弯曲、腕部弯曲和腕部滚动关节位置)、动作(5维浮点数组,与观测状态对应)、观测图像(工作空间和腕部摄像头,均为480x640x3的视频,使用AV1编解码器)、目标位置(2维浮点数组,代表目标x和y坐标)、时间戳、帧索引、集索引、索引和任务索引。数据集以Parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB,用于训练机器人控制任务,如基于视觉的机械臂操作。

--- license: apache-2.0 任务类别: - 机器人学 标签: - LeRobot(LeRobot) - newah - s2 - act 配置项: - 配置名称:default 数据文件:data/*/*.parquet --- 本数据集基于[LeRobot(LeRobot)](https://github.com/huggingface/lerobot)构建。 可点击下方链接可视化本数据集: <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=kurah/newah-s2-soft-v2"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## 数据集说明 - **主页:** [暂无更多信息] - **论文:** [暂无更多信息] - **许可证:** Apache-2.0 ## 数据集结构 元数据文件为[meta/info.json](meta/info.json),其内容如下: json { "代码库版本": "v3.0", "帧率": 30, "特征项": { "观测.关节状态(observation.state)": { "数据类型": "float32", "形状": [ 5 ], "字段名称": [ "shoulder_pan(肩平转关节)", "shoulder_lift(肩升降关节)", "elbow_flex(肘屈伸关节)", "wrist_flex(腕屈伸关节)", "wrist_roll(腕滚转关节)" ] }, "动作(action)": { "数据类型": "float32", "形状": [ 5 ], "字段名称": [ "shoulder_pan(肩平转关节)", "shoulder_lift(肩升降关节)", "elbow_flex(肘屈伸关节)", "wrist_flex(腕屈伸关节)", "wrist_roll(腕滚转关节)" ] }, "观测.工作区图像(observation.images.workspace)": { "数据类型": "video", "形状": [ 480, 640, 3 ], "维度说明": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "通道数": 3, "包含音频": false } }, "观测.腕部图像(observation.images.wrist)": { "数据类型": "video", "形状": [ 480, 640, 3 ], "维度说明": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "通道数": 3, "包含音频": false } }, "观测.目标点(observation.target)": { "数据类型": "float32", "形状": [ 2 ], "字段名称": [ "target_x(目标X坐标)", "target_y(目标Y坐标)" ] }, "时间戳(timestamp)": { "数据类型": "float32", "形状": [ 1 ], "字段名称": null }, "帧索引(frame_index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "回合索引(episode_index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "全局索引(index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "任务索引(task_index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null } }, "总回合数": 30, "总帧数": 6374, "总任务数": 1, "块大小": 1000, "数据文件总大小(MB)": 100, "视频文件总大小(MB)": 200, "数据文件路径格式": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频文件路径格式": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "机器人类型": "newah_arm_only(仅newah机械臂)", "数据集划分": { "训练集": "0:30" } } ## 引用 **BibTeX格式:** bibtex [暂无更多信息]

提供机构:
kurah
搜集汇总
数据集介绍
kurah/newah-s2-soft-v2 数据集图片
构建方式
该数据集依托LeRobot框架构建,采用统一的元数据描述规范组织多模态机器人操作数据。数据采集环节以newah_arm_only机械臂为平台,在30Hz频率下同步记录五自由度关节状态与动作指令,并配备工作空间及腕部两路视频流,分辨率为480×640。所有样本按时间戳、帧索引与回合索引进行结构化对齐,形成30个完整操作回合,总计6374帧,数据以Parquet列式存储格式分块保存,视频流则采用AV1编码独立存放,便于高效读取与随机访问。
特点
数据集面向机器人精细操作任务,核心特征在于多视角视觉观测与本体感知的融合。观测状态与动作空间均涵盖肩部旋转、肩部抬升、肘部弯曲、腕部弯曲及腕部旋转五个维度,同时提供目标二维坐标作为辅助监督信号。工作空间与腕部两路视频流从不同视角捕捉操作过程,为策略学习提供丰富的空间上下文信息。数据集仅包含单一任务,训练集覆盖全部30个回合,结构清晰,适合作为模仿学习或动作分块Transformer算法的基准测试资源。
使用方法
使用者可通过HuggingFace平台直接加载该数据集,借助LeRobot提供的可视化工具在线浏览操作回放。数据文件按配置路径自动索引,支持按回合或按帧提取状态、动作与视频帧,便于构建端到端的策略学习流程。训练时可将observation.state与observation.images作为输入,action作为预测目标,亦可引入observation.target辅助定位。数据集遵循Apache-2.0许可协议,允许在学术与商业场景中自由使用与修改,建议引用时参考主页补充的论文信息。
背景与挑战
背景概述
在机器人学习领域,高质量、带标注的示范数据集是训练模仿学习与操作策略模型的基础。newah-s2-soft-v2数据集依托LeRobot框架构建,于2024年前后发布,由kurah等研究人员贡献,主要面向桌面级机械臂的精细操作任务。该数据集记录了30条成功演示轨迹,包含双视角视觉观测、五自由度关节状态与动作,以及目标位置信息,总计6374帧。其核心研究问题在于如何从少量人类遥操作数据中学习柔性物体操作技能,并以ACT等策略模型验证。该数据集为小型机械臂在受限环境下的操作研究提供了可复现的基准,推动了低成本机器人学习社区的发展。
当前挑战
该数据集所应对的领域问题在于桌面机械臂对柔性或易变形物体的精细操作,此类任务因物体状态难以精确建模、接触动力学复杂而极具挑战。构建过程中面临多重困难:双视角视频同步采集与时间对齐需确保数据一致性;五自由度动作空间与视觉观测的联合标注要求精确标定;动作数据需反映人类遥操作中的平滑性与任务意图。此外,仅30条演示轨迹的数据规模有限,模型易过拟合,跨场景泛化能力不足。数据集尚缺标准化评估协议与详细元信息,限制了其作为基准的广泛可比性,后续需扩充任务多样性与规模以提升鲁棒性。
常用场景
经典使用场景
在具身智能与机器人操作学习领域,该数据集最经典的应用场景在于基于视觉-动作映射的模仿学习与策略训练。其以30帧每秒的采样频率,同步记录了五自由度机械臂的关节状态、双视角视觉观测(工作空间与腕部)以及末端执行器的二维目标坐标,并通过ACT等算法实现从示教轨迹中端到端地学习精细操作技能。研究者可借助该数据集完成行为克隆、动作分块预测以及多模态表征学习等典型任务,进而评估策略在连续控制任务中的泛化能力与鲁棒性。
解决学术问题
该数据集着力解决学术研究中示教数据稀缺、多模态同步困难以及真实机器人操作策略难以复现等常见问题。通过提供标准化格式的30条高质量演示轨迹及6374帧同步标注,数据集为模仿学习算法提供了可重复的基准测试条件,缓解了不同研究间因数据采集协议差异导致的对比困难。其公开可用的特性亦推动了机器人操作领域在视觉-动作联合建模、低维控制空间表征等方面的可复现研究,为算法创新与公平比较奠定了数据基础。
衍生相关工作
围绕该数据集,衍生出一系列与LeRobot框架紧密相关的经典工作,包括基于ACT的视觉-动作策略学习、数据集可视化与在线评估工具的开发,以及面向低自由度机械臂的模仿学习基准构建。相关研究进一步探索了多视角融合、目标条件策略泛化以及仿真到现实迁移等方向,推动了开源机器人学习社区在标准化数据格式与算法评测方面的协同进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务