遇见数据集

Voxel51/FreeTacMan

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

FreeTacMan (FiftyOne) 是一个基于 OpenDriveLab/FreeTacMan 视觉-触觉操作数据集构建的分组FiftyOne视频数据集。每个组代表单个演示轨迹,包含每个相机/传感器视图的视频,以及完整的工具中心点(TCP)和夹爪轨迹作为每帧字段存储。该数据集是一个大规模、高精度的视觉-触觉操作数据集,使用无机器人、人类操作的数据收集系统收集,针对接触丰富的操作,配对了手腕安装的鱼眼相机同步RGB视频和两个GelSight风格的光学触觉传感器,以及密集的6自由度末端执行器轨迹。源数据集包含超过300万视觉-触觉图像对和超过1万条轨迹,涵盖50个任务类别。此FiftyOne版本将源数据重组为分组视频数据集,以便在FiftyOne App中并排查看演示的触觉和视觉流,并将机器人本体感觉渲染为每帧数字字段。数据集由OpenDriveLab策划,语言为英语(视频、触觉和轨迹数据,无文本),许可证为MIT。

FreeTacMan (FiftyOne) is a grouped FiftyOne video dataset built from the OpenDriveLab/FreeTacMan visuo-tactile manipulation dataset. Each group is a single demonstration trajectory, with one video per camera/sensor view and the full tool-center-point (TCP) and gripper trajectory stored as per-frame fields. FreeTacMan is a large-scale, high-precision visuo-tactile manipulation dataset collected with a robot-free, human-operated data collection system. It targets contact-rich manipulation, pairing synchronized RGB video from a wrist-mounted fisheye camera with two GelSight-style optical tactile sensors, plus dense 6-DoF end-effector trajectories. The source dataset contains over 3,000k visuo-tactile image pairs and more than 10k trajectories across 50 task categories. This FiftyOne version reorganizes the source data into a grouped video dataset so the tactile and visual streams for a demonstration can be viewed side by side in the FiftyOne App, with the robot proprioception rendered as per-frame numeric fields. Curated by OpenDriveLab, language is English (video, tactile, and trajectory data; no text), license is MIT.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/FreeTacMan 数据集图片
构建方式
FreeTacMan数据集由OpenDriveLab团队构建,旨在为接触丰富的操作任务提供高质量的视触觉数据。其核心创新在于采用了一种无机器人的可穿戴数据采集系统,将光学触觉传感器直接置于操作者指尖,消除了传统遥操作系统中机械传动带来的触觉信号衰减。数据收集过程中,每段演示同步记录腕载鱼眼相机RGB图像(640×480,30 FPS)与两个指尖光学触觉传感器图像,同时通过OptiTrack运动捕捉系统以300 Hz频率追踪末端执行器的6自由度位姿及夹爪开度,最终下采样至30 Hz与视频流对齐。本版本(FiftyOne)将原始按任务组织的MP4视频与轨迹CSV文件解析为分组视频数据集,每个演示轨迹构成一个组,包含触觉传感器1、触觉传感器2与鱼眼相机三个视频切片,并将12维轨迹数据映射为逐帧数值字段,同时将原始MPEG-4 Part 2视频转码为H.264/yuv420p格式以支持应用内播放。
特点
该数据集具备三大显著特征。其一,规模宏大且精度卓越:包含超过300万对视触觉图像对与6,228条演示轨迹,覆盖45种接触丰富的操作任务(如注水、切香蕉、拧灯泡等),末端执行器位姿追踪平均误差仅为0.118毫米。其二,多模态同步记录:每组演示同步提供两个触觉传感器与一个鱼眼相机的视频流,配合完整的6自由度TCP轨迹与夹爪开度信息,为多模态融合研究提供了对齐良好的数据基础。其三,结构化的分组设计:FiftyOne版本将同一演示的不同传感器视图组织为组,用户可在应用内自由切换切片以对比触觉印记与RGB视觉画面,且每条轨迹的末端执行器状态被复制到每个切片中,便于从任意视角读取完整运动信息。
使用方法
使用FreeTacMan数据集前需安装FiftyOne库(pip install -U fiftyone),然后通过from fiftyone.utils.huggingface import load_from_hub函数从Hugging Face Hub加载数据集,调用dataset = load_from_hub("Voxel51/FreeTacMan")即可获取包含6,228个组的视频数据集。加载后,可通过fo.launch_app(dataset)启动FiftyOne应用进行可视化浏览与切片切换。研究者可利用fiftyone的ViewField按任务筛选演示(如dataset.match(F("task.label") == "PourWater")),或通过select_group_slices方法选择特定传感器视图(如dataset.select_group_slices("tactile_sensor_1"))。该数据集适用于触觉条件模仿学习、触觉表征对比预训练以及触觉与视觉策略的基准测试,可直接作为动作分块变换器(ACT)等模型的训练输入。
背景与挑战
背景概述
FreeTacMan数据集由OpenDriveLab团队于2025年提出,相关论文已被ICRA 2026接收,主要研究人员包括吴龙燕、余彻诚、任杰骥、陈力、蒋宇飞、黄然、顾国英和李宏阳。该数据集聚焦于机器人接触丰富操作领域,核心研究问题在于如何高效获取高精度的视觉-触觉同步数据以支撑模仿学习与触觉表征预训练。数据集包含超过300万对视觉-触觉图像对和一万余条轨迹,覆盖50类操作任务,其无机器人、可穿戴的采集系统消除了传统遥操作中的机械间隙,为触觉条件策略学习提供了大规模基准,对推动触觉感知在机器人操作中的应用具有重要影响力。
当前挑战
该数据集主要应对两大挑战:其一,接触丰富操作任务中,传统采集系统因机械间隙导致触觉信号衰减,而FreeTacMan通过指尖原位传感器实现了无衰减的触觉反馈,但光学触觉传感器本质为凝胶形变测量,无法提供真实接触力数据,限制了其在精确力控场景中的应用。其二,构建过程中,跨40余种任务的6000余条演示需同步多路30Hz视频与300Hz运动捕捉数据,因硬件故障导致约10%的鱼眼相机缺失,且不同操作者的行为差异增加了轨迹一致性维护的难度,同时视频转码与分组结构的构建亦对数据处理流程提出了效率要求。
常用场景
经典使用场景
在具身智能与机器人操作领域,FreeTacMan数据集最经典的应用场景是服务于接触密集型操作的模仿学习研究。该数据集通过机器人无依赖的人工采集系统,同步记录了腕部鱼眼相机的RGB视频、两种GelSight式光学触觉传感器的图像序列,以及由OptiTrack运动捕捉系统以300 Hz采样率获取的六自由度末端执行器轨迹。研究者可将这些多模态信息作为输入,训练诸如Action Chunking Transformer等策略网络,使得机器人能够从人类演示中习得精细的接触操作技能。其特有的原位触觉传感器设计消除了传统机械手爪带来的滞后效应,使得触觉信号与视觉信息高度对齐,为接触丰富的灵巧操作提供了坚实的数据基础。
实际应用
FreeTacMan数据集在实际应用场景中展现出广泛价值,尤其在工业精密操作与日常生活辅助领域。基于该数据集训练的机器人策略可直接部署于精密装配、柔性物件操控等任务,例如拧灯泡、穿针引线、挤牙膏及插USB接口等。由于其数据采集系统完全脱离机器人硬件,采集的演示数据可直接迁移至不同型号的机械臂,如论文中验证的PIPER六自由度臂,极大降低了数据采集成本。这一特性使得FreeTacMan适用于跨体机器人技能迁移,为服务机器人、医疗辅助机器人以及智能制造中的柔性操作单元提供了可复用的示范数据资源。
衍生相关工作
FreeTacMan数据集已催生了多项经典后续研究工作。在数据层面,研究者基于其多视点触觉信息开发了触觉编码器与视觉编码器对齐的对比预训练框架,显著提升了触觉表示的泛化能力。在模型层面,该数据集被用于训练融合视觉-触觉信息的模仿学习策略,并衍生出触觉条件下的行动分块变换器(Action Chunking Transformer)等新架构。此外,针对其光学触觉传感器的特性,相关研究探索了从触觉图像中解耦出接触力与几何信息的方法,推动了无校准触觉力传感技术的前进。这些工作不仅验证了FreeTacMan在接触密集型操作研究中的核心价值,也为未来机器人灵巧操作的数据驱动范式奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务