遇见数据集

OctoSense

收藏
arXiv2026-06-26 更新2026-06-29 收录
数据链接:
官方服务:

资源简介:

OctoSense数据集是由宾夕法尼亚大学GRASP实验室与布朗大学联合创建的大规模多模态机器人感知数据集,旨在解决多传感器融合在复杂环境下的鲁棒性挑战。该数据集包含总计59小时、覆盖2474公里的时间同步驾驶数据,数据量达8.4TB,集成了立体RGB与事件相机、热成像仪、激光雷达、惯性测量单元、RTK-GPS以及车辆CAN总线等多种异构传感器数据,来源涵盖城市、郊区和高速公路等多种场景及昼夜不同光照条件。数据采集通过定制化的OctoSense硬件平台完成,并经过严格的时间同步、传感器标定与后处理,确保了多源数据的高质量对齐。该数据集主要应用于自动驾驶与机器人领域,支持自监督学习、多模态融合算法研究,并为深度估计、光流计算、语义分割、里程计等下游任务提供密集的基准真值。

The OctoSense dataset is a large-scale multimodal robotic perception dataset jointly created by the GRASP Laboratory at the University of Pennsylvania and Brown University, aiming to address the robustness challenges of multi-sensor fusion in complex environments. This dataset contains a total of 59 hours of time-synchronized driving data spanning 2474 kilometers, with a total data volume of 8.4 TB, integrating heterogeneous sensor data from multiple modalities including stereo RGB and event cameras, thermal imagers, LiDAR, inertial measurement units (IMUs), RTK-GPS, and vehicle CAN bus. The collected data covers diverse scenarios such as urban, suburban, and highway environments, as well as varying lighting conditions across day and night. Data was collected via a custom OctoSense hardware platform, and underwent rigorous time synchronization, sensor calibration, and post-processing to ensure high-quality alignment of multi-source data. This dataset is primarily applied in the fields of autonomous driving and robotics, supporting research on self-supervised learning and multimodal fusion algorithms, and providing dense ground truth for downstream tasks such as depth estimation, optical flow calculation, semantic segmentation, and odometry.

创建时间:
2026-06-26
原始信息汇总

数据集概述:OctoSense

OctoSense 是一个专注于多模态机器人感知的大规模、时间同步开源数据集与平台,旨在推动在退化环境下的鲁棒感知研究。

核心特点与规模

  • 数据规模:包含 59 小时 / 2,474 公里 的驾驶数据,是目前最大的包含事件相机的机器人数据集之一。
  • 采集条件:数据在白天、夜晚及传感器退化(如低光、高动态范围、快速运动)条件下采集,覆盖日出、日落、阳光眩光、数据包丢失等场景。
  • 地理位置:路线涵盖美国长岛和费城的城市、郊区和乡村道路。
  • 时间同步:采用自研的 PPS 时间同步硬件,确保所有传感器数据对齐到统一时间线。

传感器平台

平台搭载了8个时间同步传感器:

模态 传感器 参数 速率
RGB (立体) 2× FLIR Blackfly S 1920×1456 100 Hz
事件相机 (立体) 2× SilkyEV VGA (Prophesee) 640×480 ≈7 MEv/s
热成像 FLIR A35 320×256 50 Hz
LiDAR Ouster OS1-64 64 × 2048 10 Hz
IMU VectorNav VN-100T 加速度/陀螺仪/磁力计/气压计 400 Hz
GNSS u-blox ZED-F9P RTK (NTRIP) 5 Hz
本体感知 车辆 CAN / 四足机器人关节 方向盘、油门、刹车 / 关节角度 50–100 Hz

数据内容与特性

  • 数据格式:提供 HDF5 格式的数据集,支持通过 Hugging Face 下载。
  • 可搜索性:每5秒窗口使用 Gemma 4 生成描述,并使用 Qwen3-Embedding-8B 生成嵌入,构建了 FAISS + BM25 混合索引,支持自然语言搜索(如“夜间湿路”)。
  • 真值标签:提供基于 LiDAR-惯性里程计推导的度量深度自运动光流,以及基于 EoMT 模型在 Cityscapes 上训练的语义分割伪标签。

核心方法:多模态掩码自编码器 (Multimodal MAE)

提出一种晚期融合的掩码自编码器,用于学习鲁棒的多模态联合表示。

  1. 传感器表示:将事件流、LiDAR、RGB 和 IMU 等不同模态数据统一转换为 Token 序列。
  2. 量化目标:为每个模态预训练一个使用有限标量量化 (FSQ) 的自编码器,将每个 Patch 映射到离散编码。MAE 网络负责预测这些冻结的离散编码,而非原始像素。
  3. 融合编码器:采用时空管状掩码策略,通过狄利克雷分布分配各模态的保留比例。编码器分为三个注意力阶段:空间注意力 -> 时间注意力 -> 多模态注意力。推理时通过 Token 缓存实现实时运行(RTX 5090 上 6.68 ms,嵌入式 Orin NX 上 112 ms)。
  4. 下游任务探针:冻结预训练编码器,训练轻量级探针(如 Dense Prediction Transformer 和注意力探针)用于深度估计、光流、语义分割和自运动估计。

性能与对比

  • 评估结果:在深度估计、光流、语义分割和自运动估计任务上,本方法的性能优于所有纯视觉基础模型(如 DINOv3, V-JEPA 2.1)。
  • 退化环境优势:在夜间和传感器退化条件下,性能优势尤为显著。例如,在退化条件下,深度 RMSE 为 4.77 米(对比 DINOv3 的 7.40 米)。
  • 模态贡献分析:消融实验表明,LiDAR 对自运动和密集预测任务贡献最大;RGB 对语义分割任务至关重要。
  • 零样本迁移:该表示可零样本迁移至 M3ED 数据集,并在不同传感器配置下保持竞争力。

扩展与应用

  • 超越驾驶:数据集还包含了船只Unitree Go2-W 四足机器人的序列,朝着跨平台感知模型迈出一步。
  • 开源:硬件 CAD、传感器安装件、定制电子电路以及数据处理工具链均完全开源。
搜集汇总
数据集介绍
OctoSense 数据集图片
构建方式
OctoSense数据集的构建依托于一套自主研发的开源硬件平台,该平台集成了立体彩色与事件相机、LiDAR、热成像仪、惯性测量单元、RTK差分GPS以及车辆CAN总线与四足机器人关节角度等本体感知信息。为应对多传感器异构数据的高吞吐挑战,研究团队采用ROS 2 Zenoh零拷贝通信框架,将传感器数据以原始速率完整记录,并通过H.265视频压缩与LiDAR事件包压缩技术,将约1.7 GB/s的原始数据流压缩至78.7 MB/s的可用带宽。硬件层面,通过定制PCB电路实现脉冲同步信号的硬件触发,并利用卡尔曼平滑后处理进行传感器时钟对齐;标定方面,采用反光圆形靶标与AprilGrid结合的策略,依次求解相机内外参、LiDAR-相机外参及相机-IMU外参,确保多模态数据的精准空间对齐。
特点
OctoSense数据集是目前规模最大的多模态机器人感知数据集之一,包含59小时、2474公里跨城市、郊区和乡村环境的驾驶数据,覆盖日出、日间、日落与夜间等多种光照条件,并特意纳入传感器退化情形(如太阳耀斑、数据丢包等)。其核心特点在于异构传感器的深度融合:立体事件相机、热成像仪、LiDAR与IMU等器件具有截然不同的数据频率、延迟和噪声特性,而数据集通过时间同步和空间标定保证了各模态间的时空一致性。此外,数据集提供了基于LiDAR-惯性里程计的自监督稠密真值(深度、光流、语义分割)以及CAN总线与里程计联合校验的车辆状态信息,为多模态表征学习提供了高质量的基准。
使用方法
该数据集适用于训练与评估多模态自监督学习模型。使用者可通过公开的项目页面获取传感器原始流数据、标定参数及代码工具。数据集配备了基于Gemma 4图文描述和Qwen3嵌入的自然语言检索系统,支持按场景语义(如“警车”、“夜间行人”)快速定位感兴趣片段。对于下游任务,论文提供了基于冻结编码器的任务特定探针训练流程:稠密预测任务(深度、光流、语义分割)采用DPT风格的层级特征融合头,而自运动估计则利用交叉注意力模块从编码器输出中回归平移、旋转、速度与转向角等参数。所有预训练与探针训练的超参数及数据处理管线均已开源,便于研究者复现或扩展。
背景与挑战
背景概述
OctoSense数据集由宾夕法尼亚大学GRASP实验室的Anthony Bisulco、Jeremy Wang、Kostas Daniilidis与布朗大学的Randall Balestriero、Pratik Chaudhari于2026年联合创建。该数据集旨在解决机器人多模态感知中缺乏大规模、传感器多样且时间同步的公开数据集这一核心问题。平台集成了立体RGB与事件相机、LiDAR、热成像仪、IMU、RTK纠正GPS及本体感知(车辆CAN总线与四足机器人关节角),并提供了59小时、涵盖城市、郊区、乡村及日出、日暮、夜晚等不同时段、包含传感器退化场景的驾驶数据。作为目前最大的包含事件相机数据的多模态机器人数据集之一,OctoSense为自监督多模态表示学习研究奠定了重要基础,推动了机器人领域对恶劣环境下鲁棒感知能力的探索。
当前挑战
OctoSense所应对的领域挑战在于,现实机器人场景中单一传感器无法胜任全天候、全环境感知任务——全局快门相机在低光、高动态范围和快速运动下表现不佳,LiDAR提供稀疏深度且语义贫乏,不同传感器在数据速率、频率、噪声特性及失效模式上存在巨大差异。其构建过程亦面临严峻工程挑战:硬件层面需解决低温下电容失效、事件相机时间戳因寒冷而损坏、LiDAR振动丢包、USB总线因蜂窝模块过流而崩溃等棘手问题;软件层面需为八类传感器设计定制驱动与触发电路(如基于Teensy 4.1的自定义PCB产生PPS脉),并实现高精度时间同步(通过Kalman平滑拟合仿射变换)、多传感器联合标定(利用反光圆靶与AprilGrid进行LiDAR-相机-IMU外参优化)、以及处理高速数据流(1.7 GB/s原始数据经21倍压缩后仍达78.7 MB/s)的记录与监控系统。
常用场景
经典使用场景
在机器人感知与自主驾驶领域,OctoSense数据集的核心经典用途在于为多模态自监督学习提供大规模、高精度的训练与评测基准。它将立体RGB与事件相机、LiDAR、热成像仪、惯性测量单元、RTK差分GPS以及车辆CAN总线数据融为一体,覆盖59小时、2474公里的多样化驾驶场景。研究者可借此同时获取时空对齐的密集视觉、稀疏深度、高速运动轨迹及本体感知信息,从而构建能够抵抗光照剧变、传感器退化与复杂环境干扰的鲁棒感知模型。该数据集尤为适用于需要融合异构传感器以增强感知可靠性的场景,代表了从单一模态向多模态融合感知研究的关键演进。
实际应用
在实际应用中,该数据集驱动的多模态感知模型可直接部署于自动驾驶车辆和四足无人平台,实现全天候、多环境下的环境理解与状态估计。由于OctoSense硬件平台被设计为开放源码且结构坚固,其采集的同步数据可被用于开发高可靠性的工业级感知系统,例如在夜间、浓雾或传感器部分失效时仍能保持稳定的深度估计与运动规划。该数据集及其配套的晚融合编码器能在边缘计算设备(如NVIDIA Orin NX)上以112毫秒的低延迟运行,适用于需要实时决策能力的移动机器人系统。
衍生相关工作
OctoSense的出现催生了多项衍生性工作。其一,其自监督预训练范式启发了一系列旨在提升稀疏传感器(如LiDAR和事件相机)表征效率的后续研究,推动了面向点云、惯性数据与事件流的新型分词器设计。其二,其晚融合多模态掩码自编码器架构为后续更高效的跨模态融合模型提供了设计蓝图,例如在多机器人和多环境场景中推广的泛化性研究。此外,该数据集还支撑了对感知任务输入冗余性的理论分析工作,引导研究者重新审视多模态信息中独特、协同与冗余成分的定量分离,从而为构建最具性价比的传感器组合提供原则性指导。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务