OctoSense
收藏资源简介:
OctoSense数据集是由宾夕法尼亚大学GRASP实验室与布朗大学联合创建的大规模多模态机器人感知数据集,旨在解决多传感器融合在复杂环境下的鲁棒性挑战。该数据集包含总计59小时、覆盖2474公里的时间同步驾驶数据,数据量达8.4TB,集成了立体RGB与事件相机、热成像仪、激光雷达、惯性测量单元、RTK-GPS以及车辆CAN总线等多种异构传感器数据,来源涵盖城市、郊区和高速公路等多种场景及昼夜不同光照条件。数据采集通过定制化的OctoSense硬件平台完成,并经过严格的时间同步、传感器标定与后处理,确保了多源数据的高质量对齐。该数据集主要应用于自动驾驶与机器人领域,支持自监督学习、多模态融合算法研究,并为深度估计、光流计算、语义分割、里程计等下游任务提供密集的基准真值。
The OctoSense dataset is a large-scale multimodal robotic perception dataset jointly created by the GRASP Laboratory at the University of Pennsylvania and Brown University, aiming to address the robustness challenges of multi-sensor fusion in complex environments. This dataset contains a total of 59 hours of time-synchronized driving data spanning 2474 kilometers, with a total data volume of 8.4 TB, integrating heterogeneous sensor data from multiple modalities including stereo RGB and event cameras, thermal imagers, LiDAR, inertial measurement units (IMUs), RTK-GPS, and vehicle CAN bus. The collected data covers diverse scenarios such as urban, suburban, and highway environments, as well as varying lighting conditions across day and night. Data was collected via a custom OctoSense hardware platform, and underwent rigorous time synchronization, sensor calibration, and post-processing to ensure high-quality alignment of multi-source data. This dataset is primarily applied in the fields of autonomous driving and robotics, supporting research on self-supervised learning and multimodal fusion algorithms, and providing dense ground truth for downstream tasks such as depth estimation, optical flow calculation, semantic segmentation, and odometry.
数据集概述:OctoSense
OctoSense 是一个专注于多模态机器人感知的大规模、时间同步开源数据集与平台,旨在推动在退化环境下的鲁棒感知研究。
核心特点与规模
- 数据规模:包含 59 小时 / 2,474 公里 的驾驶数据,是目前最大的包含事件相机的机器人数据集之一。
- 采集条件:数据在白天、夜晚及传感器退化(如低光、高动态范围、快速运动)条件下采集,覆盖日出、日落、阳光眩光、数据包丢失等场景。
- 地理位置:路线涵盖美国长岛和费城的城市、郊区和乡村道路。
- 时间同步:采用自研的 PPS 时间同步硬件,确保所有传感器数据对齐到统一时间线。
传感器平台
平台搭载了8个时间同步传感器:
| 模态 | 传感器 | 参数 | 速率 |
|---|---|---|---|
| RGB (立体) | 2× FLIR Blackfly S | 1920×1456 | 100 Hz |
| 事件相机 (立体) | 2× SilkyEV VGA (Prophesee) | 640×480 | ≈7 MEv/s |
| 热成像 | FLIR A35 | 320×256 | 50 Hz |
| LiDAR | Ouster OS1-64 | 64 × 2048 | 10 Hz |
| IMU | VectorNav VN-100T | 加速度/陀螺仪/磁力计/气压计 | 400 Hz |
| GNSS | u-blox ZED-F9P | RTK (NTRIP) | 5 Hz |
| 本体感知 | 车辆 CAN / 四足机器人关节 | 方向盘、油门、刹车 / 关节角度 | 50–100 Hz |
数据内容与特性
- 数据格式:提供 HDF5 格式的数据集,支持通过 Hugging Face 下载。
- 可搜索性:每5秒窗口使用 Gemma 4 生成描述,并使用 Qwen3-Embedding-8B 生成嵌入,构建了 FAISS + BM25 混合索引,支持自然语言搜索(如“夜间湿路”)。
- 真值标签:提供基于 LiDAR-惯性里程计推导的度量深度、自运动光流,以及基于 EoMT 模型在 Cityscapes 上训练的语义分割伪标签。
核心方法:多模态掩码自编码器 (Multimodal MAE)
提出一种晚期融合的掩码自编码器,用于学习鲁棒的多模态联合表示。
- 传感器表示:将事件流、LiDAR、RGB 和 IMU 等不同模态数据统一转换为 Token 序列。
- 量化目标:为每个模态预训练一个使用有限标量量化 (FSQ) 的自编码器,将每个 Patch 映射到离散编码。MAE 网络负责预测这些冻结的离散编码,而非原始像素。
- 融合编码器:采用时空管状掩码策略,通过狄利克雷分布分配各模态的保留比例。编码器分为三个注意力阶段:空间注意力 -> 时间注意力 -> 多模态注意力。推理时通过 Token 缓存实现实时运行(RTX 5090 上 6.68 ms,嵌入式 Orin NX 上 112 ms)。
- 下游任务探针:冻结预训练编码器,训练轻量级探针(如 Dense Prediction Transformer 和注意力探针)用于深度估计、光流、语义分割和自运动估计。
性能与对比
- 评估结果:在深度估计、光流、语义分割和自运动估计任务上,本方法的性能优于所有纯视觉基础模型(如 DINOv3, V-JEPA 2.1)。
- 退化环境优势:在夜间和传感器退化条件下,性能优势尤为显著。例如,在退化条件下,深度 RMSE 为 4.77 米(对比 DINOv3 的 7.40 米)。
- 模态贡献分析:消融实验表明,LiDAR 对自运动和密集预测任务贡献最大;RGB 对语义分割任务至关重要。
- 零样本迁移:该表示可零样本迁移至 M3ED 数据集,并在不同传感器配置下保持竞争力。
扩展与应用
- 超越驾驶:数据集还包含了船只和 Unitree Go2-W 四足机器人的序列,朝着跨平台感知模型迈出一步。
- 开源:硬件 CAD、传感器安装件、定制电子电路以及数据处理工具链均完全开源。




