OpenLongTail
收藏资源简介:
OpenLongTail是由德克萨斯农工大学、英伟达等多机构联合创建的开源生成式数据引擎,旨在解决自动驾驶领域长尾事件数据稀缺的瓶颈问题。该数据集通过创新的姿态感知外推视图合成管道,将异构的单目行车视频转化为空间对齐且时间连贯的多视角资产,数据规模包含1万条精调样本,并整合了来自Waymo E2E、众包视频等多源数据。其创建过程深度融合了普吕克射线几何编码、时序深度扭曲和跨视图记忆库等先进技术,实现了从单目观测到目标相机阵列的几何一致生成。该数据集主要应用于自动驾驶策略的鲁棒性训练,能够有效提升模型在动物穿行、施工区等罕见长尾场景中的泛化能力和安全性能。
OpenLongTail is an open-source generative data engine jointly developed by multiple institutions including Texas A&M University and NVIDIA. It aims to address the bottleneck issue of scarce data for long-tail events in the autonomous driving domain. By leveraging an innovative pose-aware extrapolation view synthesis pipeline, this engine converts heterogeneous monocular driving videos into spatially aligned and temporally consistent multi-view assets. It includes 10,000 fine-tuned samples and integrates multi-source data from sources such as Waymo E2E and crowdsourced videos. Its development process deeply integrates advanced technologies including Plücker ray geometric encoding, temporal depth warping, and cross-view memory banks, enabling geometrically consistent generation from monocular observations to target camera arrays. This dataset is primarily applied for robustness training of autonomous driving strategies, and can effectively improve the generalization ability and safety performance of models in rare long-tail scenarios such as animal crossings and construction zones.
数据集名称
OpenLongTail:长尾驾驶数据的生成式缩放
核心任务
将异构的长尾驾驶视频(尤其单目视角)转化为姿态对齐、时间一致的完整多视角环绕场景数据,用于规模化训练自主驾驶策略模型,提升对长尾事件的鲁棒性。
关键方法
- 度量姿态恢复 (Metric Pose Recovery):使用MapAnything恢复度量尺度的自我轨迹,并通过卡尔曼+RTS平滑消除抖动。
- 普吕克射线几何 (Plücker Ray Geometry):为每个令牌编码目标相机光线,确保所有分支在统一的3D射线框架下工作。
- 时间深度扭曲 (Temporal Depth Warp):基于深度的重投影将可见的前视角证据传播到侧方和后方目标视角,即使零重叠区域也可处理。
- 跨视角记忆 (Cross-View Memory):构建有向记忆图,使每个目标视角能基于已生成的相邻视角进行条件生成,实现无缝一致性。
- 生成引擎基线:基于Wan 2.1-VACE骨干网络。
数据生成能力
- 输入:单一前视角(单目)长尾驾驶视频
- 输出:前、左、右、左后、右后、后长焦共六个标准环绕视角(目标相机配置)
- 支持跨来源缩放:可将外部单目视频(如Waymo E2E)转化为目标配置的多视角资产,拓展训练池。
实验验证
- 视觉保真度与跨视角一致性:通过外推视角合成和姿态指标验证有效性。
- 闭环驾驶策略提升:在AlpaSim的53个长尾事件闭环评估中:
- 使用OpenLongTail生成的合成多视角数据微调Alpamayo-R1策略,平均AlpaSim得分达到0.748,碰撞率降至0.0%;
- 性能接近使用真实多视角数据的模型(0.764 AS,0.0%碰撞率),优于基线模型。
- 跨来源缩放:结合NVIDIA PAV内部数据与Waymo E2E外部数据生成的合成资产,在十字路口、骑行者、非常见车辆等场景中产出更一致的闭环滚动结果。
论文与代码
- 论文:arXiv:2607.09655
- 代码及项目页面:https://openlongtail.github.io/

- 1OpenLongTail: Generative Scaling of Long-Tail Driving Data德克萨斯农工大学; 英伟达; 威斯康星大学麦迪逊分校; 德克萨斯大学奥斯汀分校; 耶鲁大学; Adobe; Meta; 特拉华大学; 斯坦福大学 · 2026年



