HUGE-Bench
收藏资源简介:
HUGE-Bench是由墨尔本大学和MBZUAI等机构联合开发的高级别无人机视觉-语言-动作任务基准测试数据集。该数据集包含4个真实场景的数字孪生环境、8类高级任务及256万米轨迹数据,采用3D高斯泼溅与网格对齐的混合表示技术,兼具照片级渲染能力与物理碰撞检测功能。数据通过DJI M400无人机在6.45平方公里区域采集,结合LLM标注与人工校验流程构建,支持过程导向的轨迹覆盖率和碰撞感知指标评估,主要用于测试无人机在简短指令下的语义理解、多阶段任务分解及安全执行能力。
HUGE-Bench is a high-level drone vision-language-action (VLA) task benchmark dataset jointly developed by the University of Melbourne, MBZUAI and other institutions. This dataset includes four real-scenario digital twin environments, eight types of high-level tasks and 2.56 million meters of trajectory data, and adopts a hybrid representation technique combining 3D Gaussian Splatting and mesh alignment, which features both photorealistic rendering capabilities and physical collision detection functions. The data was collected using a DJI M400 drone over a 6.45-square-kilometer area, and constructed through a workflow integrating LLM-based annotation and manual verification. It supports the evaluation of process-oriented trajectory coverage and collision-aware metrics, and is primarily designed to test drones' capabilities in semantic understanding, multi-stage task decomposition and safe execution under concise instructions.
HUGE-Bench 数据集概述
数据集名称
HUGE-Bench
核心简介
HUGE-Bench 是一个面向高级无人机视觉-语言-动作任务的基准测试,旨在测试智能体能否解释简洁的语言指令,并执行复杂、面向过程且具有安全意识的轨迹。
主要特点
- 任务类型:高级无人机视觉-语言-动作任务。
- 核心挑战:将简洁的高级命令落地为安全的多阶段行为,侧重于过程导向的执行与安全感知。
- 与现有基准的区别:不同于现有主要关注长篇幅、分步式路线描述和目标中心评估的无人机视觉语言导航基准,本基准更贴近需将简短高级指令转化为安全多阶段行为的真实操作场景。
数据集构成
- 场景数量:4个真实世界数字孪生场景。
- 任务数量:8个高级任务。
- 轨迹总长度:2.56百万米。
- 环境表示:基于对齐的3D高斯溅射-网格表示,结合了照片级真实感渲染与支持碰撞检测的几何结构,用于可扩展的生成和碰撞感知评估。
评估指标
引入过程导向和碰撞感知的指标,用于评估过程保真度、终端精度和安全性。
实验发现
对代表性前沿视觉-语言-动作模型的实验揭示了其在高级语义完成和安全执行方面存在显著差距,凸显了HUGE-Bench作为高级无人机自主性诊断测试平台的价值。
高级任务示例
- 飞到喷泉喷水池塘上方80米处。
- 检查视野中的小路,朝顶部飞行。
- 飞越当前的建筑群。
- 围绕条纹人行横道螺旋下降。
- 以20米半径环绕篮球场飞行。
- 在80米高度绕直升机停机坪飞行一圈。
- 在视野右上方的田野上空执行测绘任务。
- 环绕视野右上方的建筑飞行。

- 1HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks墨尔本大学; MBZUAI; Navlyn; 悉尼大学 · 2026年



