遇见数据集

byeonghwikim/abp_dataset

收藏
Hugging Face2024-04-13 更新2024-03-04 收录
官方服务:

资源简介:

ALFRED数据集用于ABP项目,包含了以自我为中心的视图和周围视图的ResNet-18特征、注释等。周围视图来自ALFRED中定义的四个可导航动作:RotateLeft (90°), LookUp(15°), LookDown(15°), 和 RotateRight(90°)。文件结构几乎与ALFRED数据集相同,建议参考ALFRED的原始仓库获取更多细节。数据集非常大(约1.6T),下载后可以直接加载周围视图特征。特征的0维度对应于不同的视图方向:左视图(RotateLeft)、上视图(LookUp)、前视图(无动作)、下视图(LookDown)和右视图(RotateRight)。此外,数据集还应用了图像增强技术,包括交换图像颜色通道和AutoAugment。

ALFRED数据集用于ABP项目,包含了以自我为中心的视图和周围视图的ResNet-18特征、注释等。周围视图来自ALFRED中定义的四个可导航动作:RotateLeft (90°), LookUp(15°), LookDown(15°), 和 RotateRight(90°)。文件结构几乎与ALFRED数据集相同,建议参考ALFRED的原始仓库获取更多细节。数据集非常大(约1.6T),下载后可以直接加载周围视图特征。特征的0维度对应于不同的视图方向:左视图(RotateLeft)、上视图(LookUp)、前视图(无动作)、下视图(LookDown)和右视图(RotateRight)。此外,数据集还应用了图像增强技术,包括交换图像颜色通道和AutoAugment。

提供机构:
byeonghwikim
原始信息汇总

ALFRED Dataset for ABP

数据集概述

  • 数据内容:包含用于ABP项目的ALFRED数据集,包括以自我为中心和周围视图的ResNet-18特征、注释等。
  • 周围视图:来自ALFRED中定义的四种导航动作:RotateLeft (90°)、LookUp (15°)、LookDown (15°)、RotateRight (90°)。
  • 文件结构:与ALFRED数据集几乎相同,更多细节可参考ALFRED

数据集下载

  • 下载命令: bash cd $ALFRED_ROOT/data git clone https://huggingface.co/byeonghwikim/abp_dataset json_feat_2.1.0

  • 数据大小:约1.6TB。

数据加载示例

  • 加载示例: python import torch filename = train/look_at_obj_in_light-AlarmClock-None-DeskLamp-301/trial_T20190907_174127_043461/feat_conv_panoramic.pt im = torch.load(filename) # [5, T, 512, 7, 7], T 表示轨迹的长度 print(im.shape)

  • 特征维度

    • 0: 左视图 (RotateLeft)
    • 1: 上视图 (LookUp)
    • 2: 前视图 (以自我为中心) (无动作)
    • 3: 下视图 (LookDown)
    • 4: 右视图 (RotateRight)

图像增强

  • 增强类型
    • 无增强:(feat_conv_panoramic.pt)
    • 交换颜色通道:(feat_conv_colorSwap1_panoramic.pt, feat_conv_colorSwap2_panoramic.pt)
    • AutoAugment:(feat_conv_onlyAutoAug1_panoramic.pt ~ feat_conv_onlyAutoAug4_panoramic.pt)

相关工作

  • 使用此数据集的相关工作
    • Online Continual Learning for Interactive Instruction Following Agents (ICLR 2024)
    • Multi-Level Compositional Reasoning for Interactive Instruction Following (AAAI 2023 Oral)
    • Factorizing Perception and Policy for Interactive Instruction Following (ICCV 2021)
    • Agent with the Big Picture: Perceiving Surroundings for Interactive Instruction Following (Embodied AI Workshop @ CVPR 2021)

引用

  • 引用格式: plaintext @inproceedings{kim2021agent, author = {Kim, Byeonghwi and Bhambri, Suvaansh and Singh, Kunal Pratap and Mottaghi, Roozbeh and Choi, Jonghyun}, title = {Agent with the Big Picture: Perceiving Surroundings for Interactive Instruction Following}, booktitle = {Embodied AI Workshop @ CVPR 2021}, year = {2021}, }
搜集汇总
数据集介绍
byeonghwikim/abp_dataset 数据集图片
构建方式
在具身智能与指令跟随任务的研究背景下,该数据集专为ABP模型设计,基于ALFRED框架构建。其核心构建思路在于采集智能体在执行导航动作时的多视角视觉信息,包括第一人称的自我中心视角以及由旋转与俯仰操作(如左转90°、上仰15°、下俯15°、右转90°)产生的四个周围视角。数据集不仅提供原始RGB图像及其对应的深度图和物体掩码,还额外提供了经ResNet-18网络预提取的特征张量,以简化后续研究中的特征提取步骤。此外,受MOCA研究的启发,数据集引入了两种图像增强策略——通道颜色交换与AutoAugment自动增强,从而生成多种增强后的全景特征文件,以提升模型的泛化能力。
特点
该数据集最显著的特征在于其全景视角的覆盖能力,通过整合五个不同方向的视觉特征(左、上、前、下、右),为智能体提供了超越单一自我中心视野的“大局观”,从而更有效地支持交互式指令跟随任务。特征张量的维度结构清晰,第一维索引对应具体的观察方向,便于研究者针对性地利用不同视角的信息。同时,数据集提供了多种增强版本的特征文件,包括无增强、两种颜色交换以及四种AutoAugment变体,这种多样性为研究视觉鲁棒性与数据增强策略提供了丰富的实验素材。整体数据结构与ALFRED高度一致,降低了学习与迁移成本。
使用方法
使用者可通过HuggingFace平台直接克隆数据集仓库,根据需求选择下载原始RGB图像与深度掩码(用于自定义特征提取)或直接获取预提取的庞大特征文件(约1.6TB)。特征文件以PyTorch张量格式存储,可直接通过torch.load函数加载,例如加载全景特征后得到的张量形状为[5, T, 512, 7, 7],其中T表示轨迹长度。每个视角的索引位置(0至4)已明确对应具体方向,方便在模型输入时进行切片与组合。此外,所有增强后的特征文件命名规范,研究者可依据后缀轻松调用不同增强版本,以进行对比实验或训练更具鲁棒性的智能体模型。
背景与挑战
背景概述
在视觉语言导航与指令跟随领域,智能体需依据自然语言指令在三维环境中执行复杂任务,这对其感知与推理能力提出了严苛要求。为此,Byeonghwi Kim 等人于2021年创建了 ABP(Agent with the Big Picture)数据集,该数据集基于 ALFRED 框架扩展而来,由韩国首尔大学等机构的研究人员主导开发,核心研究问题在于探索如何融合多视角信息以提升交互式指令跟随智能体的表现。ABP 数据集不仅提供了标准的第一人称视角图像与深度掩码,还创新性地加入了环绕视角特征(包括旋转、俯仰等动作对应的四个方向),并整合了 ResNet-18 预提取特征与多种数据增强策略。该数据集在 Embodied AI Workshop @ CVPR 2021 上首次提出,随后被多篇顶级会议论文(如 ICCV 2021、AAAI 2023、ICLR 2024)所采用,对推动多模态智能体在复杂室内环境中的理解与决策能力具有重要影响。
当前挑战
ABP 数据集所解决的领域挑战在于,传统视觉语言导航任务中智能体仅依赖单目第一人称视角,难以感知环境全貌,导致在需要全局理解或空间推理的场景中表现欠佳。通过引入环绕视角特征,ABP 旨在突破这一感知瓶颈,但构建过程亦面临多重困难:首先,数据采集需严格对齐 ALFRED 的轨迹与动作注释,确保环绕视图与自中心视角在时间与空间上的一致性;其次,数据规模庞大(约1.6TB),包含原始 RGB 图像、深度图、物体掩码及多种增强后的特征文件,对存储与计算资源构成挑战;此外,为确保模型鲁棒性,数据集采用了颜色通道交换与 AutoAugment 等增强手段,但需验证这些操作在语义保持与任务泛化上的有效性,避免引入噪声干扰指令执行逻辑。
常用场景
经典使用场景
该数据集为基于ALFRED框架的交互式指令跟随任务提供了增强的视觉感知数据,核心特色在于融合了智能体的自我中心视角与四个导航方向(左转、右转、上仰、下俯)的全景特征。研究者通常利用预提取的ResNet-18全景特征(维度为[5, T, 512, 7, 7])来训练模型在复杂室内环境中理解自然语言指令并执行序列化动作。通过引入颜色通道交换和AutoAugment等图像增强策略,该数据集有效提升了模型对视觉变化的鲁棒性,成为评估智能体空间认知与多视角融合能力的标准基准。
实际应用
在实际应用层面,该数据集直接服务于家庭服务机器人和虚拟助手的视觉导航系统。例如,机器人可借助全景特征在厨房或客厅等复杂场景中根据‘打开右侧台灯’等指令自主规划动作,避免因视角盲区而碰撞障碍物。此外,数据增强技术使得模型在不同光照和色彩环境下仍保持稳定性能,为跨场景部署提供了工程化基础。相关技术已逐步迁移至仓储物流和医疗辅助等需要精准空间操作的领域。
衍生相关工作
基于该数据集衍生了多项经典工作,包括MOCA(ICCV 2021)提出的感知与策略解耦框架,通过分离视觉特征提取和动作决策模块降低训练复杂度;MCR-Agent(AAAI 2023 Oral)引入多层级组合推理机制,使智能体能够逐步分解复杂指令;以及CL-ALFRED(ICLR 2024)探索的在线持续学习范式,解决了模型在新任务场景中灾难性遗忘的问题。这些工作共同构成了交互式指令跟随领域的技术演进脉络,从全景感知到认知架构均实现了突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务