遇见数据集

RenderIH

收藏
arXiv2023-09-28 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

RenderIH是一个大规模的合成数据集,专门用于3D交互手势姿态估计。该数据集由阿里巴巴集团和上海人工智能实验室创建,包含100万张照片级真实图像,涵盖了多样的背景、视角和手部纹理。数据集通过新的姿态优化算法生成自然且多样的交互姿态,并引入基于Transformer的姿态估计网络TransHand,以提高姿态估计的准确性。RenderIH数据集不仅适用于提高任何手势姿态估计方法的准确性,还能显著降低误差,从6.76mm降至5.79mm。该数据集的应用领域包括人机交互、增强现实、虚拟现实和手语识别等,旨在解决3D交互手势姿态从单一RGB图像中获取的挑战。

RenderIH is a large-scale synthetic dataset specifically designed for 3D interactive hand gesture pose estimation. Created by Alibaba Group and the Shanghai AI Laboratory, it contains 1 million photorealistic images covering diverse backgrounds, viewpoints and hand textures. The dataset generates natural and diverse interactive poses via a novel pose optimization algorithm, and introduces the Transformer-based pose estimation network TransHand to improve the accuracy of pose estimation. The RenderIH dataset can not only be applied to enhance the accuracy of any hand gesture pose estimation method, but also significantly reduce the error from 6.76 mm to 5.79 mm. Its application fields include human-computer interaction, augmented reality, virtual reality and sign language recognition, and it aims to address the challenge of recovering 3D interactive hand gesture poses from a single RGB image.

提供机构:
阿里巴巴集团
创建时间:
2023-09-17
搜集汇总
数据集介绍
RenderIH 数据集图片
构建方式
在三维交互手部姿态估计领域,现有数据集常受限于背景单一、纹理贫乏和姿态分布有限的问题。为突破这些瓶颈,RenderIH数据集基于A-MANO参数化手部模型,从InterHand2.6M中提取原始姿态并通过随机旋转增强,随后设计了一套融合抗穿透约束、手部吸引力约束、解剖学约束和对抗性判别器的多目标优化算法,生成自然且无穿透的交互手部姿态。渲染阶段,系统结合300张高动态范围全景背景图、30种精细手部纹理(涵盖肤色、皱纹、血管等细节)以及动态光照与射线追踪引擎,最终为约10万种有效姿态各配置10个相机视角,产出100万张照片级逼真的合成图像。
使用方法
RenderIH设计为模型无关的通用增强资源,可无缝融入现有手部姿态估计流程。实验表明,将数据集作为预训练源,在InterHand2.6M等真实数据上微调,可使MPJPE误差从6.76mm降至5.79mm,甚至仅用10%的真实数据即可达到全量真实数据训练的精度。使用时,建议先利用RenderIH的100万张合成图像进行预训练,以学习鲁棒的姿态与纹理先验,再结合目标真实数据集进行微调,从而显著提升在复杂遮挡和跨域场景下的泛化能力。数据集与配套的Transformer网络TransHand代码均已开源,便于研究者直接集成与复现。
背景与挑战
背景概述
三维交互手部姿态估计是计算机视觉与人类行为理解领域的关键任务,广泛应用于人机交互、增强现实及手语识别等场景。然而,真实世界中采集交互手部数据面临严重自遮挡、标注耗时且精度有限的困境。为突破这一瓶颈,由阿里巴巴集团联合上海人工智能实验室、北京大学及中佛罗里达大学的研究团队于2023年发布了RenderIH数据集。该数据集包含100万张照片级逼真的合成图像,覆盖多样化的背景、视角与手部纹理,并引入创新的姿态优化算法生成自然且无穿透的交互手部姿态。其核心研究问题在于构建大规模、高保真的合成数据集以弥补真实数据不足,显著提升三维交互手部姿态估计的泛化能力与精度,在领域内具有里程碑式的影响力。
当前挑战
RenderIH面临的挑战主要体现在两大层面。在领域问题层面,现有交互手部数据集普遍存在背景与纹理单一、姿态分布受限的缺陷,严重制约模型在复杂真实场景中的泛化性能;同时,手工标注的关节位置易受机器标注器误差影响,导致标注不精确。在构建过程中,首要挑战是生成有效且自然的交互手部姿态,需在保证双手紧密耦合的同时避免网格穿透,这要求设计兼顾吸引力与反穿透约束的优化算法。其次,渲染系统的逼真度与多样性亦构成挑战,需融合高动态范围背景、动态光照及光线追踪渲染技术,以模拟真实世界的复杂光照与纹理变化,从而缩小合成数据与真实数据之间的域差距。
常用场景
经典使用场景
在三维交互手部姿态估计领域,RenderIH数据集被广泛用作预训练与域适应基准。研究者利用其百万级高保真合成图像,涵盖多样化背景、光照与手部纹理,通过预训练策略显著提升模型在真实场景中的泛化能力。该数据集尤其擅长模拟双手紧密交互时的复杂遮挡情形,为单目RGB图像下的双手姿态回归任务提供了丰富的训练素材。其精心设计的姿态优化算法确保了生成姿态的自然性与无穿透特性,使得模型能够学习到更具鲁棒性的手部几何与运动特征。
解决学术问题
RenderIH数据集有效解决了真实双手交互数据标注成本高昂、样本分布狭窄及姿态有效性的核心难题。传统真实数据集如InterHand2.6M受限于实验室环境与机器标注误差,而合成数据集如Ego3d则存在姿态穿透与多样性不足的缺陷。RenderIH通过引入解剖学约束、对抗生成网络与多子网格穿透损失,生成了大规模、无穿透且自然度高的交互姿态,将姿态估计误差从6.76mm降至5.79mm。其意义在于为学界提供了一个模型无关的合成数据基准,大幅降低了对真实标注数据的依赖,推动了双手交互理解研究从受控场景向开放环境的跨越。
实际应用
在实际应用中,RenderIH数据集为人机交互、增强现实与虚拟现实以及手语识别等场景提供了关键支撑。通过在该合成数据上预训练,模型仅需10%的真实数据即可达到与全量真实数据训练相当的精度,极大降低了部署成本。在AR/VR领域,该数据集帮助系统更精准地捕捉用户双手的细微动作,实现自然的手势操控与虚拟物体交互;在手语识别中,其对复杂手指关节与遮挡关系的建模显著提升了非特定人手势的识别鲁棒性。此外,该数据集还支持手部分割掩码等扩展标注,便于下游任务灵活定制。
数据集最近研究
最新研究方向
在三维交互手部姿态估计领域,合成数据集的构建与优化已成为突破真实数据标注瓶颈的关键路径。RenderIH作为当前规模最大、质量最高的合成交互手部数据集,通过创新的姿态优化算法与高保真渲染系统,有效解决了现有数据集背景单一、纹理匮乏及姿态分布局限等核心问题。该数据集融合了高动态范围场景、动态光照与光线追踪技术,生成100万张具有丰富纹理、视角与光照变化的逼真图像,显著提升了模型的泛化能力。前沿研究聚焦于利用该数据集进行预训练,仅需10%的真实数据即可达到与全量真实数据训练相当的精度,并在InterHand2.6M等基准测试中将平均关节位置误差从6.76毫米降至5.79毫米。这一突破不仅推动了人机交互与增强现实等应用的发展,也为减少对昂贵真实标注数据的依赖提供了可行方案,标志着合成数据在复杂手部交互理解中的关键作用日益凸显。
相关研究论文
  • 1
    RenderIH: A Large-scale Synthetic Dataset for 3D Interacting Hand Pose Estimation阿里巴巴集团 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务