XPose
收藏资源简介:
XPose是由上海交通大学团队构建的首个高质量非人类姿态公开数据集,包含5万条姿态-视频配对数据,旨在支持通用姿态引导视频生成研究。该数据集从Koala和UltraVideo原始视频中筛选单主体非人类视频,通过Grounded-SAM2进行主体分割和BlumNet姿态提取,采用严格的质量控制算法确保时空一致性。数据涵盖多样化的运动类型(如行走、飞行)和生物类别(如动物、虚构角色),其细粒度标注为跨物种姿态迁移、动画制作等应用提供了重要基准,解决了现有方法仅支持人类姿态的局限性问题。
XPose is the first high-quality public non-human pose dataset constructed by the research team at Shanghai Jiao Tong University. It contains 50,000 pose-video paired samples, aiming to support research on general pose-guided video generation. The dataset selects single-subject non-human videos from the original Koala and UltraVideo datasets, leverages Grounded-SAM2 for subject segmentation and BlumNet for pose extraction, and employs strict quality control algorithms to ensure spatio-temporal consistency. Covering diverse motion types such as walking and flying, as well as biological categories including animals and fictional characters, its fine-grained annotations provide a critical benchmark for applications like cross-species pose transfer and animation production, addressing the limitation of existing methods that only support human pose-related tasks.
PoseAnything 数据集概述
数据集基本信息
- 数据集名称:PoseAnything
- 核心任务:通用姿态引导视频生成
- 主要贡献:首个能够处理人类与非人类角色、支持任意骨骼输入的通用姿态引导视频生成框架
关键方法与创新
- Part-aware Temporal Coherence Module:将主体划分为不同部分,建立部分对应关系,并通过跨帧对应部分间的交叉注意力实现细粒度的部分级别一致性。
- Subject and Camera Motion Decoupled CFG:一种新颖的引导策略,通过将主体运动和相机运动控制信息分别注入CFG的正负锚点,首次在姿态引导视频生成中实现独立的相机运动控制。
- XPose数据集:一个高质量公共数据集,包含50,000个非人类姿态-视频对,并配有自动化的标注和过滤流程。
实验与评估
- 比较方法:
- 人类数据对比:与UniAnimate、Animate-X、MagicPose等最先进方法进行比较。
- 非人类数据对比:与ATI、SG-I2V、Tora等轨迹引导视频生成方法进行比较。
- 评估结果:
- 在人类数据上,模型在运动连续性、外观一致性和背景稳定性方面表现优异。
- 在非人类数据上,模型在精确的对象姿态控制方面展现出显著优势,而竞争方法难以实现帧级姿态对齐,且在大范围运动合成中容易产生幻觉。
数据资源
- 演示视频:包含在页面中(demo_video)。
- 对比案例:
- 人类数据:提供4个测试案例的详细对比。
- 非人类数据:提供11个测试案例的详细对比。
相关链接
- arXiv论文:https://arxiv.org/
- GitHub仓库:https://github.com/




