AnyViewBench
收藏资源简介:
AnyViewBench是由丰田研究院与亚马逊网络服务联合构建的综合性动态视图合成基准,旨在解决极端相机轨迹下的多视角视频生成问题。该数据集整合了12个跨领域4D数据集(如驾驶、机器人、人类活动等),涵盖单视角与多视角视频,通过加权采样确保各领域数据均衡。其数据来源包括真实场景与仿真环境,支持复杂相机运动模式(固定、线性、非线性)及内外参变化。该基准的建立推动了无需显式3D重建的隐式神经表示研究,主要应用于机器人视觉、自动驾驶、VR/AR等领域,为生成视角一致且时空稳定的动态场景提供评估基础。
AnyViewBench is a comprehensive dynamic view synthesis benchmark jointly developed by Toyota Research Institute and Amazon Web Services, which aims to address the multi-view video generation problem under extreme camera trajectories. This dataset integrates 12 cross-domain 4D datasets (e.g., driving scenarios, robotic applications, human activity recordings, etc.), covering both single-view and multi-view videos, and ensures balanced data distribution across domains via weighted sampling. Its data sources encompass both real-world scenes and simulated environments, and supports complex camera motion modes including fixed, linear, and nonlinear motions, as well as variations in intrinsic and extrinsic camera parameters. This benchmark has advanced the research on implicit neural representations that do not require explicit 3D reconstruction. It is primarily applied in fields such as robotic vision, autonomous driving, VR/AR, and provides an evaluation foundation for generating dynamic scenes with consistent viewpoints and spatio-temporal stability.
AnyView数据集详情总结
数据集名称
AnyView
核心任务
动态视角合成:给定任意摄像机轨迹拍摄的单段视频,预测同一场景在任意其他摄像机轨迹下、时间同步的视频。
方法概述
- 基础模型:采用潜在扩散变换器(Cosmos)作为基础模型。
- 核心机制:不依赖扭曲深度图等显式条件,仅依靠隐式学习的4D表示。
- 摄像机参数编码:将所有摄像机参数编码为统一的普吕克表示P=(r,m),将外参和内参组合成密集的每像素光线和矩向量。这些嵌入沿通道维度连接,而两个视点沿序列维度连接以形成完整的令牌集。
数据集构成
训练数据
结合了来自四个不同领域的12个不同的4D(多视角视频)数据集:
- Robotics
- Driving
- 3D
- Other 训练时执行加权采样,确保每个领域被等频率(即批次的25%)看到,以创建平衡的表示。
新引入的数据集/基准
-
Kubric-5D
- 描述:新生成的Kubric-4D变体,极大地增加了摄像机轨迹的多样性,并融入了诸如推拉变焦等高级电影制作效果。这些场景包含具有丰富视觉外观和复杂动态的多物体交互,并提供覆盖多种摄像机运动的同步多视角视频。
- 下载状态:下载链接即将发布!
-
AnyViewBench
- 描述:一个多方面的基准测试,涵盖多个领域的数据集:
- Driving: Argoverse, DDAD, Lyft-L5, ParallelDomain, Waymo
- Robotics: DROID, Kubric, LBM
- Human Activity: AssemblyHands, Ego-Exo4D
- 下载状态:下载链接即将发布!
- 描述:一个多方面的基准测试,涵盖多个领域的数据集:
评估与结果
- 评估基准:在标准基准测试上评估,展示了与当前最先进技术具有竞争力的结果。
- 极端场景性能:在提出的新基准AnyViewBench(针对多样真实世界场景中的极端动态视角合成)上,大多数基线方法性能急剧下降,而AnyView在从任何视点提示时,仍能保持生成真实、合理且时空一致视频的能力。
- 对比方法:包括Depth reprojection、GCD、TrajAttn、GEN3C、TrajCrafter、CogNVS等。
关键特性
- 端到端操作:不依赖显式3D重建或昂贵的测试时优化。
- 支持极端视点位移:输入和输出视点之间可能几乎没有重叠。
- 保持一致性:在显著不同的目标姿态和高度“不完整”的视觉观察下,仍能保持场景几何、外观和动态。
- 零样本生成:能够从任意摄像机位置和轨迹生成零样本的新视频。
- 高级推理能力:展示了利用细微视觉线索提高未观察区域生成准确性的能力,体现了高级常识和时空推理。
论文信息
- 标题:AnyView: Synthesizing Any Novel View in Dynamic Scenes
- 状态:In Submission
- 年份:2026
- 作者:Basile Van Hoorick, Dian Chen, Shun Iwase, Pavel Tokmakov, Muhammad Zubair Irshad, Igor Vasiljevic, Swati Gupta, Fangzhou Cheng, Sergey Zakharov, Vitor Campagnolo Guizilini
- 机构:Toyota Research Institute, Amazon Web Services
- BibTeX引用:
@inproceedings{vanhoorick2026anyview, title={AnyView: Synthesizing Any Novel View in Dynamic Scenes}, author={Van Hoorick, Basile and Chen, Dian and Iwase, Shun and Tokmakov, Pavel and Irshad, Muhammad Zubair and Vasiljevic, Igor and Gupta, Swati and Cheng, Fangzhou and Zakharov, Sergey and Guizilini, Vitor Campagnolo}, journal={In Submission}, year={2026}}




