CameraBench
收藏资源简介:
CameraBench是一个大规模的数据集,包含超过150K的二进制标签和约3,000个视频的标注,涵盖了多种类型、流派、视角、捕获设备和后期制作效果(例如自然、电影、游戏、2D/3D、真实/合成、GoPro、无人机镜头等)。
CameraBench is a large-scale dataset containing over 150K binary labels and annotations for approximately 3,000 videos, covering diverse categories, genres, perspectives, capture devices and post-production effects, such as natural scenery, cinematic works, games, 2D/3D content, real/synthetic media, GoPro footage, drone footage and more.
CameraBench 数据集概述
📌 数据集简介
- 名称: CameraBench
- 目标: 理解视频中的摄像机运动
- 核心内容: 提供1000+带有专家标注和字幕的测试视频
- 特色: 结合生成式视觉语言模型(VLMs)与经典SfM/SLAM方法进行几何和语义分析
📊 关键数据
- 测试集规模: 1000+视频
- 标注类型:
- 专家标注的摄像机运动标签
- 场景描述字幕
- 额外数据: 约1,400个带标注的视频片段用于监督微调(SFT)
🛠️ 技术指标
- 基准模型: 7B Qwen2.5-VL
- 性能表现:
- 经过SFT后AP翻倍
- 超越当前最佳MegaSAM模型
- 评估指标:
- VQAScore (生成式VLMs)
- CLIPScore/ITMScore (判别式VLMs)
📂 数据获取
- 测试集下载: HuggingFace仓库
- 下载脚本: python python download_test_videos.py --save_dir ./your_target_folder python download_test_data.py --save_dir ./your_target_folder
📄 相关资源
- 论文: arXiv:2504.15376
- 主页: 项目主页
- 排行榜: 完整排行榜
✍️ 引用格式
bibtex @article{lin2025towards, title={Towards Understanding Camera Motions in Any Video}, author={Lin, Zhiqiu and Cen, Siyuan and Jiang, Daniel and Karhade, Jay and Wang, Hewei and Mitra, Chancharik and Ling, Tiffany and Huang, Yuhan and Liu, Sifan and Chen, Mingyu and Zawar, Rushikesh and Bai, Xue and Du, Yilun and Gan, Chuang and Ramanan, Deva}, journal={arXiv preprint arXiv:2504.15376}, year={2025}, }




