TAG-Bench-Video
收藏资源简介:
TAG-Bench是一个用于评估视频生成模型中人类动作真实性的基准数据集。它包含300个由5种不同模型生成的视频片段,以及来自246名人类评估者的评分。评分涵盖两个关键维度:动作一致性(AC)和时间连贯性(TC)。数据集设计为5种模型×10种动作×6种种子=300个视频,所有视频均为合成内容,无真实世界片段。数据集的目标是评估当前视频生成模型在捕捉常见物理动作的合理人类运动方面的表现。
TAG-Bench is a benchmark dataset for evaluating the authenticity of human actions in video generation models. It includes 300 video clips generated by five distinct models, along with ratings from 246 human evaluators. The ratings cover two key dimensions: Action Consistency (AC) and Temporal Coherence (TC). The dataset is structured as 5 models × 10 actions × 6 seeds, resulting in exactly 300 videos in total. All videos are synthetic and contain no real-world footage. The core objective of TAG-Bench is to assess the performance of current video generation models in generating plausible human movements for common physical actions.
TAG-Bench 数据集概述
基本信息
- 数据集名称:TAG-Bench
- 许可证:Creative Commons Attribution 4.0 International (CC BY 4.0)
- 任务类别:其他
- 标签:视频、生成模型、人工评估
- 规模类别:1K<n<10K
- 语言:英语
数据集简介
TAG-Bench 是一个用于评估视频生成模型中人体运动真实性的基准数据集。它包含 300 个生成的人体动作视频片段,以及来自一项涉及 246 名人类评估者的大规模研究收集的人工评分。
评分维度
评分涵盖两个关键维度:
- AC – 动作一致性(运动与预期动作的匹配程度)
- TC – 时间连贯性(运动在时间上以物理上合理且平滑的方式演化的程度)
数据集目标
TAG-Bench 旨在评估当前视频生成模型在捕捉常见物理动作的合理人体运动方面的表现。
数据集摘要
- 视频数量:300
- 模型数量:5
Hunyuan(模型名称:HunyuanVideo-I2V-720,分辨率:1088x832)Opensora_768(模型名称:Opensora-768px,分辨率:1024×576)RunwayGen4(模型名称:Gen4-Turbo,分辨率:1280x720)Wan2p1(模型名称:Wan2.1-I2V-14B-720P,分辨率:1104×816)Wan2p2(模型名称:Wan2.2-I2V-A14B,分辨率:1280x720)
- 动作类别数量:10(来自 UCF101 数据集的人体动作)
BodyWeightSquatsHulaHoopJumpingJackPullUpsPushUpsShotputSoccerJugglingTennisSwingThrowDiscusWallPushups
- 设计:5 个模型 × 10 个动作 × 6 个种子 = 300 个视频
- 内容:所有视频均为视频生成模型的合成输出(无真实世界镜头)。
研究目的
TAG-Bench 旨在研究:
- 不同视频模型在同一组动作提示上的表现
- 简单或先进的自动运动指标与人类判断的相关性
- 人体运动在动作一致性和时间连贯性方面的失败模式
相关资源
- 项目页面:https://xthomasbu.github.io/video-gen-evals/
- 论文:https://arxiv.org/abs/2512.01803




