遇见数据集

T2V视频质量评估数据集

收藏
arXiv2023-09-15 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

本数据集由都柏林城市大学的数据分析中心创建,包含超过1000个由5种最新文本到视频(T2V)模型生成的视频。数据集旨在评估这些视频的自然性和与文本提示的语义匹配度,通过应用多种质量评估指标和人类评估来比较不同模型的表现。数据集的应用领域主要集中在AI视频生成质量评估,旨在解决如何有效评估T2V模型输出质量的问题。

This dataset was developed by the Data Analytics Center at Dublin City University, and contains over 1,000 videos generated by five state-of-the-art text-to-video (T2V) models. It aims to assess the naturalness of these videos as well as their semantic alignment with given text prompts, by utilizing multiple quality assessment metrics and human evaluation to compare the performance across different models. The dataset is primarily targeted at the field of AI video generation quality assessment, with the goal of addressing the challenge of effectively evaluating the output quality of T2V models.

创建时间:
2023-09-15
搜集汇总
数据集介绍
T2V视频质量评估数据集 数据集图片
构建方式
该数据集基于五种前沿的开源文本到视频生成模型(包括VideoFusion、Text-to-Video Synthesis、Text2Video-Zero、Aphantasia及Tune-a-Video),通过精心筛选的201条文本提示词,生成了共计1005段视频。每条提示词涵盖广泛的主题与长度分布,确保视频内容的多样性与代表性。研究团队进一步招募了24名标注员,从视频与提示词的对齐程度及感知质量两个维度,对每段视频进行了人工评分,最终收集到超过48000个质量评价数据,构建了包含自动指标与人类评估的综合性视频质量评估库。
特点
本数据集的核心特色在于其双轨评估体系:一方面集成了包括Inception Score、Fréchet Video Distance、CLIPSim在内的多种自动质量指标,另一方面引入了基于人类感知的对齐度与自然度评分。特别地,数据集创新性地提出了一个集成式视频质量度量方法,融合了基于XGBoost的自然度分类器与结合BERT及余弦相似度的文本相似性度量,以捕捉生成视频在视觉真实感与语义匹配上的微妙差异。此外,数据集中还包含了不同模型在不同长度提示词下的表现分布,揭示了提示词长度对生成质量的显著影响。
使用方法
研究者可利用该数据集对文本到视频生成模型进行多维度的质量评估与比较。通过数据集提供的自动指标计算结果与人类评分,用户能够验证现有评估指标的有效性,或训练新的视频质量预测模型。数据集中的视频、提示词及模型参数均已公开,支持复现实验与二次开发。建议使用者在分析时重点关注自然度与语义匹配的联合评估,同时结合提示词长度与模型类型的交叉分析,以全面理解生成视频的质量特性。
背景与挑战
背景概述
随着文本到视频生成技术的迅猛发展,如何公正且全面地评估生成视频的质量成为亟待解决的关键问题。2023年,都柏林城市大学的Iya Chivileva、Philip Lynch、Tomás E. Ward与Alan F. Smeaton等研究人员构建了T2V视频质量评估数据集,旨在系统性地对比自动评估指标与人工评估在文本生成视频质量判断上的表现。该数据集涵盖了来自五种前沿T2V模型(包括Text2Video-Zero、VideoFusion等)生成的超过1000段视频,并附有24名标注者提供的48000余项人工评分,聚焦于视频的自然度与文本对齐度两大维度。该研究不仅揭示了现有指标(如Inception Score、FVD、CLIPSim)的局限性,还提出了集成评估框架T2V-CL,为文本生成视频质量评估领域提供了重要的基准资源与实证基础。
当前挑战
该数据集所应对的核心挑战之一在于现有自动评估指标难以精准捕捉生成视频的自然度与语义匹配度,例如Inception Score对低质量视频的误判、FVD对参考视频的依赖以及CLIPSim对语义相似性的过度乐观估计,导致单一指标无法全面反映视频的真实质量。在数据集构建过程中,研究人员面临多方面的困难:首先,需从五个迥异的T2V模型中生成风格与质量差异显著的视频样本,并确保文本提示的多样性与覆盖度;其次,人工评估环节需协调24名标注者在远程环境下完成大规模评分任务,同时处理评分主观性带来的偏差,并通过调整MOS分数与Tukey HSD检验来提升评估的可信度;此外,训练自然度分类器时需手动标注大量视频样本,并融合纹理、色彩、频谱等多维统计特征,以克服传统图像质量指标(如NIQE、BRISQUE)在区分自然与非自然内容上的不足。
常用场景
经典使用场景
在文本到视频(T2V)生成模型迅猛发展的浪潮中,如何公正且全面地衡量生成视频的质量成为关键挑战。T2V视频质量评估数据集应运而生,其经典使用场景在于系统性地比较不同T2V模型的输出质量。该数据集汇集了来自五种前沿开源模型(如Tune-a-Video、VideoFusion、Text2Video-Zero等)生成的超过1000个视频,并配以详尽的文本提示。研究者可借助该数据集,对模型在视频自然度与文本语义对齐度两大维度上进行量化评估,从而揭示不同模型在生成逼真、连贯且与提示高度匹配的视频内容方面的优劣差异。
解决学术问题
该数据集直击T2V领域长期存在的评估困境,即传统指标(如Inception Score、Fréchet Video Distance和CLIPSim)虽被广泛使用,却存在显著局限,例如对非自然图像判别力不足、依赖参考视频、或对语义匹配的捕获不够精准。通过提供大量带有细粒度人工标注(涵盖对齐度与感知质量)的视频样本,该数据集为学术界搭建了一个基准测试平台,使研究者能够深入剖析自动评估指标与人类主观判断之间的关联与偏差。其意义在于推动开发更可靠、更全面的视频质量评估方法,从而为T2V模型的迭代优化提供科学依据。
衍生相关工作
基于该数据集的发布,一系列衍生工作应运而生,进一步拓展了其学术价值。例如,研究者借鉴了该数据集中的自然度分类器设计思路,开发出融合纹理、色彩分布与频域统计特征的集成式质量评估模型T2V-CL,显著提升了自动评分与人类判断的一致性。此外,该数据集还催生了关于提示长度与生成质量关系的深入探讨,揭示了长提示对模型语义对齐能力的挑战。这些后续工作不仅验证了数据集的实用性,更推动了从单一指标向多维度、多模态评估范式的转变,为视频生成领域的质量研究奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务