原始下载地址:https://zenodo.org/record/4682137/files/msva_video_summarization.tar 放到hf里面因为hf速度快. upload the data to hf , because hf download is faster. the code to use this data for video hightlight detec
VISTA数据集是由Saarland University、University of Cambridge和University of Edinburgh共同创建的一个英语多模态数据集,专为科学领域的视频到文本摘要任务设计。该数据集包含来自计算语言学和机器学习领域领先会议的18599对视频和相应论文摘要的配对,涵盖了从2020年到2024年的内容。数据集的平均视频长度为6.76分钟,摘要平均包含1