GOAL
收藏数据链接:
官方服务:
资源简介:
GOAL是首个英文体育赛事摘要数据集,由苏州大学创建,包含103对评论与新闻样本,平均评论长度为2724.9字,新闻长度为476.3字。数据集通过爬取英文体育网站Goal.com收集,涵盖2016至2020年四大足球联赛的赛事。创建过程包括数据爬取和样本配对,旨在解决体育新闻自动生成的问题,支持半监督学习研究。
GOAL is the first English-language sports event summarization dataset, developed by Soochow University. It comprises 103 paired commentary and news samples, with an average length of 2724.9 words for the commentary and 476.3 words for the news. The dataset was collected by crawling the English sports website Goal.com, covering matches from the four major football leagues between 2016 and 2020. Its development process includes data crawling and sample pairing, aiming to address the challenge of automatic sports news generation and support semi-supervised learning research.
提供机构:
苏州大学创建时间:
2022-07-18
搜集汇总
数据集介绍

构建方式
GOAL数据集的构建源于对实时足球解说这一复杂应用场景的深入探索。研究团队从SoccerNet-v2开源数据集中精选了80场完整比赛视频,通过Azure ASR工具将解说语音转换为原始文本,并依据分辨率与解说稀疏性筛选出20场高质量比赛作为标注候选。随后,一支由10名英语母语者且资深球迷组成的标注团队执行了多轮人工标注任务,包括解说文本校对、视频-文本时间轴对齐、知识实体识别与句子类型分类。为丰富视频关联知识,团队从专业体育平台爬取比赛相关半结构化与非结构化知识,并利用BLINK工具将实体链接至Wikidata以获取结构化知识,最终构建了超过8.9k个视频片段、22k条句子与42k个知识三元组的高质量基准。
使用方法
GOAL数据集的使用遵循知识驱动视频描述(KGVC)任务范式,即模型需基于输入视频片段,选择相关背景知识并生成富含知识的解说文本。研究团队为适配现有模型提供了预处理接口,包括基于关键事件与文本长度的视频分割(平均片段长度10.31秒)、2D/3D视觉特征建模(利用ResNet提取)以及知识特征构建。实验表明,直接应用HMN、SwinBERT、ALPRO等主流模型时性能显著下降(如SwinBERT的CIDEr从95.5降至3.7),而通过设计知识提示或融合知识特征可带来有限提升。该数据集特别适合用于探索实体-对象链接、知识感知推理及大语言模型链式思考等前沿方向。
背景与挑战
背景概述
在视频描述生成领域,现有基准多聚焦于粗粒度场景的简单描述,难以满足真实应用中如体育解说等需要融合背景知识的细粒度、生动叙述需求。为填补这一空白,清华大学计算机系与腾讯平台与内容事业群的研究团队于2023年提出了GOAL数据集,旨在推动知识驱动视频描述生成(KGVC)任务的发展。该数据集基于开源SoccerNet-v2中超过40小时的足球比赛视频,经过精细筛选与标注,最终包含8.9k个视频片段、22k条解说文本及42k个知识三元组,并关联了来自WhoScored和Wikidata的异构知识。GOAL的发布为视频理解与自然语言生成交叉领域提供了极具挑战性的新基准,其核心研究问题在于如何使模型在理解视频动态的同时,调用外部知识生成兼具准确性与生动性的描述,对体育解说、智能问答等应用具有重要推动作用。
当前挑战
GOAL数据集所面临的挑战主要体现在两个方面。在领域问题层面,现有视频描述模型难以应对KGVC任务的三重需求:一是视频理解需从粗粒度物体识别升级为细粒度实体链接(如将“人”识别为“Walcott”),并推理多动作组合事件(如“踢球”与“庆祝”推断为“进球”);二是需建立视频、文本与背景知识之间的跨模态关联;三是需利用知识生成富含信息的长文本,而非简单描述画面。在构建过程中,挑战同样显著:原始广播视频中解说文本与画面时间轴的对齐依赖人工校对,需10名母语为英语的资深球迷完成双重校验;知识扩展需从专业平台与Wikidata中爬取并筛选结构化与非结构化信息,确保数据时效性与相关性;此外,视频分割需结合事件检测与文本长度,处理平均10.31秒的片段,并提取2D/3D视觉特征以供模型适配,过程复杂且耗时。
常用场景
经典使用场景
在视频描述生成领域,传统基准数据集如MSVD和MSR-VTT多聚焦于粗粒度的场景理解,而GOAL数据集则开创性地引入了知识驱动的视频描述任务。该数据集由超过8.9k个足球比赛视频片段、22k条解说文本及42k个知识三元组构成,每个视频片段平均关联193.1个知识三元组,为模型提供了丰富的结构化与非结构化背景知识。其经典使用场景在于评估模型在复杂体育赛事中,能否基于视频视觉内容与外部知识(如球员信息、球队历史、战术术语)生成兼具准确性与生动性的实时解说,从而推动视频描述从简单的场景叙述向知识增强的智能叙事演进。
解决学术问题
GOAL数据集直面现有视频描述模型在知识整合与细粒度理解上的双重短板。传统模型常因缺乏背景知识而导致实体识别错误(如混淆球员姓名)、动作误解(如无法区分守门员与后卫的防守动作)及知识缺失(如对裁判规则的无知)。该数据集通过构建“视频-文本-知识”三元对齐的标注体系,系统性地提出了知识增强视频描述(KGVC)这一新任务设置,促使研究者探索如何将外部知识图谱(如Wikidata)与视觉特征进行深度融合。其意义在于为计算机视觉与自然语言处理交叉领域提供了一个高难度的评测基准,揭示了现有方法在知识推理与长文本生成上的显著不足,进而引导学术社区关注模型的知识获取与逻辑推理能力。
实际应用
在实际应用层面,GOAL数据集的核心价值在于赋能体育赛事自动解说系统。例如,在足球比赛直播中,模型需实时识别场上球员(如识别梅西而非一般运动员)、理解战术动作(如区分“扑救”与“逼抢”),并调用背景知识(如球队历史战绩、球员赛季首球)生成专业且富有感染力的解说词。这一技术可广泛应用于电视转播、体育资讯平台及虚拟现实观赛场景,为观众提供个性化、深度的赛事解读。此外,该数据集所培养的知识增强模型还可迁移至其他领域,如医学影像描述(结合病历知识)、自动驾驶场景叙事(融合交通规则)等,展现出跨领域的应用潜力。
数据集最近研究
最新研究方向
在视频描述生成领域,传统基准多聚焦于粗粒度场景的简短描述,而GOAL数据集开创性地提出了知识驱动的视频描述生成(KGVC)任务,将研究前沿推向更具挑战性的实时体育解说生成。该数据集通过整合超过8.9k个足球视频片段、22k条解说文本及42k个知识三元组,构建了视频、文本与外部知识(如球员信息、战术统计)的精细对齐。当前研究热点集中于如何利用大规模语言模型(如LLM)的推理能力与知识图谱进行链式思考,以解决实体误匹配、动作误解和知识缺失等核心难题。这一方向不仅推动了视频理解与自然语言生成技术的深度融合,更在自动体育解说、人机交互等应用中具有里程碑式意义,标志着视频描述正从视觉感知迈向知识推理的新纪元。
相关研究论文
- 1GOAL: A Challenging Knowledge-grounded Video Captioning Benchmark for Real-time Soccer Commentary Generation清华大学计算机科学与技术系 · 2023年
以上内容由遇见数据集搜集并总结生成



