遇见数据集

nfl-4th-downs-dataset

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

NFL四档进攻决策数据集(1999-2025)是一个专门用于分析和预测美式橄榄球比赛中教练在四档进攻时决策的机器学习数据集。该数据集从1999年至2025年共27个NFL赛季的完整比赛逐次播放数据中筛选出所有四档进攻场景,总计113,156次四档进攻播放,覆盖7,273场比赛。数据集的核心任务是预测教练在四档进攻时的决策类型,目标变量为三类:go(跑动或传球进攻)、punt(弃踢)和fg(射门尝试)。数据集中包含28个特征字段,涵盖比赛背景(赛季、比赛ID、节次、剩余时间等)、场地位置(距离对方端区距离、需要推进码数等)、球队信息(控球方、防守方、主客队等)、胜率预期和博彩背景(胜率、让分盘、总分盘等)。数据集按训练集(90,524个样本)、验证集(11,316个样本)和测试集(11,316个样本)划分,类别分布显示弃踢决策占主导(61.75%),射门尝试占23.77%,进攻尝试占14.49%。该数据集适用于构建分类模型,研究教练决策模式,分析比赛策略,以及体育分析相关的机器学习任务。

The NFL Fourth-Down Decision Dataset (1999-2025) is a specialized machine learning dataset designed for analyzing and predicting coaches decisions during fourth-down plays in American football games. It is derived from complete play-by-play data across 27 NFL seasons from 1999 to 2025, filtering all fourth-down scenarios, totaling 113,156 fourth-down plays covering 7,273 games. The core task of the dataset is to predict the type of coach decision on fourth down, with the target variable categorized into three classes: go (run or pass offensive attempt), punt (punt), and fg (field goal attempt). The dataset includes 28 feature fields covering game context (season, game ID, quarter, time remaining, etc.), field position (distance to opponents end zone, yards to gain, etc.), team information (possessing team, defending team, home/away team, etc.), win probability expectations, and betting background (win probability, point spread, over/under, etc.). The dataset is split into training set (90,524 samples), validation set (11,316 samples), and test set (11,316 samples). The class distribution shows that punt decisions dominate (61.75%), field goal attempts account for 23.77%, and offensive attempts account for 14.49%. This dataset is suitable for building classification models, studying coach decision patterns, analyzing game strategies, and machine learning tasks related to sports analytics.

创建时间:
2026-06-22
原始信息汇总

数据集概述

数据集名称: NFL 4th Down Decision Dataset (1999–2025)

数据集地址: https://huggingface.co/datasets/afzalmengal/nfl-4th-downs-dataset

核心任务: 基于比赛上下文,预测NFL球队在第4档进攻时的教练决策(强攻、弃踢或射门)。

目标变量

label 字段表示决策类别,由原始 play_type 映射而来:

标签 含义
go 强攻(跑球或传球)
punt 弃踢
fg 射门

特征说明

比赛上下文 (Game Context)

  • game_id: 唯一比赛标识
  • season: NFL赛季(1999–2025)
  • qtr: 节次
  • game_seconds_remaining: 比赛剩余秒数
  • score_differential: 持球队得分与防守队得分之差
  • home_score: 主队得分
  • away_score: 客队得分

场上位置 (Field Position)

  • yardline_100: 距对方端区的距离(0–100)
  • ydstogo: 首攻所需码数
  • goal_to_go: 是否处于达阵区前(1/0)

球队信息 (Teams)

  • posteam: 持球进攻队
  • defteam: 防守队
  • home_team: 主队
  • away_team: 客队

胜率与博彩 (Win Expectancy / Betting)

  • wp: 胜率概率
  • spread_line: 拉斯维加斯让分盘口
  • total_line: 拉斯维加斯总分线

原始标签与标签

  • play_type: NFL原始进攻类型
  • label: 清洗后的决策类别

数据集规模与统计

项目 数值
总行数(第4档进攻) 113,156
总比赛数 7,273
覆盖赛季 27个(1999–2025)
原始列数 372

类别分布(目标变量 label

类别 数量 百分比
go 15,515 14.49%
punt 66,137 61.75%
fg 25,455 23.77%

每场比赛平均第4档进攻次数: 15
每赛季平均比赛数: 269

数据集划分

划分 样本数
训练集 (train) 90,524
验证集 (validation) 11,316
测试集 (test) 11,316

使用示例

python from datasets import load_dataset

dataset = load_dataset("your-username/nfl-fourth-down-dataset")

train_data = dataset["train"] print(train_data[0])

搜集汇总
数据集介绍
nfl-4th-downs-dataset 数据集图片
构建方式
该数据集源自NFL 1999至2025赛季的逐场逐档数据,经过精细筛选,仅保留第四档进攻的回合信息。原始数据集包含372个维度,经处理后提取出与教练决策紧密相关的核心特征,如比赛时间、场上位置、胜率预期和博彩赔率等。标签变量基于原始进攻类型进行归并,将弃踢、射门和强打作为三类决策标签,从而将复杂的体育竞技场景转化为清晰的分类任务,便于机器学习模型进行建模与分析。
特点
数据集横跨27个赛季,涵盖7273场比赛,共收录113156个第四档进攻样本,具有显著的时间广度和样本丰度。特征体系兼顾了比赛情境(如剩余时间与分差)、空间位置(如距端区距离与所需码数)以及外部预期(如胜率与让分盘),结构完整且层次分明。类别分布呈现典型的不均衡特征,弃踢决策占据主导地位(约61.7%),而强打决策仅占14.5%,反映了真实比赛中保守策略的普遍倾向。
使用方法
使用者可通过HuggingFace Datasets库便捷加载:`from datasets import load_dataset` 后调用 `load_dataset("用户名/nfl-fourth-down-dataset")` 即可获得预划分的训练、验证与测试集合。每个样本均为包含游戏ID、赛季、攻防球队、时间位置、胜率及决策标签等29个字段的结构化记录。研究者可直接将`label`字段作为目标变量,开展第四档决策预测的二分类或三分类建模任务,亦可利用丰富的特征进行策略优化与情境分析。
背景与挑战
背景概述
在美式橄榄球竞技中,第四档进攻决策是决定比赛走向的关键战术环节,历来依赖教练经验与直觉。然而,随着数据分析在体育领域的深度渗透,基于历史数据量化决策价值成为研究热点。nfl-4th-downs-dataset数据集由数据科学家与橄榄球分析专家于近年来构建,覆盖1999至2025赛季,涵盖超过11万条第四档进攻记录,核心研究问题在于利用比赛情境特征(如球场位置、比分差、获胜概率等)预测教练的实际决策(强攻、弃踢或射门)。该数据集通过系统整理NFL逐档数据,为运动分析、决策建模及人工智能辅助战术研究提供了标准化基准,显著推动了体育数据科学领域的实证发展。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:第四档决策受多因素非线性交互影响,如剩余时间、球队风格与对手防守强度,传统统计模型难以捕捉潜藏模式。此外,构建过程中需应对数据稀疏性与类别不平衡——弃踢占样本近62%,而强攻仅占14%,易导致模型偏向主导类别。噪声标注也是一大难题,原始play_type中包含“no_play”等非典型类别,须经严格清洗与映射标签。同时,历史数据的特征维度高达372列,需降维提取有效信息,并确保跨赛季数据的统计一致性,这都对特征工程与模型泛化能力提出了严苛要求。
常用场景
经典使用场景
在美式橄榄球数据分析领域,NFL第四次进攻决策数据集为研究者提供了自1999年至2025年跨越27个赛季的完整第四次进攻回合数据。该数据集最经典的使用场景是构建机器学习分类模型,基于比赛情境特征预测教练在第四档的战术抉择——究竟是选择强攻推进、弃踢交出球权,还是尝试射门得分。通过整合诸如剩余比赛秒数、得分差、端区距离、胜率期望等精细化的情境变量,研究人员能够模拟并揭示不同比赛状态下决策的潜在逻辑规律。
衍生相关工作
基于该数据集,已经衍生了多项具有代表性的研究工作。一些学者将其与强化学习框架相结合,构建了能够动态调整策略的第四档决策智能体,模拟不同战术选择对比赛后续进程的影响。另外,也有研究将该数据集作为基准,对比不同分类算法在决策预测任务上的性能差异,并探讨特征工程与数据平衡技术对模型效果的提升。这些衍生工作不仅拓展了数据集的应用广度,也推动了体育分析与人工智能交叉领域的持续创新。
数据集最近研究
最新研究方向
在体育分析与人工智能交汇的前沿,该数据集聚焦于美式橄榄球中至关重要的第四次进攻决策预测,通过跨越27个赛季的详尽比赛情境数据,为机器学习模型提供了研究教练决策行为的丰沃土壤。当前研究热点在于利用深度学习和博弈论方法,基于实时比赛态势(如胜率预期、场地位置、比分差)模拟最优选择,并与实际人类决策进行对比分析,从而揭示战术倾向性与风险偏好规律。这一方向不仅推动了体育科学中数据驱动决策模型的演进,也为人工智能在复杂动态环境下的策略学习提供了真实的竞技场验证平台,其成果对提升球队战术效率和观众分析体验具有显著的现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务