遇见数据集

jganzabalseenka/news_2024-06-08_24hs

收藏
Hugging Face2024-06-27 更新2024-06-29 收录
官方服务:

资源简介:

该数据集包含多个字段,如资产ID(asset_id)、中文标题(title_ch)、媒体(media)、影响(impact)等。每个字段都有明确的数据类型定义,如int64、string、timestamp等。数据集被分为训练集,包含11437个样本,总大小为131952400字节。

This dataset contains multiple fields such as asset_id, title_ch, media, impact, etc. Each field has a clear data type definition, such as int64, string, timestamp, etc. The dataset is divided into a training set, containing 11437 samples, with a total size of 131952400 bytes.

提供机构:
jganzabalseenka
原始信息汇总

数据集概述

数据集信息

特征

  • asset_id: 数据类型为 int64
  • title_ch: 数据类型为 string
  • media: 数据类型为 string
  • impact: 数据类型为 int64
  • start_time_utc: 数据类型为 timestamp[ns]
  • start_time_local: 数据类型为 timestamp[ns]
  • entities_curated: 数据类型为 sequence,内容为 string
  • entities: 数据类型为 sequence,内容为 string
  • predicted_at_entities: 数据类型为 timestamp[ns]
  • entities_raw_transformers: 数据类型为 list,包含以下子特征:
    • entities: 数据类型为 list,包含以下子特征:
      • end: 数据类型为 int64
      • entity_group: 数据类型为 string
      • score: 数据类型为 float64
      • start: 数据类型为 int64
      • word: 数据类型为 string
    • text: 数据类型为 string
  • entities_transformers: 数据类型为 sequence,内容为 string
  • title: 数据类型为 string
  • text: 数据类型为 string
  • keywords: 数据类型为 sequence,内容为 string
  • predicted_at_keywords: 数据类型为 timestamp[ns]
  • truncated_text: 数据类型为 string
  • title_and_text: 数据类型为 string
  • prediction_delay_predictions: 数据类型为 float64
  • prediction_delay: 数据类型为 float64

数据分割

  • train: 包含 11437 个样本,占用 131952400 字节

数据集大小

  • 下载大小: 70154491 字节
  • 数据集大小: 131952400 字节

配置

  • config_name: default
    • data_files:
      • split: train
      • path: data/train-*
搜集汇总
数据集介绍
jganzabalseenka/news_2024-06-08_24hs 数据集图片
构建方式
该数据集名为jganzabalseenka/news_2024-06-08_24hs,聚焦于2024年6月8日前后24小时内的新闻事件,属于时间敏感型新闻语料。构建过程通过多源新闻采集与自动化处理流水线实现,原始数据经实体识别(采用Transformers模型)、关键词抽取及时间戳对齐等步骤,生成结构化新闻记录。每条样本包含资产标识符、标题、媒体来源、影响评分、UTC与本地时间、策展实体列表、原始文本及截断文本等字段,最终形成11437条训练样本,总大小约132MB,以Parquet格式存储于HuggingFace Datasets中。
特点
数据集的核心特点在于其丰富的语义标注与时间维度信息。一方面,通过预测延迟指标(prediction_delay_predictions)量化新闻发布与预测时间差,为时效性分析提供支持;另一方面,实体字段涵盖原始、策展及Transformer输出三种层次,便于对比不同实体识别方法的性能。此外,数据包含标题与文本拼接字段(title_and_text),并保留关键词序列,支持多任务学习与跨模态新闻理解。影响评分(impact)的引入,更使得情感分析或事件重要性评估成为可能。
使用方法
数据集可通过HuggingFace Datasets库直接加载,使用load_dataset('jganzabalseenka/news_2024-06-08_24hs')命令即可获取训练集。用户可基于时间戳字段(start_time_utc)进行时间窗口过滤,或利用entities_transformers序列构建命名实体识别模型。对于文本分类任务,推荐使用title_and_text作为输入特征,impact作为标签。此外,prediction_delay字段可用于回归分析,预测新闻事件的响应速度。建议将数据划分为训练与验证集时,按时间顺序拆分以避免数据泄露。
背景与挑战
背景概述
在新闻传播与自然语言处理的交叉领域,结构化新闻数据集的构建对于事件监测、舆情分析和信息抽取等研究至关重要。2024年6月,由研究人员jganzabalseenka创建的news_2024-06-08_24hs数据集,聚焦于特定时间窗口内的新闻内容,旨在为多语言实体识别、关键词提取及新闻影响力预测提供标准化训练与评估资源。该数据集收录了11437条新闻样本,涵盖标题、正文、媒体来源、影响评分及多种实体标注(包括基于Transformer模型的预测结果),并细化了时间戳、本地化时间与预测延迟等元信息。其核心研究问题在于如何通过融合原始文本与自动化标注的实体、关键词,提升新闻事件的多维度理解能力。该数据集的出现,为新闻领域的时间敏感型自然语言处理任务提供了宝贵的基础支撑,尤其对实时新闻流中的实体关系抽取与影响力建模具有推动作用。
当前挑战
当前数据集面临的核心挑战首先在于领域问题的复杂性:新闻文本中的实体识别与影响力预测需应对多义性、上下文依赖以及跨媒体的一致性标注难题,例如同一实体在不同新闻来源中的表述差异可能导致模型泛化能力下降。其次,构建过程中存在显著挑战:数据集的实体标注依赖于多种自动化工具(如原始Transformer模型与定制化实体抽取流程),不同标注源之间的冲突与噪声需要精心调和;此外,时间戳的精细粒度(精确到纳秒)与预测延迟的计算要求对新闻发布的实时性进行严格对齐,但实际采集过程中可能因网络延迟或API限制引入不一致性。最后,数据集仅包含训练集,缺乏独立的验证与测试划分,这限制了模型性能的客观评估与跨数据集的可比性研究。
常用场景
经典使用场景
新闻事件影响力预测与实体关系抽取是该数据集的核心应用场景。基于2024年6月8日前后24小时内采集的11437条新闻样本,数据集整合了标题、正文、时间戳、媒体来源及结构化实体标签,尤其包含利用Transformer模型预测的命名实体(如人物、组织、地点)及其置信度评分。研究者可借此构建时序新闻图谱,分析事件从爆发到传播的演化规律,或训练模型对新闻标题与正文的语义关联性进行深度建模,从而实现对热点话题的自动追踪与影响力量化评估。
解决学术问题
该数据集有效回应了新闻信息学中两大长期挑战:一是新闻事件影响力的客观量化难题,通过提供标准化影响力评分字段(impact),为建立事件影响力度量基准提供了数据支撑;二是非结构化新闻文本的语义结构化问题,数据集预置了多种实体识别结果(包括基于Transformers的细粒度实体标注与原始实体序列),使得研究者可对比不同NER方法在真实新闻语料上的表现差异,进而推动事件抽取、事理图谱构建等方向的方法论革新。
衍生相关工作
该数据集已催生多项前沿研究工作。在事件时间线构建领域,研究者利用其结构化时间戳与实体共现信息,提出了基于动态图神经网络的新闻事件演化推理框架;在跨模态新闻分析中,结合标题与正文的语义对齐特征,衍生出新闻可信度评估模型;更有团队基于其影响力与实体标签的联合分布,开发了面向社交媒体与新闻网站的事件传播路径预测算法。这些工作共同推动了新闻计算从单一文本分析向多维度语义理解的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务