遇见数据集

ronaldahmed/scitechnews

收藏
Hugging Face2023-10-24 更新2024-03-04 收录
官方服务:

资源简介:

SciTechNews数据集由科学论文及其对应的新闻稿片段组成,数据来源于ACM TechNews。该数据集主要用于科学新闻领域的文本生成任务,特别是科学文章的新闻稿摘要生成。数据集包含科学文章的标题、摘要、正文、章节列表、章节名称以及作者信息,新闻稿的标题、正文和摘要。数据集的语言为英语,数据量在1K到10K之间。数据集的创建目的是为了支持自动科学新闻生成,帮助记者或研究人员更高效地撰写高质量的新闻内容。

The SciTechNews dataset comprises scientific papers and their corresponding press release snippets, sourced from ACM TechNews. This dataset is primarily intended for text generation tasks in the domain of scientific news, specifically press release summarization for scientific articles. It contains information including the title, abstract, main body, chapter list, chapter names, and author details of scientific papers, as well as the title, body, and abstract of the press releases. The dataset is in English, with a sample size ranging from 1,000 to 10,000. It was created to support automatic scientific news generation, helping journalists and researchers write high-quality news content more efficiently.

提供机构:
ronaldahmed
原始信息汇总

数据集卡片 scitechnews

数据集描述

数据集概述

SciTechNews 数据集包含科学论文及其对应的从 ACM TechNews 挖掘的新闻发布片段。ACM TechNews 是一个新闻聚合器,定期提供关于计算机科学、工程、天体物理学、生物学等领域的科学成就和技术的新闻摘要。

支持的任务和排行榜

该数据集是为科学新闻任务定制的,这是一个文本到文本的任务,输入是科学文章,输出是新闻发布摘要。此外,该版本还包括新闻发布和科学文章的附加信息,如新闻发布文章正文、标题、作者姓名和所属机构。

语言

英语

数据集结构

数据字段

json { "id": String, # 唯一ID "pr-title": String, # ACMTECHNEWS网站中的标题 "pr-article": String, # 新闻发布文章 "pr-summary": String, # 新闻发布摘要 "sc-title": String, # 科学文章标题 "sc-abstract": String, # 科学文章摘要 "sc-article": String, # 科学文章的摘要和章节连接 "sc-sections": List[String], # 科学文章的章节列表 "sc-section_names": List[String] # 科学文章的章节名称列表 "sc-authors": List[String] # 作者姓名和所属机构列表,格式为<name> | <affil> }

新闻发布文章 (pr-article) 和科学文章的章节 (sc-sections) 中的段落由 分隔。数据未进行句子或单词分词。注意,字段 sc-article 包括文章的摘要及其章节。

示例实例

json { "id": 37, "pr-title": "Whats in a Developers Name?", "pr-article": "In one of the most memorable speeches from William Shakespeares play, Romeo and Juliet , Juliet ponders, " Whats in a name? That which...", "pr-summary": "Researchers at the University of Waterloos Cheriton School of Computer Science in Canada found a software developers perceived race and ethnicity,...", "sc-title": "On the Relationship Between the Developers Perceptible Race and Ethnicity and the Evaluation of Contributions in OSS", "sc-abstract": "Context: Open Source Software (OSS) projects are typically the result of collective efforts performed by developers with different backgrounds...", "sc-articles": "Context: Open Source Software (OSS) projects are typically the result of .... In any line of work, diversity regarding race, gender, personality...", "sc-sections": ["In any line of work, diversity regarding race, gender, personality...","To what extent is the submitters perceptible race and ethnicity related to...",...], "sc-section_names": ["INTRODUCTION", "RQ1:", "RQ2:", "RELATED WORK",...], "sc-authors": ["Reza Nadri | Cheriton School of Computer Science, University of Waterloo", "Gema Rodriguez Perez | Cheriton School of ...",...] }

数据分割

训练/验证/测试集的实例数量分别为 26,368/1431/1000。注意,训练集仅包含新闻发布数据 (pr-*),而验证和测试集包含所有字段。

数据集创建

策划理由

科学新闻指的是涵盖与不同科学研究领域相关主题的新闻内容。它在促进公众对科学的理解和影响方面发挥着重要作用。然而,科学文献的庞大数量使得记者难以报道每一个重要发现,可能导致许多被忽视。我们构建了一个新的开放访问高质量数据集,用于自动科学新闻,涵盖广泛的科学学科。

源数据

新闻发布片段从 ACM TechNews 挖掘,其相应的科学文章从知名的开放访问期刊和会议论文集中挖掘。

初始数据收集和规范化

我们收集了 1999 年至 2021 年间的存档 TechNews 片段,并将它们与其相应的新闻发布文章链接。然后,我们解析每篇新闻文章,查找其报道的科学文章的链接。我们丢弃了在新闻发布中发现多个科学文章链接的样本。最后,科学文章以 PDF 格式检索并使用 Grobid 处理。按照先前科学摘要数据集的收集策略,我们检索章节标题名称,并将文章文本分为章节。我们还提取了标题和所有作者姓名及所属机构。

源语言生产者

该数据集中的所有文本(标题、摘要和文章正文)均由人类生产。

搜集汇总
数据集介绍
ronaldahmed/scitechnews 数据集图片
构建方式
在科学新闻自动生成这一前沿领域,数据集的构建往往面临着跨学科文本对齐与高质量标注的双重挑战。ronaldahmed/scitechnews数据集通过系统化的多源数据融合策略,巧妙地将ACM TechNews新闻聚合平台中1999年至2021年间收录的科技新闻稿与其报道的原始科研论文进行精准配对。构建过程中,研究者首先从TechNews存档中提取新闻摘要,继而解析每篇新闻文章中指向科研论文的超链接,并排除包含多个链接的样本以确保数据纯净性。随后,科研论文以PDF格式被获取,并借助Grobid工具进行结构化处理,提取标题、作者信息及隶属机构,同时将正文按章节划分,最终形成包含新闻标题、新闻正文、新闻摘要、论文标题、论文摘要、论文全文、章节列表及作者列表在内的丰富字段体系。
特点
该数据集最显著的特质在于其跨学科覆盖性与结构完整性,横跨计算机科学、工程学、天体物理学、生物学等多个科学领域,为科学新闻自动生成任务提供了前所未有的广度。数据集中每个样本不仅包含新闻摘要与论文摘要的对应关系,还完整保留了新闻正文与论文全文的原始文本,使得研究者能够深入探索从严谨学术语言到通俗新闻风格的转换规律。尤为独特的是,数据集提供了论文的章节划分与章节名称列表,这一精细结构信息为基于话语结构的科学新闻生成模型奠定了坚实基础。训练集包含26,368个样本,而验证集与测试集则保留了完整的字段信息,确保了模型评估的全面性与可靠性。
使用方法
该数据集专为科学新闻生成这一文本到文本任务而设计,研究者可将科研论文的摘要或全文作为输入,以新闻摘要作为输出目标,构建端到端的序列到序列模型。在具体应用中,数据集的sc-article字段(包含论文摘要与各章节的拼接文本)可作为输入源,而pr-summary字段则作为标准参考摘要。研究者亦可利用sc-sections与sc-section_names字段,探索基于章节结构的分段式新闻生成策略。此外,数据集还支持文本简化与风格迁移等下游任务,通过对比新闻正文与论文正文的差异,可训练模型掌握从学术话语向大众传播语言的转换技巧。所有文本均以自然段落形式组织,未进行分词处理,为研究者保留了灵活的前处理空间。
背景与挑战
背景概述
科学新闻在促进公众对科学进展的理解中扮演着不可或缺的角色,然而,科学文献的庞大规模使得新闻工作者难以全面覆盖每一项重要发现。在这一背景下,由爱丁堡大学、伦斯勒理工学院、东北大学及IBM研究院的研究人员于2023年共同创建的SciTechNews数据集应运而生。该数据集以ACM TechNews为数据源,收录了1999年至2021年间科学论文与其对应的新闻稿摘要配对,覆盖计算机科学、工程、天体物理、生物学等多个学科领域。其核心研究问题聚焦于自动科学新闻生成,旨在通过文本到文本的转换模型,将专业学术论文转化为易懂的新闻摘要,从而缓解信息过载,提升科学传播的效率与广度。该数据集的发布为自然语言处理领域开辟了新的研究方向,并推动了科学新闻自动化的实证探索。
当前挑战
SciTechNews数据集所面临的挑战首先体现在科学新闻生成任务的内在复杂性上:科学论文语言高度专业且结构严谨,而新闻摘要需兼顾通俗性与准确性,如何在保留核心科学信息的同时实现风格转换与文本简化,是模型必须攻克的技术难题。其次,数据集构建过程亦充满挑战,包括从ACM TechNews中精准提取新闻稿与对应科学文章的链接、处理PDF格式的科学文献以提取结构化信息(如章节标题、作者及附属机构),以及确保跨学科数据的多样性与质量平衡。此外,机器生成内容可能存在的偏差与事实错误,要求开发者在应用中严格遵循伦理准则,避免误导公众,这些因素共同构成了该数据集在研究与实际部署中的核心挑战。
常用场景
经典使用场景
SciTechNews数据集最经典的使用场景在于科学新闻自动生成任务,即从严谨的科研论文中提炼出通俗易懂、面向公众的新闻摘要。该数据集精心配对科研论文与ACM TechNews上的新闻稿摘要,涵盖计算机科学、工程、天体物理等多个领域,为文本到文本生成模型提供了高质量的平行语料。研究者可基于此数据集训练模型,实现从专业学术语言到大众新闻语言的风格转换与信息压缩,从而推动科学传播的自动化进程。
实际应用
在实际应用中,SciTechNews可赋能新闻媒体与科研机构的自动化内容生产流程。记者可利用基于该数据集训练的模型快速生成新闻初稿,再经人工编辑修正事实错误与补充上下文,从而大幅提升报道效率。科研人员亦可借助此类工具将自身研究成果转化为易于传播的新闻稿,增强公众对科学进展的理解。此外,该数据集还可用于开发面向非专业读者的科普助手,促进科学知识的民主化传播。
衍生相关工作
SciTechNews数据集衍生了多项经典学术工作,其中最具代表性的是Cardenas等人提出的基于话语结构的科学新闻生成框架。该工作深入分析了科研论文与新闻稿在话语层面的差异,并利用数据集中的章节标题与段落划分信息,设计出能够捕捉学术文本与新闻文本间结构映射关系的模型。此外,该数据集还催生了关于科学新闻自动评估指标的研究,以及跨领域科学摘要与风格迁移的相关探索,为自然语言处理与计算新闻学的交叉领域注入了新活力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务