遇见数据集

xwjzds/ag_news_lemma_train

收藏
Hugging Face2023-09-16 更新2024-03-04 收录
官方服务:

资源简介:

# Dataset Card for Dataset Name ### Dataset Summary This is lemmatized version of Ag News Data. ### Languages English ### Citation Information ```bibtex @inproceedings{xu-etal-2023-vontss, title = "v{ONTSS}: v{MF} based semi-supervised neural topic modeling with optimal transport", author = "Xu, Weijie and Jiang, Xiaoyu and Sengamedu Hanumantha Rao, Srinivasan and Iannacci, Francis and Zhao, Jinjin", booktitle = "Findings of the Association for Computational Linguistics: ACL 2023", month = jul, year = "2023", address = "Toronto, Canada", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2023.findings-acl.271", doi = "10.18653/v1/2023.findings-acl.271", pages = "4433--4457", abstract = "Recently, Neural Topic Models (NTM), inspired by variational autoencoders, have attracted a lot of research interest; however, these methods have limited applications in the real world due to the challenge of incorporating human knowledge. This work presents a semi-supervised neural topic modeling method, vONTSS, which uses von Mises-Fisher (vMF) based variational autoencoders and optimal transport. When a few keywords per topic are provided, vONTSS in the semi-supervised setting generates potential topics and optimizes topic-keyword quality and topic classification. Experiments show that vONTSS outperforms existing semi-supervised topic modeling methods in classification accuracy and diversity. vONTSS also supports unsupervised topic modeling. Quantitative and qualitative experiments show that vONTSS in the unsupervised setting outperforms recent NTMs on multiple aspects: vONTSS discovers highly clustered and coherent topics on benchmark datasets. It is also much faster than the state-of-the-art weakly supervised text classification method while achieving similar classification performance. We further prove the equivalence of optimal transport loss and cross-entropy loss at the global minimum.", } ```

# 数据集卡片 ### 数据集概述 本数据集为Ag News Data的词形还原版本。 ### 语言 英语 ### 引用信息 bibtex @inproceedings{xu-etal-2023-vontss, title = "vONTSS:基于von Mises-Fisher(vMF)的最优传输半监督神经主题建模", author = "Xu, Weijie and Jiang, Xiaoyu and Sengamedu Hanumantha Rao, Srinivasan and Iannacci, Francis and Zhao, Jinjin", booktitle = "计算语言学协会研究发现:ACL 2023", month = jul, year = "2023", address = "加拿大多伦多", publisher = "计算语言学协会", url = "https://aclanthology.org/2023.findings-acl.271", doi = "10.18653/v1/2023.findings-acl.271", pages = "4433--4457", abstract = "近年来,受变分自编码器(Variational AutoEncoder, VAE)启发的神经主题模型(Neural Topic Model, NTM)受到了大量研究关注,但由于难以融入人类知识,这类方法在现实场景中的应用受到限制。本研究提出了一种半监督神经主题建模方法vONTSS,该方法采用基于von Mises-Fisher(vMF)的变分自编码器与最优传输技术。当给定每个主题的少量关键词时,半监督设置下的vONTSS可生成潜在主题,并优化主题-关键词质量与主题分类性能。实验结果表明,vONTSS在分类准确率与主题多样性两项指标上均优于现有半监督主题建模方法。此外,vONTSS同样支持无监督主题建模任务。定量与定性实验均证明,无监督设置下的vONTSS在多个维度上优于近年提出的神经主题模型:在基准数据集上,vONTSS能够挖掘出聚类性与连贯性俱佳的主题。同时,该方法在实现相近分类性能的前提下,运行速度远优于当前最优的弱监督文本分类方法。我们还从理论上证明了,在全局最优解处,最优传输损失与交叉熵损失是等价的。", }

提供机构:
xwjzds
原始信息汇总

数据集概述

数据集名称

Dataset Name

数据集摘要

这是一个经过词形还原处理的Ag News数据集版本。

语言

英语

引用信息

bibtex @inproceedings{xu-etal-2023-vontss, title = "v{ONTSS}: v{MF} based semi-supervised neural topic modeling with optimal transport", author = "Xu, Weijie and Jiang, Xiaoyu and Sengamedu Hanumantha Rao, Srinivasan and Iannacci, Francis and Zhao, Jinjin", booktitle = "Findings of the Association for Computational Linguistics: ACL 2023", month = jul, year = "2023", address = "Toronto, Canada", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2023.findings-acl.271", doi = "10.18653/v1/2023.findings-acl.271", pages = "4433--4457", abstract = "Recently, Neural Topic Models (NTM), inspired by variational autoencoders, have attracted a lot of research interest; however, these methods have limited applications in the real world due to the challenge of incorporating human knowledge. This work presents a semi-supervised neural topic modeling method, vONTSS, which uses von Mises-Fisher (vMF) based variational autoencoders and optimal transport. When a few keywords per topic are provided, vONTSS in the semi-supervised setting generates potential topics and optimizes topic-keyword quality and topic classification. Experiments show that vONTSS outperforms existing semi-supervised topic modeling methods in classification accuracy and diversity. vONTSS also supports unsupervised topic modeling. Quantitative and qualitative experiments show that vONTSS in the unsupervised setting outperforms recent NTMs on multiple aspects: vONTSS discovers highly clustered and coherent topics on benchmark datasets. It is also much faster than the state-of-the-art weakly supervised text classification method while achieving similar classification performance. We further prove the equivalence of optimal transport loss and cross-entropy loss at the global minimum.", }

搜集汇总
数据集介绍
xwjzds/ag_news_lemma_train 数据集图片
构建方式
在自然语言处理领域,词形还原(lemmatization)是文本预处理的关键步骤,旨在将词汇还原为其词典原型,以降低数据稀疏性并提升语义一致性。xwjzds/ag_news_lemma_train数据集正是基于经典的AG News新闻分类数据集,通过系统性的词形还原技术构建而成。具体而言,该数据集对原始AG News中的每一条新闻文本进行了词级层面的词形还原处理,将动词、名词等各类词形统一转换为其基本形式,从而生成一个词形归一化的训练语料库。这一构建方式保留了原始数据集中的类别标签与新闻内容结构,确保了与下游任务的兼容性。
使用方法
该数据集可便捷地通过HuggingFace的datasets库加载使用,用户只需调用load_dataset函数并指定数据集名称xwjzds/ag_news_lemma_train即可获取词形还原后的训练数据。在应用层面,该数据集适用于需要词形归一化输入的各类自然语言处理任务,包括但不限于主题建模、文本分类、语义相似度计算等。研究者可直接将其作为标准AG News的词形还原替代版本,用于对比实验或作为半监督学习方法的输入。加载后的数据以字典形式组织,包含文本特征与标签字段,便于快速接入常见的深度学习框架如PyTorch或TensorFlow进行模型训练与评估。
背景与挑战
背景概述
在自然语言处理领域,文本分类任务一直是研究的热点与基石,其中新闻文本的分类因其广泛的应用场景而备受关注。AG News数据集作为经典的新闻分类基准,自发布以来便成为评估模型性能的重要标尺。xwjzds/ag_news_lemma_train数据集由Xu Weijie、Jiang Xiaoyu等研究人员于2023年构建,其核心贡献在于对原始AG News数据进行了词形还原(lemmatization)处理,旨在为半监督神经主题模型(如vONTSS)提供更纯净的文本表示。该研究团队来自多家机构,相关工作发表于ACL 2023,其提出的vONTSS方法在主题建模与分类任务中展现出卓越性能。通过词形还原,该数据集有效减少了词汇形态的冗余,为后续模型挖掘语义结构奠定了坚实基础,对推动文本分类与主题建模的交叉研究具有重要影响力。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:AG News作为多类别新闻分类任务,其文本中充斥着大量专业术语、缩写及非正式表达,词形还原虽能简化词汇形态,却难以完全消除歧义,例如一词多义现象可能误导主题建模。此外,在数据集构建过程中,研究人员需应对词形还原算法自身的局限性,不同工具(如WordNet Lemmatizer)对上下文依赖的敏感性可能导致还原错误,进而影响数据质量。同时,原始AG News数据集中的类别不平衡问题(如部分新闻类别样本稀疏)在词形还原后依然存在,这为半监督学习中的标签传播与主题优化增添了困难,需要更鲁棒的模型设计来缓解噪声与稀疏性的双重挑战。
常用场景
经典使用场景
在自然语言处理与文本挖掘领域,AG News数据集长久以来被视为新闻文本分类与主题建模的基准测试平台。xwjzds/ag_news_lemma_train作为其词形还原版本,通过将词汇还原为基本形态,有效降低了数据稀疏性并增强了语义一致性,从而为后续模型训练提供了更为纯净的语料基础。该数据集最经典的使用场景在于评估和对比各类主题模型在新闻文本上的聚类效果与分类性能,尤其适用于验证半监督与无监督神经主题建模方法的鲁棒性与泛化能力。
解决学术问题
该数据集的核心学术价值在于解决了传统主题建模中难以融合先验知识与处理高维稀疏文本的困境。通过词形还原预处理,它显著缓解了词汇形态变化带来的噪声干扰,使得主题模型能够更精准地捕捉新闻文本的潜在语义结构。此外,该数据集为半监督主题建模研究提供了标准化评测平台,推动了诸如vONTSS等方法在少量关键词引导下实现高质量主题发现与分类准确率的突破,从而深化了对主题模型可解释性与可控性的理论探索。
实际应用
在实际应用层面,该数据集所支撑的技术成果已广泛渗透至新闻聚合、舆情监控与智能推荐系统。例如,基于该数据集训练的主题模型能够自动将海量新闻文章归类至体育、商业、科技等预设类别,辅助媒体平台实现内容的高效组织与个性化推送。同时,词形还原版本的低噪声特性使其在金融舆情分析、事件检测等对语义精度要求严苛的场景中表现出色,为企业决策与风险预警提供了可靠的数据驱动工具。
数据集最近研究
最新研究方向
基于词形归并的新闻文本主题建模与语义理解前沿探索。该数据集作为AG News语料的词形归一化版本,为自然语言处理领域中的主题建模与文本分类研究提供了关键支撑。当前研究热点聚焦于结合变分自编码器与最优传输理论的半监督主题建模方法,如vONTSS模型,在仅需少量关键词先验的条件下,能有效提升主题聚类质量与分类精度,同时保持主题多样性。这一方向与大规模新闻文本的自动化分析、舆情监控及知识发现等实际应用紧密相关,推动了无监督与弱监督场景下文本语义理解技术的突破,具有显著的理论价值与工程意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务