登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Clustering results on 20-newsgroups (200 samples).
Clustering results on 20-newsgroups (200 samples).
收藏
NIAID Data Ecosystem
2026-03-11 收录
文本聚类
新闻文本分析
数据链接:
https://figshare.com/articles/dataset/Clustering_results_on_20-newsgroups_200_samples_/9635339
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Clustering results on 20-newsgroups (200 samples).
应用场景:
创建时间:
2019-08-15
相关数据集
文本聚类原子能力
文本聚类
机器学习
文本聚类主要是依据著名的聚类假设:同类的文档相似度较大,而不同类的文档相似度较小。作为一种无监督的机器学习方法,聚类由于不需要训练过程,以及不需要预先对文档手工标注类别,因此具有一定的灵活性和较高的自动化处理能力,已经成为对文本信息进行有效地组织、摘要和导航的重要手段。
海南省数据产品超市
2023-12-12 更新
40
0
itisarainyday/ml_sentenceBERT_cluster
自然语言处理
文本聚类
该数据集包含多个字段,主要涉及问题的ID、模块名称、问题标题、主内容、技能评分、持续时间上限、部分内容、解答位置、解答内容、教程、总主题、模块、级别、总文本、问题内容、问题句子长度、动词计数、文本长度、LaTeX长度、嵌入、表格、总解答长度、步骤、部分技能、技能与总解答长度的乘积、技能与步骤的乘积、文本与LaTeX统计、解答与LaTeX统计、总RA数、问题字符长度等。数据集划分为训练集,包含776
Hugging Face
2024-07-03 更新
9
0
slvnwhrl/blurbs-clustering-s2s
文本聚类
词嵌入
该数据集可作为德语词嵌入聚类的基准。数据集包含书籍标题,基于GermEval 2019共享任务的数据集。数据集包含17,726个独特样本,28个分割,每个分割的样本数从177到16,425不等,类别数从4到93不等。分割方式类似于MTEB的ArxivClusteringS2S。
Hugging Face
2024-01-08 更新
6
0
Arabic Gigaword Second Edition
阿拉伯语处理
新闻文本分析
Introduction Arabic Gigaword Second Edition was developed by the Linguistic Data Consortium (LDC) and contains 1.6 million documents of Arabic newswire text collected by LDC.
DataCite Commons
2021-07-01 更新
17
0
reddit-clustering-vn
文本聚类
Reddit内容
该数据集包含四个字段:句子(sentences)、标签(labels)、原始句子(og_sentences)和一个整数类型的索引字段。测试集包含10个示例。具体描述和用途未在README中提供。
Hugging Face
2025-04-17 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广