textminr/topic-labeling
收藏资源简介:
这是一个精心制作的主题标注数据集。它将一系列由主题模型(如LDA、Top2Vec等)生成的词汇映射到主题标签,以便像T5、Mistral等大型语言模型可以在此数据集上进行微调,从而为给定文本生成主题标签。该数据集的部分内容已手动或使用GPT-4进行标注。数据集的来源包括Wikimedia的Wikipedia数据集、textminr的mn-ds数据集以及Project Gutenberg。
This is a meticulously curated topic annotation dataset. It maps a set of terms generated by topic models (e.g., LDA, Top2Vec, etc.) to topic labels, enabling fine-tuning of large language models (LLMs) such as T5, Mistral, etc., on this dataset to generate topic labels for given texts. Portions of this dataset have been annotated either manually or using GPT-4. The dataset sources include Wikimedia's Wikipedia dataset, textminr's mn-ds dataset, and Project Gutenberg.
数据集概述
基本信息
- 语言: 英语 (en), 德语 (de)
- 数据规模: 小于1K
- 任务类别: 文本分类
- 数据集名称: Topic Labeling
配置详情
-
配置名称: gutenberg
- 默认配置: 是
- 数据文件:
- 分割: train
- 路径: "gutenberg/train.jsonl"
-
配置名称: generic
- 数据文件:
- 分割: train
- 路径: "base/train.jsonl", "mn-ds/train.jsonl"
- 数据文件:
数据集描述
该数据集用于主题标签标注,将一系列单词(由LDA、Top2Vec等主题模型生成)映射到主题标签,以便LLMs如T5、Mistral等可以在此数据集上进行微调,为给定文本生成主题标签。部分数据已通过手动或使用GPT-4进行标注。
数据来源
- 主要来源:
- 额外来源:




