相关数据集
argilla-warehouse/personahub-fineweb-edu-4-embeddings
该数据集通过使用Alibaba-NLP/gte-large-en-v1.5模型从句子转换器中获取了argilla-warehouse/personahub-fineweb-edu-4-dedup数据集的嵌入。数据集包含一个pipeline.yaml文件,可用于在distilabel中使用distilabel CLI重现生成数据集的管道。数据集的特征包括id、persona、model_name_e
Hugging Face2024-09-10 更新160
the-cramer-project/Kyrgyz_News_Corpus
Kyrgyz_News_Corpus数据集是一个包含256,364条吉尔吉斯语新闻的集合,这些新闻通过网页抓取技术从多个新闻网站收集而来。数据集涵盖了政治、经济、文化、体育等多个主题的新闻。每条新闻条目包括文本和来源。该数据集仅用于研究目的,如自然语言处理、主题建模等,适合对吉尔吉斯语文本分析感兴趣的研究人员、开发者和学生。
Hugging Face2024-04-02 更新130
Dataset of five narratives split (1200 tokens) into events
This repository contains 5 textual narratives split into events by diffirent Large Language Models
DataCite Commons2024-07-08 更新90
prli/pubmed-full_chopped_pyt_llama_alpha_0-1
该数据集包含文本、元信息、句子扰动数量以及文档统计信息。文本是数据集的主要特征,元信息中包含了数据集的集合名称。文档统计信息详细记录了文档的优势分数、长度变化比例、原始句子长度、替换后的句子长度等多个统计数据。数据集分为验证集,验证集大小为4000个样本。
Hugging Face2025-10-14 更新130
Dawnnn0429/MathInstruct-PoT-NumGLUE
该数据集包含三个字段:来源(source),指令(instruction)和输出(output),均为文本格式。数据集分为训练集和测试集两部分,其中训练集包含12126个示例,测试集包含1348个示例。数据集主要用于某种文本生成或处理任务,具体应用场景需结合字段内容和数据集划分进一步分析。
Hugging Face2025-11-12 更新100



