相关数据集
JokeTailor_big_set_annotated
这是一个包含笑话文本和相关特征的数据集,特征包括笑话的文本内容、广泛话题、类型、语调、唯一标识符以及嵌入向量。数据集提供了一个训练集,共有11018条笑话数据。
Hugging Face2025-03-17 更新130
finepdfs-et
该数据集是一个包含文本和其他相关信息的集合,主要用于训练和测试NLP模型。它包含了文本内容、语言信息、文档的截断状态等特征,以及用于标识和定位数据的字段如唯一标识符、URL和文件路径等。数据集分为训练集和测试集,但没有具体描述其内容和来源。
Hugging Face2025-09-16 更新120
DKYoon/s1k-1.1-filtered
该数据集包含对话信息,每个对话条目包括内容和角色信息,划分为训练集。共有894条对话数据,数据集大小约为23.5MB。
Hugging Face2025-02-14 更新50
abdulmannan-01/rag_combined_dataset_orca_and_openscholar_messages_format
该数据集包含对话信息,每个示例包括内容(content)和角色(role)两个字段,并提供了数据来源(dataset_source)。数据集仅包含训练集部分,共有180,135条示例数据,数据集总大小为1,396,793,123字节,下载大小为663,503,269字节。
Hugging Face2025-01-09 更新120
Croatian Twitter training corpus ReLDI-NormTagNER-hr 3.0
This corpus contains manually annotated Croatian tweets. It is meant as a gold-standard training and testing dataset for tokenisation, sentence segmentation, word normalisation, morphosyntactic taggin
SSH Open MarketPlace2023-10-13 更新60



