官方服务:
资源简介:
Can be used for ChatGPT
应用场景:
创建时间:
2023-05-23
相关数据集
Thanmay/xquad-hi
该数据集包含多个特征,如id、标题、上下文、问题、答案、答案起始位置、类别、聚类、最近聚类和最近页面。这些特征以不同的数据类型存储,包括字符串、整数序列和结构化数据。数据集仅包含一个验证集,大小为36745196字节,包含1190个示例。数据集的下载大小为1189437字节。
Hugging Face2024-06-28 更新190
Taywon/hri_rlhf
--- dataset_info: features: - name: question struct: - name: dataset dtype: string - name: id dtype: string - name: full_text dtype: string - name: quotes_0
Hugging Face2024-05-23 更新150
bloyal/small-uniref30
--- license: cc-by-4.0 dataset_info: features: - name: id dtype: int64 - name: num dtype: int64 - name: text dtype: string splits: - name: train num_bytes: 1067207.07039336
Hugging Face2023-05-04 更新80
Sindhi语言大型语料库
本研究为资源匮乏的Sindhi语言开发了一个包含超过6100万单词的大型语料库。该语料库通过网络爬虫从多个网络资源中收集,并经过精心预处理以过滤噪声文本。语料库的创建解决了Sindhi语言在自然语言处理(NLP)领域缺乏大规模未标注语料的问题,为训练神经词嵌入提供了基础。此外,本研究还利用了GloVe、Skip-Gram和Continuous Bag of Words等先进的词2vec算法来生成S
arXiv2020-12-30 更新160
hlillemark/c4_t5_pretrain
--- dataset_info: features: - name: input_ids sequence: int32 - name: labels sequence: int64 splits: - name: validation num_bytes: 53400000 num_examples: 10000 - name: trai
Hugging Face2023-05-22 更新80



