登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
(大模型电子书)中英文小说
(大模型电子书)中英文小说
收藏
北方大数据交易中心
2025-01-16 收录
文学
自然语言处理
数据链接:
https://exchange.datadmz.com:30101/datadmz/tradeFloor/list?removeSideBar=true
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
(大模型电子书)中英文小说;TXT,1.5万本
应用场景:
提供机构:
全知启航(北京)科技有限公司
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集名为'(大模型电子书)中英文小说',包含约1.5万本中英文小说电子书,所有内容均以TXT格式提供。它专注于大模型相关的电子书资源,为用户提供丰富的文本素材。
以上内容由遇见数据集搜集并总结生成
相关数据集
Sindhi语言大型语料库
Sindhi语
自然语言处理
本研究为资源匮乏的Sindhi语言开发了一个包含超过6100万单词的大型语料库。该语料库通过网络爬虫从多个网络资源中收集,并经过精心预处理以过滤噪声文本。语料库的创建解决了Sindhi语言在自然语言处理(NLP)领域缺乏大规模未标注语料的问题,为训练神经词嵌入提供了基础。此外,本研究还利用了GloVe、Skip-Gram和Continuous Bag of Words等先进的词2vec算法来生成S
arXiv
2020-12-30 更新
16
0
hlillemark/c4_t5_pretrain
机器学习预训练
自然语言处理
--- dataset_info: features: - name: input_ids sequence: int32 - name: labels sequence: int64 splits: - name: validation num_bytes: 53400000 num_examples: 10000 - name: trai
Hugging Face
2023-05-22 更新
8
0
cassanof/Capybara-code
代码对话
自然语言处理
capybara数据集经过过滤,仅包含包含代码的对话(通过检测Markdown代码块的存在)。数据集的特征包括source和conversation,其中conversation是一个列表,包含input和output两个字段。数据集只有一个train分割,包含1314个示例,文件大小为7680536字节,下载大小为3402523字节。
Hugging Face
2024-01-12 更新
8
0
Taywon/hri_rlhf
自然语言处理
机器学习
--- dataset_info: features: - name: question struct: - name: dataset dtype: string - name: id dtype: string - name: full_text dtype: string - name: quotes_0
Hugging Face
2024-05-23 更新
15
0
bloyal/small-uniref30
自然语言处理
掩码填充
--- license: cc-by-4.0 dataset_info: features: - name: id dtype: int64 - name: num dtype: int64 - name: text dtype: string splits: - name: train num_bytes: 1067207.07039336
Hugging Face
2023-05-04 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广