登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
In eundem obitum
In eundem obitum
收藏
B2FIND
2026-04-28 收录
巴洛克文学
文本数据
数据链接:
https://b2find.eudat.eu/dataset/5b438c5a-1906-50cf-a6fe-a3bc94926885
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Source: Deutsche Literatur, Reihe Barock, Erg.-Bd., Leipzig: Reclam, 1939.
应用场景:
相关数据集
Literature-zh
文本数据
文本质量评估
这个数据集是由公共爬虫收集的中文书籍、论文、法律文件和专利组成的复合数据集。经过数据清洗,移除了含有非拉丁、非中文字符比例超过2%的文本,以及含有大量特殊字符的文本,同时将繁体中文转换为了简体中文。数据集中的文档还经过语言质量评估,移除了质量较低的文档。数据集包含47,087,808个样本,磁盘大小为214G的parquet文件。
Hugging Face
2025-03-30 更新
48
0
vietgpt/the_pile_openwebtext2
自然语言处理
文本数据
--- language: en dataset_info: features: - name: title dtype: string - name: text dtype: string - name: reddit_scores sequence: int32 splits: - name: train num_bytes: 68786
Hugging Face
2023-07-15 更新
10
0
CATIE-AQ/french_books
法语文学
文本数据
该数据集是一个包含2075本法语书籍的数据框,所有书籍均以txt格式存储。这些书籍是从Gutenberg项目中筛选出来的,去除了那些在french_books_summuries数据集中有摘要的作者的作品。数据框中包含四个字段:文本内容、书籍标题、作者名字及生卒日期、文本单词数量的估计。根据文本的单词数量,README还提供了不同数量级文本的估计数量和对应的年份范围。
Hugging Face
2025-07-03 更新
7
0
CognitiveLab/Aarogya_wiki_medical_terms
医学术语
文本数据
--- dataset_info: features: - name: __index_level_0__ dtype: int64 - name: Aarogya_prompt dtype: string - name: page_title dtype: string - name: page_text dtype: string spl
Hugging Face
2023-12-29 更新
13
0
Fahmi23/geethaamrita-llama2-1k
文本数据
机器学习
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 123035 num_examples: 1000 download_size: 8132 dataset_size: 123035 configs: - config_nam
Hugging Face
2024-05-28 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广