English, Finnish, Linux, Music
收藏资源简介:
本仓库包含四个数据集,用于训练和评估字符级(基于RNN)语言模型。这些数据集非常多样化,应涵盖广泛的语义特征。英语数据集:我们整理了Project Gutenberg中的所有莎士比亚戏剧,总字符数为6,347,705,包含85个唯一字符。芬兰语数据集:我们从Project Gutenberg收集了芬兰剧作家Juhani Aho和Eino Leino的所有文本,总字符数为10,976,530,包含106个唯一字符。Linux数据集:我们保存了Linux内核的所有C代码,总字符数为6,546,665,包含97个唯一字符。音乐数据集:我们通过从MIDI文件中提取音乐笔记创建此数据集,总音符数为1,553,852,包含90个唯一音符。
This repository contains four datasets designed for training and evaluating character-level (RNN-based) language models. These datasets are highly diverse and are expected to cover a broad spectrum of semantic features. English Dataset: We have compiled all of Shakespeare's plays from Project Gutenberg, totaling 6,347,705 characters with 85 unique characters. Finnish Dataset: We collected all texts by Finnish playwrights Juhani Aho and Eino Leino from Project Gutenberg, totaling 10,976,530 characters with 106 unique characters. Linux Dataset: We preserved all C code from the Linux kernel, totaling 6,546,665 characters with 97 unique characters. Music Dataset: We created this dataset by extracting musical notes from MIDI files, totaling 1,553,852 notes with 90 unique notes.
数据集概述
本数据集包含四个用于训练和评估字符级循环神经网络(RNN)的多样化数据集,涵盖了广泛的语义特征。
数据集详情
英语
- 来源:所有威廉·莎士比亚的剧本,从Project Gutenberg收集。
- 内容:剧本随机排序。
- 规模:总字符数为6,347,705,包含85个独特字符。
芬兰语
- 来源:芬兰剧作家Juhani Aho和Eino Leino的作品,从Project Gutenberg收集。
- 规模:总字符数为10,976,530,包含106个独特字符。
Linux
- 来源:Linux内核的所有C代码。
- 时间点:2016年11月22日。
- 规模:总字符数为6,546,665,包含97个独特字符。
音乐
- 来源:从MIDI文件中提取的音乐笔记,包括巴赫、贝多芬、肖邦和海顿的钢琴作品,从Classical Archives下载。
- 处理:移除了重复的作品。
- 规模:总音符数为1,553,852,包含90个独特音符。




