huggingartists/tony-raut-and-garry-topor
收藏资源简介:
该数据集包含从Genius解析的歌词数据,旨在用于生成歌词。数据集生成大小为0.083901 MB,包含15个训练样本,没有验证和测试样本。数据集的语言为英语,数据字段包括text,表示歌词文本。
This dataset contains lyric data parsed from Genius, and is intended for lyric generation tasks. It has a size of 0.083901 MB, includes 15 training samples and no validation or test samples. The dataset is in English, and its data field includes "text", which represents the lyric text.
数据集卡片 for "huggingartists/tony-raut-and-garry-topor"
数据集描述
- 生成的数据集大小: 0.083901 MB
数据集摘要
该数据集是从Genius解析的歌词数据集,旨在通过HuggingArtists生成歌词。模型可在此处获取:HuggingArtists Model。
支持的任务和排行榜
语言
en
如何使用
如何直接使用datasets库加载此数据集:
python from datasets import load_dataset
dataset = load_dataset("huggingartists/tony-raut-and-garry-topor")
数据集结构
train的一个示例如下:
json { "text": "Look, I was gonna go easy on you Not to hurt your feelings But Im only going to get this one chance Somethings wrong, I can feel it..." }
数据字段
所有分区的数据字段相同:
text: 一个string特征。
数据分割
| train | validation | test |
|---|---|---|
| 15 | - | - |
Train 可以通过几行代码轻松分割为 train、validation 和 test:
python from datasets import load_dataset, Dataset, DatasetDict import numpy as np
datasets = load_dataset("huggingartists/tony-raut-and-garry-topor")
train_percentage = 0.9 validation_percentage = 0.07 test_percentage = 0.03
train, validation, test = np.split(datasets[train][text], [int(len(datasets[train][text])train_percentage), int(len(datasets[train][text])(train_percentage + validation_percentage))])
datasets = DatasetDict( { train: Dataset.from_dict({text: list(train)}), validation: Dataset.from_dict({text: list(validation)}), test: Dataset.from_dict({text: list(test)}) } )
数据集创建
策划理由
源数据
初始数据收集和规范化
源语言生产者是谁?
注释
注释过程
注释者是谁?
个人和敏感信息
使用数据集的考虑因素
数据集的社会影响
偏见的讨论
其他已知限制
附加信息
数据集策展人
许可信息
引用信息
bibtex @InProceedings{huggingartists, author={Aleksey Korshuk}, year=2021 }



