tuanio/processed_bad_word_cls_dataset
收藏资源简介:
--- dataset_info: features: - name: labels dtype: int64 - name: input_ids sequence: sequence: int32 - name: attention_mask sequence: sequence: int8 splits: - name: train num_bytes: 15208128.0 num_examples: 90000 - name: test num_bytes: 1689792.0 num_examples: 10000 download_size: 8136371 dataset_size: 16897920.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---
数据集信息: 特征: - 名称:标签(labels),数据类型:int64 - 名称:输入标识(input_ids),类型为嵌套序列,元素数据类型:int32 - 名称:注意力掩码(attention_mask),类型为嵌套序列,元素数据类型:int8 数据集划分: - 划分名称:训练集(train),占用字节数:15208128.0,样本数量:90000 - 划分名称:测试集(test),占用字节数:1689792.0,样本数量:10000 下载大小:8136371,总数据集大小:16897920.0 配置项: - 配置名称:默认(default),数据文件映射: - 训练集划分对应路径:data/train-* - 测试集划分对应路径:data/test-*
数据集概述
特征信息
- labels: 数据类型为
int64 - input_ids: 数据类型为
int32,序列类型 - attention_mask: 数据类型为
int8,序列类型
数据分割
- train: 包含 90000 个样本,占用 15208128.0 字节
- test: 包含 10000 个样本,占用 1689792.0 字节
数据大小
- 下载大小: 8136371 字节
- 数据集大小: 16897920.0 字节
配置信息
- default:
- train: 文件路径为
data/train-* - test: 文件路径为
data/test-*
- train: 文件路径为



