yjching/testing_tokenization_tokens
收藏资源简介:
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 17379 num_examples: 3 download_size: 10901 dataset_size: 17379 configs: - config_name: default data_files: - split: train path: data/train-* --- # Dataset Card for "yjching" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
dataset_info: 特征: - 名称: input_ids 序列: int32 - 名称: attention_mask 序列: int8 拆分: - 名称: 训练集(train) 字节数: 17379 样本数: 3 下载大小: 10901 数据集大小: 17379 配置: - 配置名称: default 数据文件: - 拆分: 训练集(train) 路径: data/train-* # yjching数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
特征信息
- input_ids: 序列类型为 int32
- attention_mask: 序列类型为 int8
数据分割
- train: 包含 3 个样本,占用 17379 字节
数据大小
- 下载大小: 10901 字节
- 数据集大小: 17379 字节
配置信息
- config_name: default
- data_files:
- split: train
- path: data/train-*



