tom-010/enwiki-answerability-2411-flat-tokenized-balanced
收藏资源简介:
--- dataset_info: features: - name: article dtype: string - name: article_sha1 dtype: string - name: section_idx dtype: int32 - name: section_title dtype: string - name: content dtype: string - name: question dtype: string - name: is_adversarial dtype: bool - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 - name: label dtype: int64 splits: - name: train num_bytes: 2929105206.1279635 num_examples: 511898 - name: validation num_bytes: 61676327.21013334 num_examples: 10922 download_size: 1118785509 dataset_size: 2990781533.338097 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* ---
The dataset includes multiple features such as article, article SHA1, section index, section title, content, question, is adversarial, input IDs, token type IDs, attention mask, and label. The dataset is divided into training and validation sets, containing 511898 and 10922 examples respectively. The download size of the dataset is 1118785509 bytes, and the total size is 2990781533.338097 bytes.




