遇见数据集

tom-010/enwiki-answerability-2411-flat-tokenized-balanced

收藏
Hugging Face2024-11-19 更新2024-12-14 收录
官方服务:

资源简介:

--- dataset_info: features: - name: article dtype: string - name: article_sha1 dtype: string - name: section_idx dtype: int32 - name: section_title dtype: string - name: content dtype: string - name: question dtype: string - name: is_adversarial dtype: bool - name: input_ids sequence: int32 - name: token_type_ids sequence: int8 - name: attention_mask sequence: int8 - name: label dtype: int64 splits: - name: train num_bytes: 2929105206.1279635 num_examples: 511898 - name: validation num_bytes: 61676327.21013334 num_examples: 10922 download_size: 1118785509 dataset_size: 2990781533.338097 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* ---

The dataset includes multiple features such as article, article SHA1, section index, section title, content, question, is adversarial, input IDs, token type IDs, attention mask, and label. The dataset is divided into training and validation sets, containing 511898 and 10922 examples respectively. The download size of the dataset is 1118785509 bytes, and the total size is 2990781533.338097 bytes.

提供机构:
tom-010
搜集汇总
数据集介绍
tom-010/enwiki-answerability-2411-flat-tokenized-balanced 数据集图片
背景与挑战
背景概述
该数据集基于英文维基百科,用于判断问题的可回答性,已进行分词和平衡处理,包含文章、问题、标签、对抗性标记等特征。训练集和验证集分别有511898和10922个样本,数据规模较大,适合用于问答可回答性分类任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务