alzoubi36/piextract
收藏资源简介:
--- dataset_info: features: - name: COLLECT struct: - name: subtask dtype: string - name: tags sequence: string - name: tokens sequence: string - name: NOT_COLLECT struct: - name: subtask dtype: string - name: tags sequence: string - name: tokens sequence: string - name: NOT_SHARE struct: - name: subtask dtype: string - name: tags sequence: string - name: tokens sequence: string - name: SHARE struct: - name: subtask dtype: string - name: tags sequence: string - name: tokens sequence: string splits: - name: train num_bytes: 3453408 num_examples: 2579 - name: test num_bytes: 1580498 num_examples: 1029 - name: validation num_bytes: 662810 num_examples: 456 download_size: 1013894 dataset_size: 5696716 --- # Dataset for the PI-Extract task in the [PrivacyGLUE](https://github.com/infsys-lab/privacy-glue) dataset
数据集信息: 特征: - 字段名:COLLECT,其结构体包含: - 子任务(subtask):数据类型为字符串 - 标签(tags):字符串序列 - Token(Token)序列:字符串序列 - 字段名:NOT_COLLECT,其结构体包含: - 子任务(subtask):数据类型为字符串 - 标签(tags):字符串序列 - Token(Token)序列:字符串序列 - 字段名:NOT_SHARE,其结构体包含: - 子任务(subtask):数据类型为字符串 - 标签(tags):字符串序列 - Token(Token)序列:字符串序列 - 字段名:SHARE,其结构体包含: - 子任务(subtask):数据类型为字符串 - 标签(tags):字符串序列 - Token(Token)序列:字符串序列 数据集划分: - 划分名称:train(训练集),字节大小:3453408,样本数量:2579 - 划分名称:test(测试集),字节大小:1580498,样本数量:1029 - 划分名称:validation(验证集),字节大小:662810,样本数量:456 下载大小:1013894 数据集总大小:5696716 --- # 适用于[PrivacyGLUE](https://github.com/infsys-lab/privacy-glue)数据集的PI-Extract(个人信息提取)任务专用数据集
数据集概述
数据集特征
-
COLLECT
- subtask: 数据类型为字符串
- tags: 数据类型为字符串序列
- tokens: 数据类型为字符串序列
-
NOT_COLLECT
- subtask: 数据类型为字符串
- tags: 数据类型为字符串序列
- tokens: 数据类型为字符串序列
-
NOT_SHARE
- subtask: 数据类型为字符串
- tags: 数据类型为字符串序列
- tokens: 数据类型为字符串序列
-
SHARE
- subtask: 数据类型为字符串
- tags: 数据类型为字符串序列
- tokens: 数据类型为字符串序列
数据集分割
-
train
- num_bytes: 3453408
- num_examples: 2579
-
test
- num_bytes: 1580498
- num_examples: 1029
-
validation
- num_bytes: 662810
- num_examples: 456
数据集大小
- download_size: 1013894
- dataset_size: 5696716



