遇见数据集

j-chim/pii-pile-chunk3-200000-250000-tagged

收藏
Hugging Face2023-01-22 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: texts sequence: string - name: meta struct: - name: pile_set_name dtype: string - name: scores sequence: float64 - name: avg_score dtype: float64 - name: num_sents dtype: int64 - name: tagged_pii_results list: - name: analysis_explanation dtype: 'null' - name: end dtype: int64 - name: entity_type dtype: string - name: recognition_metadata struct: - name: recognizer_identifier dtype: string - name: recognizer_name dtype: string - name: score dtype: float64 - name: start dtype: int64 splits: - name: train num_bytes: 508200278 num_examples: 49999 download_size: 194434096 dataset_size: 508200278 --- # Dataset Card for "pii-pile-chunk3-200000-250000-tagged" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 名称:文本(texts),类型:字符串序列 - 名称:元数据(meta),结构体: - 名称:语料库集合名称(pile_set_name),数据类型:字符串 - 名称:分数(scores),类型:64位浮点数序列 - 名称:平均分数(avg_score),数据类型:64位浮点数 - 名称:句子数量(num_sents),数据类型:64位整数 - 名称:已标记个人可识别信息(Personally Identifiable Information, PII)结果(tagged_pii_results),列表类型,包含字段: - 名称:分析解释(analysis_explanation),数据类型:空值 - 名称:结束位置(end),数据类型:64位整数 - 名称:实体类型(entity_type),数据类型:字符串 - 名称:识别元数据(recognition_metadata),结构体: - 名称:识别器标识符(recognizer_identifier),数据类型:字符串 - 名称:识别器名称(recognizer_name),数据类型:字符串 - 名称:置信分数(score),数据类型:64位浮点数 - 名称:起始位置(start),数据类型:64位整数 数据集划分: - 名称:训练集(train),占用字节数:508200278,样本数量:49999 下载大小:194434096 数据集总大小:508200278 # "pii-pile-chunk3-200000-250000-tagged" 数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
j-chim
原始信息汇总

数据集概述

数据集名称

  • pii-pile-chunk3-200000-250000-tagged

数据集特征

  • texts:字符串序列
  • meta:结构化数据,包含:
    • pile_set_name:字符串类型
  • scores:浮点数序列(float64)
  • avg_score:浮点数类型(float64)
  • num_sents:整数类型(int64)
  • tagged_pii_results:列表,包含:
    • analysis_explanation:空值(null)
    • end:整数类型(int64)
    • entity_type:字符串类型
    • recognition_metadata:结构化数据,包含:
      • recognizer_identifier:字符串类型
      • recognizer_name:字符串类型
    • score:浮点数类型(float64)
    • start:整数类型(int64)

数据集拆分

  • train:
    • num_bytes:508200278字节
    • num_examples:49999个样本

数据集大小

  • download_size:194434096字节
  • dataset_size:508200278字节
搜集汇总
数据集介绍
j-chim/pii-pile-chunk3-200000-250000-tagged 数据集图片
构建方式
该数据集源自The Pile语料库的第三分块,涵盖索引200,000至250,000的文本片段。通过预设的命名实体识别(NER)流水线对原始文本进行自动化标注,系统性地识别并标记其中可能存在的个人身份信息(PII),如姓名、地址等敏感实体。每个文本片段被分割成句子后,经过PII检测模型逐句分析,生成包含实体类型、起始位置、置信度分数等字段的结构化标注结果,最终形成带有标签的语料集合。
特点
数据集包含约50,000个训练样本,总大小近500MB,具备多维度的结构化特征。每条数据不仅保留原始文本及其来源元数据,还提供句子级平均PII风险分数与句子数量统计。其核心特色在于细粒度的PII标注信息,涵盖实体类型、识别器标识、置信度分数及精确的字符级位置索引,为隐私风险评估与数据脱敏研究提供了高精度的基准数据。
使用方法
该数据集适用于训练和评估PII检测模型、隐私保护文本过滤系统以及数据脱敏算法。用户可通过HuggingFace Datasets库直接加载,利用其预定义的特征架构快速访问文本、元数据和标注结果。推荐将tagged_pii_results字段中的实体位置与类型信息作为监督信号,结合原始文本构建序列标注任务,或基于avg_score字段进行文档级隐私风险分级分析。
背景与挑战
背景概述
在大规模语言模型训练中,数据隐私保护已成为一个核心议题。由j-chim团队创建的pii-pile-chunk3-200000-250000-tagged数据集,聚焦于The Pile语料库中特定子集的个人身份信息(PII)标注。该数据集于近期发布,旨在为自然语言处理领域提供一种可复用的资源,用于检测和遮蔽文本中的敏感实体,如姓名、地址等。其核心研究问题在于如何高效、准确地从海量无标注文本中识别PII,以降低模型训练中的隐私泄露风险。通过引入细粒度的实体类型和评分机制,该数据集为后续的隐私保护模型训练和评估奠定了重要基础,尤其对推动负责任AI的发展具有显著影响力。
当前挑战
当前数据集面临多重挑战。首先,在领域问题层面,精准识别多样化的PII实体(如混杂的姓名、组织名及数字标识)仍是一项难题,尤其面对上下文歧义和拼写变体时,传统规则或模型易产生误判。其次,构建过程中,从The Pile中抽取的文本片段可能包含不完整的句子或噪声数据,导致标注一致性难以保证。此外,数据集的规模(约5万样本)相对有限,可能不足以覆盖长尾或罕见实体类型,影响下游模型的泛化能力。最后,隐私标注的伦理边界(如是否应完全移除敏感信息)也构成持续挑战,需在数据效用与隐私保护间寻求平衡。
常用场景
经典使用场景
j-chim/pii-pile-chunk3-200000-250000-tagged数据集源于对大规模文本语料库The Pile的精细切分与标注,聚焦于其中第200,000至250,000个样本片段。该数据集的核心用途在于训练与评估自然语言处理模型对个人身份信息(PII)的识别与脱敏能力,特别是在文本中标记出如姓名、地址、电话号码等敏感实体。研究者常将其作为基准数据,用于开发基于序列标注的PII检测系统,例如结合预训练语言模型(如BERT或RoBERTa)进行微调,以提升模型在复杂上下文中的实体边界定位与类型分类精度。其标注结构包含实体类型、起始位置与置信度分数,为细粒度的模型性能分析提供了可靠支撑。
解决学术问题
在学术研究中,该数据集有效解决了大规模无标注文本中PII自动识别与隐私保护这一关键挑战。传统方法多依赖规则或小规模手工标注语料,难以应对真实场景中PII的多样性与上下文歧义。通过提供带有丰富标注信息的子集,该数据推动了基于深度学习的序列标注模型在隐私保护领域的应用,使研究者能够系统性地评估模型在跨领域文本(如新闻、学术论文)上的泛化能力。其意义在于为构建更安全的语言模型奠定了基础,促使学界关注数据合规与伦理问题,并催生了针对PII误报与漏报的鲁棒性优化研究。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于其标注格式改进的PII识别框架,如融合上下文嵌入与条件随机场的混合模型,以及针对低资源语言PII检测的跨语言迁移学习研究。部分工作进一步扩展了数据集规模,通过弱监督或主动学习策略生成更大规模的标注语料,提升了模型的领域适应性。此外,该数据还被用于评估大型语言模型(如GPT系列)在生成文本中泄露PII的风险,推动了隐私安全评估基准的建立。这些衍生产品共同丰富了隐私保护自然语言处理的技术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务