Pile of Law
收藏arXiv2025-09-30 收录
数据链接:
官方服务:
资源简介:
该数据集是由多个数据集组合而成,专门用于对DALE进行预训练,主要涉及法律文件。此外,该数据集还用于无监督的文本去噪和法律语言建模任务。其规模大约包含410万个文档,总数据量约为48GB。该数据集的任务是针对生成式数据增强的预训练。
This dataset is compiled from multiple datasets, specifically designed for pre-training DALE and primarily focusing on legal documents. Additionally, it is also utilized for unsupervised text denoising and legal language modeling tasks. It consists of approximately 4.1 million documents, with a total data volume of around 48 GB. This dataset is intended for pre-training oriented towards generative data augmentation.
搜集汇总
数据集介绍
构建方式
在大规模语言模型预训练数据中,有毒与隐私内容的过滤问题日益凸显,然而现有过滤手段往往缺乏上下文考量。为应对这一挑战,研究者从法律规范中汲取灵感,构建了Pile of Law数据集。该数据集汇聚了约256GB(且持续增长)的开源英文法律与行政文本,涵盖法院意见、合同、行政法规及立法记录等35个数据源。所有内容均来自公开记录,并遵循各司法管辖区的隐私与毒性过滤标准,隐式编码了法律对数据净化的权衡规则。
特点
Pile of Law的独特之处在于其内嵌了法律规范对内容过滤的精细处理。数据集反映了不同司法管辖区在隐私保护上的差异,例如美国联邦法院对当事人姓名的公开与德国法院的完全匿名化形成鲜明对比。同时,数据集中毒性内容的出现多为引用或历史材料,而非直接使用,这为学习上下文感知的过滤规则提供了天然样本。其多样性还体现在时间跨度上,从19世纪到现代,覆盖了法律语言与伦理标准的演变。
使用方法
研究者可利用Pile of Law进行多维度探索。一方面,可基于其子集训练模型学习法律隐私规则,如通过移民案件预测何时应使用化名,或对比不同机构(如退伍军人上诉委员会与劳工部)的隐私实践。另一方面,可用于校准毒性过滤器,揭示现有工具在历史文本或长文档上的不一致性。此外,该数据集可直接用于预训练法律领域语言模型,为提升司法可及性提供基础资源。
背景与挑战
背景概述
在大型语言模型迅猛发展的当下,预训练数据中充斥着偏见、淫秽、版权及隐私信息,引发了学界对模型潜在危害的深切忧虑。为应对这一困境,斯坦福大学的研究团队于2022年创建了Pile of Law数据集,该数据集由Peter Henderson、Mark S. Krass、Lucia Zheng等学者主导,旨在通过法律视角为数据过滤提供可循的规范。Pile of Law汇聚了约256GB的开放源代码法律与行政文本,涵盖法院意见、合同、行政法规及立法记录,其核心研究问题在于如何借鉴法律体系中业已成熟的隐私与毒性内容权衡机制,以指导语言模型的训练数据筛选。该数据集不仅为法律领域的模型预训练提供了宝贵资源,更开创了从法律文本中学习上下文感知过滤规则的新方向,对推动负责任的人工智能研究具有深远影响。
当前挑战
Pile of Law数据集面临多重挑战。首先,在领域问题层面,其核心挑战在于如何从法律文本中提炼出可迁移的隐私与毒性过滤规则,以解决当前模型预训练中过滤标准随意、缺乏上下文考量的问题。法律文本中隐含的过滤规范因司法管辖区、案件类型及历史时期而异,例如美国法院对未成年人姓名和财务账号的强制红action与德国法院对所有身份信息的全面隐去存在显著差异,这使得统一过滤标准的制定极为困难。其次,在构建过程中,团队需从35个不同来源整合数据,每个来源均带有其独特的法律过滤机制,确保数据一致性、版权合规性及隐私保护成为艰巨任务。此外,现有毒性过滤器在跨领域、跨时间数据上表现不一致,且长文档的毒性评分易受上下文影响,这些技术瓶颈进一步增加了数据集利用的复杂性。
常用场景
经典使用场景
Pile of Law 作为迄今规模最大的开源法律文本语料库,约256GB,汇聚了美国联邦与州法院意见、行政法规、合同、立法记录等35类来源。其经典使用场景在于为大型语言模型提供具备法律规范性过滤机制的预训练数据,研究者可借此探索如何在保留内容完整性的同时,依据法律规范对毒性及隐私信息进行情境化筛选,从而替代当前学术界普遍采用的临时性、去语境化的过滤策略。
解决学术问题
该数据集直面大语言模型预训练数据中隐私泄露与毒性内容泛滥的学术困境。通过系统梳理美国、德国、加拿大等司法管辖区对敏感信息及冒犯性内容的法定处理标准,Pile of Law 为研究者提供了可量化的过滤基准,解决了现有过滤方法缺乏法律依据、忽视语境的痛点。其意义在于将数据治理从经验驱动转向规范驱动,为构建负责任的AI系统奠定了方法论基础。
衍生相关工作
Pile of Law 催生了多项开创性研究:研究者利用其子集训练出可预测法律文书匿名化需求的分类器,并借助因果词汇分析揭示隐私决策的潜在模式;同时,该数据集被用于评估主流毒性检测工具(如 Perspective、Detoxify)在不同历史时期法律文本中的表现差异,揭示了现有过滤器在长文档及域外文本中的系统性偏差。这些工作为设计价值对齐、鲁棒性更强的数据过滤机制提供了新范式。
以上内容由遇见数据集搜集并总结生成



