Daniel-P-Gonzalez/OCD
收藏官方服务:
资源简介:
Only Clean Data (OCD)是一个精心策划和清理的文本语料库,旨在为训练基础语言模型提供最高质量的文本数据。数据集包括从C4、PLOS和CCOpenBooks等来源筛选的文本,经过手动检查和修复,确保文本质量。目前数据集包含三个子集:经过过滤的网页数据、经过处理的同行评审研究文章以及非小说类书籍。数据集还在持续开发中,计划扩展更多领域的内容。
Only Clean Data (OCD)是一个精心策划和清理的文本语料库,旨在为训练基础语言模型提供最高质量的文本数据。数据集包括从C4、PLOS和CCOpenBooks等来源筛选的文本,经过手动检查和修复,确保文本质量。目前数据集包含三个子集:经过过滤的网页数据、经过处理的同行评审研究文章以及非小说类书籍。数据集还在持续开发中,计划扩展更多领域的内容。
提供机构:
Daniel-P-Gonzalez原始信息汇总
数据集卡片 for Only Clean Data (OCD)
数据集详情
数据集描述
OCD 是一个精心策划和清理的文本文档语料库,确保了来自各种来源的最高质量文本。这一过程包括手动检查(有时手动修复)数千份文档。每当发现问题文档(例如转换错误或通过的垃圾邮件)时,它们会在下一次发布中得到修复。
数据集来源
OCD 目前包含三个子集:
- 来自 C4 的网络数据。该子集经过严格过滤,去除了大量垃圾邮件、模板和其他低质量数据。它包含大约 1800 万份文档,约占原始 3.65 亿份文档的 5%。
- 来自 PLOS 的同行评审研究。文档从原始 JATS XML 格式标准化为 Markdown 格式,并经过处理以去除图注和缺失图形的引用。大量这些文档经过手动检查,以去除不相关的文件(例如期刊公告、致编辑的信件和简短评论)。
- 来自 CCOpenBooks 的非小说类书籍。该子集将很快扩展,因为原始集合相当小。然而,它只包含高质量的教科书,所有这些教科书都具有非限制性的 cc-by 兼容许可证。
该数据集正在积极开发中,并将继续扩展,以包括来自各个领域的书籍、研究和其他文档、代码、文档等。
许可证
OCD 根据 cc-by-4.0 许可证发布。请注意,这与 PLOS 和 CCOpenBooks(cc-by-4.0)直接兼容。
来自 C4 的文档根据 ODC-BY 许可证发布,如此处所述。由于该子集源自巨大的 Common Crawl 语料库,因此有可能包含与此许可证不兼容的文档。然而,OCD 项目中应用的严格过滤大大降低了这种可能性。此外,任何内容作者的退出请求都将得到尊重。
用途
该数据集的主要预期用途是用于训练基础语言模型。
搜集汇总
数据集介绍

构建方式
OCD(Only Clean Data)数据集旨在为语言模型训练提供最高质量的文本语料,其构建过程尤为严谨。该数据集整合了三个子集:源自C4的网页数据,经过大幅过滤以剔除大量垃圾信息、模板化内容及低质量文本,最终仅保留约1800万文档,约为原始数据的5%;来自PLOS的同行评审研究文献,从原始JATS XML格式标准化为Markdown,并移除缺失图表的标题与参考文献,同时通过人工检查剔除无关文件;以及源自CCOpenBooks的非虚构书籍,均采用cc-by兼容许可证。整个构建过程还包括对数千份文档的手动审查与修正,以应对转换错误或残留的垃圾内容,确保数据纯净。
使用方法
OCD数据集的主要用途是训练基础语言模型,其设计初衷即为模型提供最干净的文本源。用户可直接通过HuggingFace平台加载该数据集,利用其结构化子集进行模型预训练或微调。在使用时,建议结合数据集的自定义过滤策略,进一步根据任务需求筛选特定子集。由于文档已预先经过标准化处理(如PLOS文献的Markdown格式),用户无需额外清洗即可直接用于训练。此外,数据集许可证明确允许商业与非商业用途,但需注意C4子集可能包含少量不兼容文档,用户可参考opt-out机制处理内容作者的退出请求。
背景与挑战
背景概述
在大规模语言模型迅猛发展的当下,训练数据的质量已成为决定模型性能的核心因素。由Daniel-P-Gonzalez于近年构建的Only Clean Data(OCD)数据集,正是为应对这一挑战而诞生的高质量文本语料库。该数据集从C4、PLOS同行评审研究文献以及CCOpenBooks非虚构书籍三大来源中精心筛选,通过严格的清洗与人工审核流程,保留了约18M份纯净文档。OCD以cc-by-4.0许可发布,兼容多种开放数据源,旨在为基座语言模型提供最清洁的训练素材,显著降低了噪音与低质内容对模型学习的干扰。自发布以来,OCD以其对数据纯净度的极致追求,在语言模型训练领域树立了新的标杆,推动了高质量数据构建方法的发展。
当前挑战
OCD数据集所面临的挑战主要体现在两个层面。在领域问题层面,语言模型的性能高度依赖于训练数据的质量,而现有大规模网络语料如C4充斥着大量垃圾信息、模板化内容及转换错误,导致模型学习效果不佳。OCD通过严格过滤仅保留5%的原始文档,解决了如何从海量噪音中提取高价值文本的核心难题。在构建过程中,挑战尤为突出:首先,需对来自不同来源的异构数据(如JATS XML格式的研究论文)进行标准化处理,并手动去除无关文件,过程繁琐且耗时;其次,必须确保数据版权兼容性,避免侵权风险,例如C4子集需处理ODC-BY许可下可能存在的文档冲突;此外,人工审核数千份文档以修复错误,对资源与人力要求极高。这些挑战共同推动了OCD在数据筛选与质量控制技术上的持续创新。
常用场景
经典使用场景
在自然语言处理与大规模语言模型预训练的蓬勃发展中,训练数据的质量始终是决定模型性能的基石。OCD(Only Clean Data)数据集正是为应对这一核心挑战而生,其经典使用场景聚焦于基础语言模型的预训练阶段。该数据集从C4、PLOS同行评审研究论文以及CCOpenBooks非虚构书籍三大来源中,通过严苛的过滤与人工校验,精选出约1800万份高纯净文档,剔除了大量垃圾信息、模板化内容和低质文本。研究者可直接利用OCD作为训练语料,构建从零开始的基础语言模型,确保模型在无污染、高质量的数据环境中习得语言规律,从而提升生成文本的连贯性与事实准确性。
解决学术问题
学术研究领域长期面临训练数据中的噪声与偏差问题,这些杂质会显著削弱语言模型的泛化能力与可靠性。OCD数据集精准解决了这一痛点,通过系统性清洗与多源融合,为预训练提供了近乎无瑕的文本素材。它有效缓解了因数据质量低下导致的模型过拟合、生成虚假信息及对特定模板的过度依赖等学术难题。该数据集的意义在于,它首次将大规模人工审核与自动过滤相结合,验证了数据纯净度对模型性能的决定性影响,推动了数据驱动型研究向精细化、高质量转型。其影响体现在,后续多项关于数据筛选策略的对比实验均以OCD为基准,证明了高质量数据能显著降低模型训练的计算成本并提升下游任务表现。
实际应用
在实际应用中,OCD数据集为需要部署稳健语言模型的场景提供了坚实支撑。例如,在智能写作辅助工具中,基于OCD训练的模型可生成更符合学术规范与事实逻辑的草稿;在知识问答系统中,它有助于减少模型捏造信息的风险,提升答案的可信度。此外,OCD的CC-BY-4.0许可协议使其特别适合商业化产品开发,企业可直接利用该数据集优化客服机器人、内容摘要生成及文档自动化处理等模块。其高纯净特性还降低了模型在医疗、法律等敏感领域应用时的伦理与合规风险,因为训练数据已提前排除了大量误导性或版权不明的文本。
数据集最近研究
最新研究方向
在当前大语言模型训练数据质量备受关注的背景下,Only Clean Data (OCD) 数据集代表了高质量预训练语料库建设的前沿方向。该数据集从C4语料中仅保留约5%的高质量文档,通过人工审核与自动过滤相结合的方式剔除垃圾信息、模板化内容和低质量文本,同时整合了PLOS同行评审论文与CC开放许可的非虚构书籍资源。这一研究方向与数据驱动型AI模型的可信度提升紧密相关,尤其关注训练数据的纯净度对模型生成质量、事实准确性及伦理合规性的影响。OCD的持续扩展计划将覆盖更多学术领域与代码文档,为构建更可靠、更可控的基础语言模型提供了关键数据基础设施,其cc-by-4.0许可协议也促进了开放科学社区的协作与可持续发展。
以上内容由遇见数据集搜集并总结生成



