wenge-research/yayi2_pretrain_data
收藏资源简介:
本数据集源自雅意训练语料,精选了约100B数据,数据大小约为500GB,旨在推动中文预训练大模型开源社区的发展。数据集在预训练阶段使用了互联网数据、通用精选数据和领域数据,涵盖了报纸类、文献类、代码类、书籍类、百科类等多种数据类型。数据清洗过程包括标准化、启发式清洗、多级去重和毒性过滤,最终从240TB原始数据中筛选出10.6TB高质量数据。数据集遵循Apache-2.0协议,并提供了社区和商用许可协议。
本数据集源自雅意训练语料,精选了约100B数据,数据大小约为500GB,旨在推动中文预训练大模型开源社区的发展。数据集在预训练阶段使用了互联网数据、通用精选数据和领域数据,涵盖了报纸类、文献类、代码类、书籍类、百科类等多种数据类型。数据清洗过程包括标准化、启发式清洗、多级去重和毒性过滤,最终从240TB原始数据中筛选出10.6TB高质量数据。数据集遵循Apache-2.0协议,并提供了社区和商用许可协议。
介绍
本数据集源自雅意训练语料,精选了约100B数据,数据大小约为500GB。通过开源预训练数据,旨在推动中文预训练大模型开源社区的发展,并与合作伙伴共同构建雅意大模型生态。
组成
在预训练阶段,数据集不仅包含互联网数据,还添加了通用精选数据和领域数据,以增强模型的专业技能。通用精选数据涵盖报纸类数据、文献类数据、APP类数据、代码类数据、书籍类数据、百科类数据等。数据分布情况如下:

数据清洗
构建了一套全方位提升数据质量的数据处理流水线,包括标准化、启发式清洗、多级去重、毒性过滤四个模块。共收集了240TB原始数据,预处理后仅剩10.6TB高质量数据。数据处理流程如下:

协议
本项目中的代码依照Apache-2.0协议开源。使用YAYI 2模型和数据需遵循雅意YAYI 2模型社区许可协议。若用于商业用途,需申请商用许可并遵循相关限制。
引用
如使用本数据集,请引用以下论文:
@article{YAYI 2, author = {Yin Luo, Qingchao Kong, Nan Xu, et.al.}, title = {YAYI 2: Multilingual Open Source Large Language Models}, journal = {arXiv preprint arXiv:2312.14862}, url = {https://arxiv.org/abs/2312.14862}, year = {2023} }




