IndustryCorpus2
收藏资源简介:
该数据集是一个用于行业模型训练的高质量数据集,包含了31个行业类别,涵盖中文和英文数据,总数据量为1TB中文和2.2TB英文。数据集经过数据源升级、行业分类系统更新、数据语义质量筛选和数据质量分层处理,分为高、中、低三个等级,以适应不同层次的模型训练需求。数据集的主要目的是提升行业模型的性能,实现行业应用的智能化转型和创新发展。
This is a high-quality dataset designed for industry model training. It covers 31 industry categories and contains bilingual Chinese and English data, with a total data size of 1TB for Chinese and 2.2TB for English. The dataset has undergone several processing steps including data source upgrading, industry classification system update, semantic quality screening, and data quality tiering, and is categorized into three quality levels: high, medium and low, to cater to the training requirements of models at different tiers. The primary goal of this dataset is to enhance the performance of industry-specific models, and promote the intelligent transformation and innovative development of industry applications.
IndustryCorpus2 数据集概述
数据集基本信息
- 许可证: Apache 2.0
- 语言: 中文、英文
- 数据规模:
- 中文数据: 1TB
- 英文数据: 2.2TB
数据集更新与迭代
- 数据源: 引入更多高质量数据源,如pile、bigcode、open-web-math等数学和代码数据。
- 行业类别系统: 结合国家统计局制定的国民经济行业分类体系(20类)和世界知识体系,重新设计行业类别,设置31个行业类别,基本覆盖当前主流行业。
- 数据语义质量筛选: 采用规则过滤+模型过滤方案,大幅提升整体数据质量。
- 数据质量分层: 根据质量评估分数对数据进行分层组织,分为高、中、低三个层次。
行业数据分布
- 数据大小: 3276GB
- 主要行业数据分布:
- 学科教育: 340.9GB
- 体育: 262.5GB
- 时政-政务-行政: 271.5GB
- 法律-司法: 238.5GB
- 医学-健康-心理-中医: 271.7GB
- 影视-娱乐: 209.4GB
数据质量分层
- 数据质量分布:
- 中文和英文数据质量分布趋势基本相同,中等质量数据最多,其次是高质量数据,低质量数据最少。
- 英文数据中高质量数据的比例高于中文数据。
行业类别分类
- 行业类别数量: 31个
- 数据构建:
- 数据来源: 预训练语料采样和开源文本分类数据,其中预训练语料占比90%。
- 标签构建: 使用LLM模型对数据进行多次分类判断,选择多次判断一致的数据作为训练数据。
- 数据规模: 36K
数据质量评估
- 低质量数据过滤: 去除极低质量数据,将可用数据分为低、中、高三个独立组,便于模型训练时的数据匹配和组合。
- 数据构建:
- 数据来源: 预训练语料随机采样。
- 标签构建: 设计数据评分规则,使用LLM模型进行多轮评分,选择多轮评分差异小于2的数据。
- 数据规模: 20k评分数据,中英文比例1:1。
模型训练
- 模型选择: 使用0.5B规模模型,比较beg-m3和qwen-0.5b,最终实验显示bge-m3整体性能最佳。
- 模型超参数: base bge-m3,全参数训练,lr=1e-5,batch_size=64,max_length = 2048。
- 模型评估: 在验证集上,模型和GPT4在样本质量判断上的一致率为90%。
高质量数据训练效益
- 训练效率提升: 使用高质量数据训练的模型在14B tokens时即可达到使用50B普通数据训练的模型性能。
- 模型效果提升: 在模型训练的退火阶段加入筛选后的高质量数据和指令数据,模型性能得到显著提升。




