建筑行业评标报告关键信息智能提取大模型训练数据
收藏资源简介:
建筑行业招投标活动中,评标报告是记录评标过程和结果的核心文件,包含项目名称、招标人、评标方法、评标委员会人数、中标候选人、评标总分、技术标得分、商务标得分、评标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量评标报告堆积导致信息提取滞后,影响中标结果确认和项目跟进;不同地区评标报告的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业评标报告关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取评标方法、中标候选人等9个关键信息字段。招标单位可实现评标信息自动化归档,投标企业可快速获取评标结果反馈,行业研究机构可批量获取评标数据用于竞争分析,推动建筑行业评标信息处理从人工模式向智能化方向发展。数据来源:原始数据来源于公司平台积累的建筑行业评标报告文本数据,涵盖房建、市政、公路、水利、装饰、钢结构、机电安装、园林绿化等10类工程类型,覆盖全国12个省份,经平台业务系统自动采集与人工核实后形成评标报告原始文本库。 数据预处理:对原始文档进行识别和文本清洗,去除印章、签名等非文本干扰,统一日期格式为YYYY-MM-DD,统一评分保留一位小数,对项目名称保留前2字+**+后2字脱敏,招标人保留前2字+**+后4字脱敏,中标候选人保留前2字+**+后4字脱敏。 数据标注:采用人工标注、模型预标注+人工校验、规则提取+人工校验、双人交叉标注等多种方式,对每份评标报告标注项目名称、招标人、评标方法、评标委员会人数、中标候选人、评标总分、技术标得分、商务标得分、评标日期共9个关键信息字段,经双人交叉标注质检,标注一致率≥95%。 模型训练:采用BERT-BidEvalReport预训练模型(12层Transformer,768维隐藏层)进行命名实体识别训练,设置学习率2e-5、批大小32、训练轮次50,使用PyTorch框架,以F1值≥0.92为目标。 模型评估:使用测试集计算各字段的精确率、召回率、F1值,确保关键字段提取F1值≥0.90,整体准确率≥92%,经业务专家人工核验确认。




