遇见数据集

建筑行业中标金额规模提取及大模型分析语料数据

收藏
浙江省数据知识产权登记平台2026-09-01 更新2026-09-02 收录
官方服务:

资源简介:

建筑行业招投标活动中,中标金额是衡量项目投资规模和市场价值的核心指标。然而,建筑行业中标金额数据分散在不同地区、不同工程类型的中标公告中,格式不统一、表述差异大,传统人工方式难以高效完成金额提取和规模分级;大量中标金额数据缺乏系统化分析,企业无法快速判断项目规模级别,影响投标策略制定和资源配置;行业缺乏统一的金额规模分析标准,不同地区对项目规模的认定存在偏差。本数据产品面向建筑行业中标金额规模AI分析场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型、5个规模等级的标注语料数据集,训练大模型实现从中标文本中自动提取金额并完成规模分级分析。招标单位可快速评估项目规模,投标企业可制定差异化竞争策略,行业研究机构可批量获取金额分布数据用于市场趋势分析,推动建筑行业招投标金额分析从人工模式向智能化方向发展。数据来源:原始数据来源于公司平台积累的建筑行业中标公告文本数据,涵盖房建、市政、公路、水利、装饰、钢结构、机电安装、园林绿化等10类工程类型,覆盖全国12个省份,经平台业务系统自动采集与人工核实后形成中标金额原始文本库。 数据预处理:对原始文档进行OCR识别和文本清洗,去除印章、签名等非文本干扰,统一日期格式为YYYY-MM-DD,统一金额单位为万元并保留两位小数,对项目名称保留前2字+**+后2字脱敏,招标人保留前2字+**+后4字脱敏,中标人保留前2字+**+后4字脱敏。 数据标注:采用人工标注、模型预标注+人工校验、规则提取+人工校验、双人交叉标注等多种方式,对每条语料标注项目名称、招标人、中标人、中标金额、金额规模等级、规模分析结论共6个关键字段,金额规模分为微型(<100万)、小型(100-500万)、中型(500-3000万)、大型(3000-10000万)、特大型(≥10000万)五级,标注一致率≥95%。 模型训练:采用BERT-BidAmount预训练模型(12层Transformer,768维隐藏层)进行金额提取与规模分类联合训练,设置学习率2e-5、批大小32、训练轮次50,使用PyTorch框架,以F1值≥0.92为目标。 模型评估:使用测试集计算金额提取的精确率、召回率、F1值及规模分类的准确率,确保金额提取F1值≥0.90,规模分类准确率≥92%,经业务专家人工核验确认。

创建时间:
2026-07-08
搜集汇总
数据集介绍
建筑行业中标金额规模提取及大模型分析语料数据 数据集图片
背景与挑战
背景概述
该数据集为建筑行业中标金额规模提取及大模型分析语料,包含12000条标注数据,覆盖12个省份、10类工程类型,按金额分为微型、小型、中型、大型、特大型五个规模等级。数据经OCR识别、清洗、脱敏及人工标注,标注了项目名称、招标人、中标人、中标金额、金额规模等级和规模分析结论等6个字段,并采用BERT模型进行金额提取与规模分类联合训练,以支持招投标金额的智能化分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务