建筑工程进度智能预测问数垂类大模型语料数据
收藏资源简介:
本数据为训练建筑行业工程进度预测领域垂类大语言模型而构建。当前工程进度监控主要依赖人工定期汇报和现场巡查,存在信息滞后、数据碎片化、延期预警不及时等问题。项目管理人员需要从施工日志、月进度表等多个渠道手动汇总进度数据,难以实时掌握项目的真实进展状态。面对大量在建项目,人工逐项分析进度偏差、评估延期风险效率低下,导致进度预警滞后,错失最佳纠偏时机。不同项目的进度数据格式不统一、字段定义不一致,给跨项目进度对比和趋势分析带来困难。本数据产品采用时序预测模式下的Text-to-SQL技术路径,围绕工程进度信息表设计18种典型查询场景,覆盖项目进度总览查询、延期项目查询、施工单位查询、延期天数查询、多条件组合查询、进度预警查询、进度综合分析查询等场景,生成高质量的问题-SQL-结果三元组训练语料。企业可基于本语料数据的“指标名称”“问题查询”等字段内容,适配自身数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据产品作为稀缺的、高质量的垂直领域语料,对推动建筑行业工程进度预测智能化发展提供了有力支撑,对建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始工程进度数据进行多维度清洗处理:(1)脱敏处理:施工单位等企业名称字段采用"前2字+**+后4字"的脱敏规则,项目所在地等地址字段采用"省市+***"的脱敏规则,确保训练数据不泄露真实商业信息;(2)数据标准化:统一日期格式、工期单位等数据表达规范,进度百分比等数值字段保留两位小数精度;(3)异常样本保留:对查询结果为"无匹配数据"的样本予以保留,用于训练模型识别边界查询和空结果场景,提升模型的鲁棒性。 2. 问题分类与结构化: 将自然语言问题按工程进度预测场景归类为18种类型:项目进度总览查询、施工单位多项目查询、进度综合分析查询等核心场景。同时按查询复杂度分为单条件查询、范围查询、多条件组合查询和综合分析查询四个维度。 3. 核心算法建模: (1)语义解析:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对用户自然语言问题进行深度语义解析,采用CRF序列标注技术提取问题中的关键查询条件(项目名称、施工单位、进度状态、日期、延期天数等),为后续SQL生成提供结构化输入。 (2)SQL生成:根据识别的意图和提取的实体,按照场景模板生成对应的SQL查询语句,支持单条件查询、范围查询、多条件组合查询和综合分析查询。结合历史工期数据和当前施工效率,对项目进度趋势进行时序预测,评估阶段转换时间和竣工日期预测。 (3)异常检测:采用IsolationForest(n_estimators=100, contamination=0.05)孤立森林算法对生成的语料进行异常检测,识别SQL语法错误、语义不一致、结果与问题不匹配等异常样本,异常语料过滤率不低于99%,确保训练语料的质量和可靠性。规则补充:(4)逻辑核验:由资深建筑行业工程管理专家对生成的语料进行最终核验,重点检查SQL语句的业务逻辑正确性、叙述式结果的信息完整性和表达准确性,确保每条训练样本符合行业实际业务场景。 4. 语料库持续迭代: 建立"应用-反馈-优化"闭环迭代机制:收集用户在实际使用中的问答日志,对回答不准确或用户不满意的样本进行专家审核和修正,定期更新工程进度数据和语料库,持续提升垂类大模型在工程进度预测领域的问数能力。




