登录后查看消息通知
遇见数据集
杭州筑龙信息技术股份有限公司

杭州筑龙信息技术股份有限公司

企业

杭州筑龙信息技术股份有限公司成立于2008年,属软件和信息技术服务业,主营第二类增值电信业务。面向建筑市场分析、企业信用评估、建筑招投标智能查询等领域提供数据服务,开放建设通-建筑业大数据服务平台(建筑市场分析、企业信用评估)、建筑企业中标业绩智能分析垂类大模型语料数据(建筑招投标智能查询、自然语言转SQL)、建筑企业关联关系图谱垂类大模型语料数据(建筑企业关联关系分析、垂类大语言模型语料),支撑市场分析与定价决策。

建筑市场分析企业信用评估建筑招投标智能查询软件信息服务高新技术企业
成立于 2008 年浙江省https://www.cbi360.net/491748212@qq.com

数据概览

89
数据集总量
311
总浏览量
0
关注人数
2026-09-03
最近更新
分类统计

相关机构

  • 杭
    杭州壹东建筑设计有限公司
    拥有数据集:30个
    企业
  • 山
    山东四季汽车服务有限公司
    拥有数据集:5个
    企业
  • 安
    安徽立光电子材料股份有限公司
    拥有数据集:5个
    企业
  • 宿
    宿州市四联机械股份有限公司
    拥有数据集:5个
    企业
  • 山
    山东新赛道航空科技有限公司
    拥有数据集:5个
    企业

数据集列表

建筑行业中标通知书关键信息智能提取大模型训练数据
建筑招投标信息提取
中标通知书结构化
建筑行业招投标活动中,中标通知书是记录中标结果的核心法律文件,包含项目名称、招标人、中标人、中标金额、项目编号、建设工期、质量要求、项目经理、中标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量中标通知书堆积导致信息提取滞后,影响项目跟进和市场竞争分析;不同地区通知书的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业中标通知书关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取项目名称、中标金额等9个关键信息字段。招标单位可实现中标信息自动化归档,中标企业可快速录入项目信息,行业研究机构可批量获取市场数据用于竞争分析,推动建筑行业招投标信息处理从人工模式向智能化方向发展。数据来源:原始数据来源于公司平台积累的建筑行业中标通知书文本数据,涵盖房建、市政、公路、水利、装饰、钢结构、机电安装、园林绿化等10类工程类型,覆盖全国12个省份,经平台业务系统自动采集与人工核实后形成中标通知书原始文本库。 数据预处理:对原始文档进行OCR识别和文本清洗,去除印章、签名等非文本干扰,统一日期格式为YYYY-MM-DD,统一金额单位为万元,对中标人名称保留前2字+**+后4字脱敏,项目经理保留姓+*脱敏。 数据标注:采用人工标注、模型预标注+人工校验、规则提取+人工校验、双人交叉标注等多种方式,对每份通知书标注项目名称、招标人、中标人、中标金额、项目编号、建设工期、质量要求、项目经理、中标日期共9个关键信息字段,经双人交叉标注质检,标注一致率≥95%。 模型训练:采用BERT-BidNotice预训练模型(12层Transformer,768维隐藏层)进行命名实体识别训练,设置学习率2e-5、批大小32、训练轮次50,使用PyTorch框架,以F1值≥0.92为目标。 模型评估:使用测试集计算各字段的精确率、召回率、F1值,确保关键字段提取F1值≥0.90,整体准确率≥92%,经业务专家人工核验确认。
浙江省数据知识产权登记平台2026-09-02 更新10
建筑行业中标金额规模提取及大模型分析语料数据
建筑招投标金额提取
中标金额规模分级
建筑行业招投标活动中,中标金额是衡量项目投资规模和市场价值的核心指标。然而,建筑行业中标金额数据分散在不同地区、不同工程类型的中标公告中,格式不统一、表述差异大,传统人工方式难以高效完成金额提取和规模分级;大量中标金额数据缺乏系统化分析,企业无法快速判断项目规模级别,影响投标策略制定和资源配置;行业缺乏统一的金额规模分析标准,不同地区对项目规模的认定存在偏差。本数据产品面向建筑行业中标金额规模AI分析场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型、5个规模等级的标注语料数据集,训练大模型实现从中标文本中自动提取金额并完成规模分级分析。招标单位可快速评估项目规模,投标企业可制定差异化竞争策略,行业研究机构可批量获取金额分布数据用于市场趋势分析,推动建筑行业招投标金额分析从人工模式向智能化方向发展。数据来源:原始数据来源于公司平台积累的建筑行业中标公告文本数据,涵盖房建、市政、公路、水利、装饰、钢结构、机电安装、园林绿化等10类工程类型,覆盖全国12个省份,经平台业务系统自动采集与人工核实后形成中标金额原始文本库。 数据预处理:对原始文档进行OCR识别和文本清洗,去除印章、签名等非文本干扰,统一日期格式为YYYY-MM-DD,统一金额单位为万元并保留两位小数,对项目名称保留前2字+**+后2字脱敏,招标人保留前2字+**+后4字脱敏,中标人保留前2字+**+后4字脱敏。 数据标注:采用人工标注、模型预标注+人工校验、规则提取+人工校验、双人交叉标注等多种方式,对每条语料标注项目名称、招标人、中标人、中标金额、金额规模等级、规模分析结论共6个关键字段,金额规模分为微型(<100万)、小型(100-500万)、中型(500-3000万)、大型(3000-10000万)、特大型(≥10000万)五级,标注一致率≥95%。 模型训练:采用BERT-BidAmount预训练模型(12层Transformer,768维隐藏层)进行金额提取与规模分类联合训练,设置学习率2e-5、批大小32、训练轮次50,使用PyTorch框架,以F1值≥0.92为目标。 模型评估:使用测试集计算金额提取的精确率、召回率、F1值及规模分类的准确率,确保金额提取F1值≥0.90,规模分类准确率≥92%,经业务专家人工核验确认。
浙江省数据知识产权登记平台2026-09-01 更新20
建筑行业资质标准AI知识问答语料数据
建筑资质知识问答
资质审查咨询
本数据产品面向建筑行业资质标准知识问答场景,构建涵盖15类建筑业企业资质、4个资质等级、12个问题分类的问答语料数据集。当前行业面临三大痛点:一是资质标准条文繁多,企业人员难以快速准确理解各类资质的人员配备、业绩要求、资产标准等具体规定;二是资质申请升级延续等流程复杂,企业常因对标准理解偏差导致申报材料不合规反复退回;三是行业缺乏系统化资质标准问答训练语料,现有大模型在建筑资质领域回答准确率低。本数据集覆盖资质等级划分、人员配备、企业业绩、企业资产、技术装备、资质申请等12个问题维度,可用于训练建筑资质标准知识问答大模型,支撑企业资质智能审查和在线咨询服务。
浙江省数据知识产权登记平台2026-08-21 更新30
建筑企业需求意图识别垂类大模型语料数据
建筑行业意图识别
自然语言转SQL
该数据可用于训练建筑企业需求意图识别垂类大语言模型,使其能够深度理解建筑企业在项目合作、采购寻源、资质服务、融资需求等业务场景中提交的自然语言需求描述,并准确转化为对应的SQL查询语句,从而实现需求数据的高效检索与意图分类分析。依托建设通平台整合的企业基础信息、需求原文、意图标注、项目类型、预算范围、紧急程度、需求来源等多源数据构建标准化语料体系,模型经训练后可精准理解"施工寻源""材料采购""资质代办""设备租赁""融资需求""政策咨询"等建筑行业特有需求意图,建筑行业企业可基于本语料数据的"指标名称""问题查询"等字段内容,适配自身需求数据表结构(如替换建表语句中的表名、字段名),快速启用文字转SQL功能进行复用。本数据也为建筑行业提供稀缺的、高质量的需求意图识别垂直领域语料库,支撑意图识别、自然语言处理等核心技术的研发与评测,推动建筑行业对于企业需求意图精准识别形成可量化评估的方向发展。同时对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1.数据清洗与标准化: 数据清洗:对从平台整合的原始数据进行清洗,剔除重复需求记录、缺失关键字段的数据及存在逻辑矛盾的样本。表格中"结果输出"为"无匹配数据"的样本,作为查询无返回结果的标准语料被保留,增强了模型对数据缺失场景的理解能力。 格式统一:统一意图类别划分标准(施工寻源/材料采购/资质服务/政策咨询等)、紧急程度等级(紧急/较急/一般/不急)、需求状态(待处理/跟进中/已签约/已关闭)和SQL语法风格,确保语料的规范性和一致性。对建表语句进行格式化,统一字段类型和注释风格。 2.问题分类与结构化:按照需求意图识别的特定场景对问题进行归类,主要包括需求意图总览、意图类别筛选、意图子类别筛选、多条件组合筛选及需求原文模糊查询等,确保语料对需求意图识别核心场景的全面覆盖。 3.核心算法建模: (1)语义解析与要素提取:采用基于规则和行业词典的文本分析方法,对自然语言问题进行解析,精准提取关键要素。针对需求意图识别领域的特有表述(如"找施工队""采购建材""代办资质"等),构建需求术语同义词映射表,将口语化表述归一化为标准意图类别和子类别查询条件。同时提取查询对象、筛选条件及聚合维度等关键要素。 (2)SQL语句生成:基于预定义的"需求术语-字段"映射规则和"查询意图-过滤条件"映射规则,自动生成标准化的SQL查询语句。映射规则覆盖多条件组合、排序、分页、聚合函数、分组统计及模糊匹配等SQL语法结构,重点强化多条件组合筛选和需求原文模糊查询的SQL生成能力。 规则补充: (3)异常值检测:对生成的SQL及其执行结果进行双重校验。一方面,利用LOF(局部异常因子)算法检测SQL语句的逻辑异常(如聚合函数缺失GROUP BY、多条件组合存在矛盾、LIKE通配符使用不当等);另一方面,结合IQR(四分位距)统计方法,识别结果中可能存在的异常值(如需求原文长度异常、关键词数量偏离正常范围等),并打标或过滤,确保语料质量。 (4)逻辑核验与业务对齐:对生成的"问题-SQL-结果"三元组进行最终核验。结合需求意图识别业务知识,判断SQL逻辑是否正确,确保语料不仅语法正确,更具备高度的业务适用性和准确性。 4. 语料库的持续迭代 构建语料库的闭环迭代机制。新产生的需求意图识别查询问题及其经核验的SQL语句会定期注入语料库,持续提升语料库对需求意图识别业务场景的覆盖度和数据质量。
浙江省数据知识产权登记平台2026-08-18 更新30
建筑行业中标金额规模提取及大模型分析语料数据
建筑招投标金额提取
中标规模分级
建筑行业招投标活动中,中标金额是衡量项目投资规模和市场价值的核心指标。然而,建筑行业中标金额数据分散在不同地区、不同工程类型的中标公告中,格式不统一、表述差异大,传统人工方式难以高效完成金额提取和规模分级;大量中标金额数据缺乏系统化分析,企业无法快速判断项目规模级别,影响投标策略制定和资源配置;行业缺乏统一的金额规模分析标准,不同地区对项目规模的认定存在偏差。本数据产品面向建筑行业中标金额规模AI分析场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型、5个规模等级的标注语料数据集,训练大模型实现从中标文本中自动提取金额并完成规模分级分析。招标单位可快速评估项目规模,投标企业可制定差异化竞争策略,行业研究机构可批量获取金额分布数据用于市场趋势分析,推动建筑行业招投标金额分析从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-08-18 更新30
建筑行业竣工验收报告关键信息智能提取大模型训练数据
建筑行业竣工验收报告信息抽取
建筑文档智能处理
建筑行业竣工验收报告是工程交付使用的核心法律文件,记录项目名称、建设单位、施工单位、监理单位、验收日期、验收结论、工程质量等级、建筑面积、工程造价等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量竣工验收报告以纸质或扫描件形式存储,信息提取滞后,影响工程档案归档和质监备案;不同地区验收报告的格式和表述差异大,人工提取难以保证一致性和准确性。本数据产品面向建筑行业竣工验收报告关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取项目名称、验收结论等9个关键信息字段。建设单位可实现验收信息自动化归档,住建主管部门可快速完成竣工备案核查,行业研究机构可批量获取竣工验收数据用于工程质量趋势分析,推动建筑行业竣工验收信息处理从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-09-02 更新10
建筑行业评标报告关键信息智能提取大模型训练数据
评标报告关键信息提取
招投标文档结构化
建筑行业招投标活动中,评标报告是记录评标过程和结果的核心文件,包含项目名称、招标人、评标方法、评标委员会人数、中标候选人、评标总分、技术标得分、商务标得分、评标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量评标报告堆积导致信息提取滞后,影响中标结果确认和项目跟进;不同地区评标报告的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业评标报告关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取评标方法、中标候选人等9个关键信息字段。招标单位可实现评标信息自动化归档,投标企业可快速获取评标结果反馈,行业研究机构可批量获取评标数据用于竞争分析,推动建筑行业评标信息处理从人工模式向智能化方向发展。数据来源:原始数据来源于公司平台积累的建筑行业评标报告文本数据,涵盖房建、市政、公路、水利、装饰、钢结构、机电安装、园林绿化等10类工程类型,覆盖全国12个省份,经平台业务系统自动采集与人工核实后形成评标报告原始文本库。 数据预处理:对原始文档进行识别和文本清洗,去除印章、签名等非文本干扰,统一日期格式为YYYY-MM-DD,统一评分保留一位小数,对项目名称保留前2字+**+后2字脱敏,招标人保留前2字+**+后4字脱敏,中标候选人保留前2字+**+后4字脱敏。 数据标注:采用人工标注、模型预标注+人工校验、规则提取+人工校验、双人交叉标注等多种方式,对每份评标报告标注项目名称、招标人、评标方法、评标委员会人数、中标候选人、评标总分、技术标得分、商务标得分、评标日期共9个关键信息字段,经双人交叉标注质检,标注一致率≥95%。 模型训练:采用BERT-BidEvalReport预训练模型(12层Transformer,768维隐藏层)进行命名实体识别训练,设置学习率2e-5、批大小32、训练轮次50,使用PyTorch框架,以F1值≥0.92为目标。 模型评估:使用测试集计算各字段的精确率、召回率、F1值,确保关键字段提取F1值≥0.90,整体准确率≥92%,经业务专家人工核验确认。
浙江省数据知识产权登记平台2026-09-01 更新00
建筑行业中标通知书关键信息智能提取大模型训练数据
建筑招投标信息抽取
中标通知书关键信息提取
建筑行业招投标活动中,中标通知书是记录中标结果的核心法律文件,包含项目名称、招标人、中标人、中标金额、项目编号、建设工期、质量要求、项目经理、中标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量中标通知书堆积导致信息提取滞后,影响项目跟进和市场竞争分析;不同地区通知书的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业中标通知书关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取项目名称、中标金额等9个关键信息字段。招标单位可实现中标信息自动化归档,中标企业可快速录入项目信息,行业研究机构可批量获取市场数据用于竞争分析,推动建筑行业招投标信息处理从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-08-19 更新20
建筑行业招标文件关键信息智能提取大模型训练数据
建筑行业招标文件信息提取
垂直领域大模型训练
本数据产品专为训练建筑行业招标文件信息提取领域垂类大语言模型而构建。建筑行业招标文件通常包含招标人信息、项目概况、资质要求、工期要求、技术参数、评标方法、合同条款等大量关键信息,这些信息分散在数十页乃至上百页的文档中,人工逐条提取耗时耗力且容易遗漏。传统招投标业务中,企业投标人员需要反复阅读招标文件,手动摘录各项关键信息用于编制投标文件和合规审查,效率低下且出错率较高。同时,不同招标文件的格式和表述方式差异较大,信息结构化程度低,给自动化处理带来挑战。本数据产品采用信息提取(Information Extraction)技术路径,覆盖招标人名称提取、项目金额提取、投标截止时间提取、资质要求提取、技术参数提取、评标方法提取、中标人信息提取等18种典型信息提取场景。企业可基于本语料数据的提取方法和标准答案字段内容,适配自身招标文件格式特点,快速构建招标文件关键信息智能提取系统进行复用。本数据为建筑行业提供了稀缺的、高质量的垂直领域语料,有力支撑了招标文件信息提取领域的自然语言处理技术研发、模型训练与评测,对推动建筑行业数据要素价值释放和AI技术应用落地具有重要意义。1. 数据清洗与标准化: 对原始招标文件提取数据进行多维度清洗处理:(1)去重处理:基于text_id和original_text+target_field_name组合键去除重复记录;(2)格式统一:文本类型字段标准化为"招标公告/招标文件/中标公示/补充通知"四种取值,字段数据类型标准化为"字符串/日期时间/金额/文本段落"四种取值;(3)脱敏处理:企业名称采用"前2字+**+后4字"规则脱敏,电话号码采用"前3位+****+后4位"规则脱敏,地址信息保留省市信息其余替换为"***";(4)保留"提取失败"样本,增强模型对复杂文本的鲁棒性。 2. 问题分类与结构化: 将信息提取场景按目标字段归类为18种类型:招标人名称提取、质量标准提取、项目经理要求提取、技术参数提取等核心场景。每种场景对应特定的提取方法组合。 3. 核心算法建模: (1)语义解析与要素提取:基于预训练语言模型(BERT-base-Chinese,12层Transformer,768维隐藏层)对招标文件原始文本进行深度语义解析,通过语义角色标注(SRL)识别文本中的论元结构,明确关键语义关系,为信息提取提供结构化语义基础。 (2)信息提取与匹配:采用命名实体识别(BiLSTM-CRF序列标注模型)结合正则表达式和领域规则引擎的双路径策略。针对结构化程度较高的信息(如电话号码、金额),设计专门的正则表达式模式进行匹配提取;针对半结构化信息(如资质要求、合同条款),基于关键词触发和上下文窗口规则进行提取。规则补充:(3)异常值检测:采用IsolationForest孤立森林算法(n_estimators=100, contamination=0.05, max_samples='auto')对提取结果进行异常检测,识别提取结果与标准答案不匹配、置信度异常偏低、字段类型错误等样本,异常语料过滤率>=99%。 (4)逻辑核验与业务对齐:建立提取结果与标准答案的匹配验证机制,综合考量实体边界置信度、上下文匹配度、规则匹配强度等多维特征。进行最终核验确保业务适用性。 4. 语料库的持续迭代: 建立"应用-反馈-优化"闭环机制:收集提取结果与人工标注标准答案的对比数据,统计各场景的提取正确率和置信度分布;针对错误样本进行原因分析,定向优化模型和规则;定期注入新语料,持续提升信息提取的覆盖度和数据质量。
浙江省数据知识产权登记平台2026-08-18 更新20
建筑行业评标报告关键信息智能提取大模型训练数据
建筑行业评标报告信息抽取
招投标文档智能处理
建筑行业招投标活动中,评标报告是记录评标过程和结果的核心文件,包含项目名称、招标人、评标方法、评标委员会人数、中标候选人、评标总分、技术标得分、商务标得分、评标日期等关键信息。传统模式下,这些信息依赖人工逐项阅读和录入,效率低下且易出错;大量评标报告堆积导致信息提取滞后,影响中标结果确认和项目跟进;不同地区评标报告的格式和表述差异大,人工提取难以保证一致性。本数据产品面向建筑行业评标报告关键信息智能提取场景,通过构建涵盖12种文本格式、覆盖12个省份10类工程类型的标注语料数据集,训练大模型实现从非结构化文本中自动提取评标方法、中标候选人等9个关键信息字段。招标单位可实现评标信息自动化归档,投标企业可快速获取评标结果反馈,行业研究机构可批量获取评标数据用于竞争分析,推动建筑行业评标信息处理从人工模式向智能化方向发展。
浙江省数据知识产权登记平台2026-08-18 更新50
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索