工贸企业有限空间知识能力评估训练数据通过对有限空间作业相关法律法规、操作规程、风险辨识、应急处置等维度的测评数据进行结构化处理与上下文标注,构建覆盖多场景、多角色、多难度层级的能力评估数据集。该数据经安全合规校验与语义增强后,可形成具有高度专业性和复杂推理需求的评估样本,用于测试大模型在有限空间作业领域的知识掌握程度、风险辨识能力、应急处置技能等能力,提升大模型在有限空间作业领域的知识掌握深度、风险判断准确性及应急决策逻辑性,有效支撑AI模型在安全生产问答、智能监护辅助、作业方案审核等场景中的语义理解、专业推理与合规生成能力评估与优化。1.加工前的数据说明:采集《中华人民共和国安全生产法》《中华人民共和国行政处罚法》《生产安全事故报告和调查处理条例》《工贸企业有限空间作业安全管理与监督暂行规定》《工贸企业有限空间作业安全规定》以及GB12942-2006《涂装作业安全规程 有限空间作业安全技术要求》、GB12358-2024《作业场所环境气体检测报警仪器通用技术要求》、DB3305/T 289—2023《印染企业有限空间作业安全技术规程》、DB33/T 707—2013《工贸企业受限空间作业安全技术规范》等工贸企业有限空间相关的法律法规、规章制度和标准体系文件涉及的公开测试、考试题目,特别是操作规程、风险辨识、应急处置等维度的题目,得到原始文献题目数据集。
2.数据处理规则:1)对数据集中的字段内容进行清洗,主要对字段值中的异常值、缺失值等进行标准化处理;2)通过自然语言处理技术,将原始题目数据集进行文本实体标注,标注为有限空间的检查分类、检查对象、检查内容、检查程序四类实体类型,并标注题目的难度级别(简单、中等、困难);3)将工贸企业有限空间相关的法律法规、规章制度、标准体系文件进行结构化处理,即采用TextRank提取摘要的方式提取每个段落的一个关键句,将关键句按照段落的顺序排列,组成新的文本内容;对文本内容提取出的关键句序列再进行一轮关键句提取,根据迭代传播权重计算各个句子的得分,再将每个句子输入序列标注模型,得到实体序列标注结果,包含实体越多的句子给予越高的重要度权重倾斜,实体权重得分和句子重要度得分之和即作为每个句子最终的重要度分数。每次设置一个范围在[1,3]的整型随机数r,提取排名前r的关键句作为该题的正确候选答案(即在TextRank模型中,T=r),将正确候选答案分类存储;4)在答案集中随机选择字符长度与原正确候选答案最为接近的3个答案成为该题目的错误候选答案,若答案集中符合要求的错误候选答案数量不足,则采用NLTK生成该答案的反义词作为错误候选答案的补充。
3.数据内容描述:加工前的数据按照上述处理规则进行处理后,输出的数据内容为ABCD四个选项、答案、答案对应的重要度分数、实体类型(检查分类、检查对象、检查内容、检查程序)、题目难度(简单、中等、困难)。该数据集可用来测试和评估有限空间领域AI模型对场景理解的适用性。
余杭区九小场所安全生产隐患图像识别训练数据通过数据处理和数据加工流程,九小场所安全生产图像AI训练数据被转化为高质量、高标注准确性的训练集。这些数据可提供给 AI 模型进行训练,帮助模型深入学习并理解不同九小场所安全生产图像的隐患特征,包括疏散通道堵塞、消防器材缺失/过期/遮挡/不全、易燃易爆危险品存储、安全出口锁闭、疏散指示标志损坏、应急照明失效、电动自行车违规停放/充电等隐患类型的视觉特征与场景规律。
经过训练的AI模型能够更准确地识别、分类和标注九小场所各类安全生产隐患图像。对于大数据公司,通过数据标注、数据清洗、数据分析等服务,可以更好地利用数据资源,开发针对基层安全监管领域的特定应用;训练生成的模型,可辅助安全监管人员开展日常排查工作,提升隐患识别效率,降低人工排查的漏判、误判风险;生成的隐患识别模型可赋能九小场所安全生产的日常监管与企业自查,帮助监管部门实现隐患的早发现、早预警、早处置,同时降低企业在安全生产自查上的时间成本和人力成本,提升基层安全管理的智能化、精准化水平,助力防范化解九小场所安全风险。1.加工前的数据说明:原始图像数据来源于余杭区九小场所实地拍摄生成,涵盖餐饮、住宿、小作坊等不同类型场所场景,记录每张隐患图像的唯一图像ID,同步标注图像对应的场所业态、拍摄时间等基础信息,构建完整的九小场所安全生产原始图像数据库。
2. 数据处理规则:(1)图像预处理。对采集的原始图像进行标准化预处理操作,包括图像统一缩放至指定分辨率、裁剪冗余背景区域、去噪提升图像清晰度、调整亮度/对比度等参数,统一图像格式为JPG/PNG,确保所有图像质量与规格符合后续模型训练要求,同时记录预处理后的图像文件存储路径及相关参数配置。(2)模型训练。采用深度学习框架 PyTorch 搭建九小场所隐患识别模型,底层算法融合卷积神经网络(CNN)特征提取与扩散算法逻辑,按“隐患类型+隐患位置+隐患属性”的特征维度构建结构化提示词。在AI生成的提示词中,统一添加系统标识前缀【安全生产 AI】,标识程度为轻量级、非侵入式,不影响提示词语义结构与可读性。抽取部分预处理后的场所图像进行人工核验,确认提示词标注的准确性(如疏散通道堵塞、消防器材失效等隐患标注),再依据该提示词对预处理后的九小场所图像进行对应隐患描述识别。
3.数据内容描述:将描述信息整合为统一的隐患标注格式,与原始图像数据关联,形成包含隐患图像ID、预处理后图像路径、隐患标注结果(包括隐患描述、隐患依据、待识别的隐患特征、隐患识别难度、隐患识别时间)的完整训练数据集。在模型训练完成后,将训练好的模型及配套的隐患识别推理代码进行本地化封装部署,同时配套开发模型轻量化适配工具,支持与九小场所隐患排查智能体系统的快速对接。
危化品经营单位安全管理能力测试数据通过对危化品经营单位安全管理领域知识测评数据进行上下文标注,形成具有高度针对性和语义复杂性的训练集。这些数据通过数据解析和安全合规验证,从而生成危化品经营单位安全管理领域的专业样本,为全面评估AI大模型的危化品经营单位安全管理知识提供了专业全面的测试样例,在危化品安全管理问答题解答中的语义理解能力、语言表达能力和思维推导能力评估,以及测试和提升危化品经营单位安全管理领域AI模型对场景理解的适用性。1.数据采集:采集《中华人民共和国安全生产法》《中华人民共和国消防法》《危险化学品安全管理条例》《危险化学品经营许可证管理办法》《使用有毒物品作业场所劳动保护条例》《生产安全事故报告和调查处理条例》《建筑设计防火规范》《常用危险化学品分类及标志》等相关法律法规、规章制度涉及的危化品经营单位安全管理领域公开测试、考试题目,得到待分析原始数据的危化品安全管理类文献题目数据集。
2.数据处理:1)采用文本标注,标注题目的难度级别(简单、中等、困难);2)采用TextRank提取摘要的方式提取每个段落的一个关键句,将关键句按照段落的顺序排列,组成新的文本内容;对文本内容提取出的关键句序列再进行一轮关键句提取,根据迭代传播权重计算各个句子的得分,再将每个句子输入序列标注模型,得到实体序列标注结果,包含实体越多的句子给予越高的重要度权重倾斜,实体权重得分和句子重要度得分之和即作为每个句子最终的重要度分数。每次设置一个范围在[1,3]的整型随机数r,提取排名前r的关键句作为该题的正确候选答案(即在TextRank模型中,T=r),将正确候选答案分类存储;3)在答案集中随机选择字符长度与原正确候选答案最为接近的2个答案成为该题目的错误候选答案,若答案集中符合要求的错误候选答案数量不足,则采用NLTK生成该答案的反义词作为错误候选答案的补充。
3.数据应用:该数据集可用来测试和提升危化品单位安全管理领域AI模型对场景理解的适用性。
安全生产知识能力评估训练数据通过对安全生产领域知识测评数据,进行上下文标注,形成具有高度针对性和语义复杂性的训练集。这些数据通过数据解析和安全合规验证,从而生成安全生产领域的专业样本,为全面评估AI大模型的安全生产知识提供了专业全面的测试样例,在安全生产问答题解答中的语义理解能力、语言表达能力和思维推导能力评估,以及测试和提升安全生产领域AI模型对场景理解的适用性。1.数据采集:采集《中华人民共和国安全生产法》《中华人民共和国消防法》《安全事故隐患排查治理暂行规定》《固定式压力容器安全技术监察规程》《起重机械定期检验规则》等安全生产相关法律法规、规章制度涉及的安全生产领域公开测试、考试题目,得到待分析原始数据的安全生产类文献题目数据集。
2.数据处理:1)采用文本标注,标注题目所属安全类型;2)采用TextRank提取摘要的方式提取每个段落的一个关键句,将关键句按照段落的顺序排列,组成新的文本内容;对文本内容提取出的关键句序列再进行一轮关键句提取,根据迭代传播权重计算各个句子的得分,再将每个句子输入序列标注模型,得到实体序列标注结果,包含实体越多的句子给予越高的重要度权重倾斜,实体权重得分和句子重要度得分之和即作为每个句子最终的重要度分数。每次设置一个范围在[1,4]的整型随机数r,提取排名前r的关键句作为该题的正确候选答案(即在TextRank模型中,T=r),将正确候选答案分类存储;3)根据该题目的安全类型与正确候选答案的实体类型,在相同安全类型与实体类型的答案集中随机选择字符长度与原正确候选答案最为接近的3个答案成为该题目的错误候选答案,若答案集中符合要求的错误候选答案数量不足,则采用NLTK生成该答案的反义词作为错误候选答案的补充。
3.数据应用:该数据集可用来测试和提升安全生产领域AI模型对场景理解的适用性。
工贸企业有限空间知识能力评估训练数据通过对有限空间作业相关法律法规、操作规程、风险辨识、应急处置等维度的测评数据进行结构化处理与上下文标注,构建覆盖多场景、多角色、多难度层级的能力评估数据集。该数据经安全合规校验与语义增强后,可形成具有高度专业性和复杂推理需求的评估样本,用于测试大模型在有限空间作业领域的知识掌握程度、风险辨识能力、应急处置技能等能力,提升大模型在有限空间作业领域的知识掌握深度、风险判断准确性及应急决策逻辑性,有效支撑AI模型在安全生产问答、智能监护辅助、作业方案审核等场景中的语义理解、专业推理与合规生成能力评估与优化。
余杭区九小场所安全生产隐患图像识别训练数据通过数据处理和数据加工流程,九小场所安全生产图像AI训练数据被转化为高质量、高标注准确性的训练集。这些数据可提供给 AI 模型进行训练,帮助模型深入学习并理解不同九小场所安全生产图像的隐患特征,包括疏散通道堵塞、消防器材缺失/过期/遮挡/不全、易燃易爆危险品存储、安全出口锁闭、疏散指示标志损坏、应急照明失效、电动自行车违规停放/充电等隐患类型的视觉特征与场景规律。
经过训练的AI模型能够更准确地识别、分类和标注九小场所各类安全生产隐患图像。对于大数据公司,通过数据标注、数据清洗、数据分析等服务,可以更好地利用数据资源,开发针对基层安全监管领域的特定应用;训练生成的模型,可辅助安全监管人员开展日常排查工作,提升隐患识别效率,降低人工排查的漏判、误判风险;生成的隐患识别模型可赋能九小场所安全生产的日常监管与企业自查,帮助监管部门实现隐患的早发现、早预警、早处置,同时降低企业在安全生产自查上的时间成本和人力成本,提升基层安全管理的智能化、精准化水平,助力防范化解九小场所安全风险。
浙江省安全生产隐患检查评估数据通过对安全生产隐患检查标准清单内容进行加工,分类形成检查清单类别、检查分类、检查对象、检查内容、典型隐患描述等,指导安全生产企业进行重大安全隐患进行自查中,统一检查标准,提高检查的一致性和有效性,帮助企业提升安全生产管理水平,增强应急处置能力。1.数据采集:采集浙江省安全生产全覆盖检查标准体系文件。
2.通过自然语言处理技术,将浙江省安全生产全覆盖检查标准体系文件进行结构化处理,识别命名实体得到需要的字段,包括检查清单类别、检查分类、检查对象、检查内容;对字段内容进行清洗,主要对字段值中的异常值、缺失值等进行标准化处理,形成数据集;运用文本相似度算法按照检查清单类别、检查分类、检查对象、检查内容等进行排序去重,得到不同企业的检查项目,通过使用KNN算法将数据集中的数据与主要依据的词语进行检索比对,形成典型隐患描述。对典型隐患描述进行检查方式的人工标注分类,分为查阅资料、人员询问、现场检查、监控回放。每项典型隐患描述对应的检查方式可包含一类或几类。
3.数据应用:该数据集可指导企业进行重大安全隐患自查,提升安全生产管理水平,增强应急处置能力。