🏆 海之子杯 AI 智能体挑战计划 · 参赛作品

建筑施工安全规范智能问答系统

97 条现行规范条文构成的结构化安全知识图谱为唯一依据:先做确定性检索定位条文,再由大模型在条文约束下生成解答,输出经 JSON Schema 校验。答不出,就明确说「不知道」——而不是编一个听起来合理的条款号。

LLM 大语言模型 安全知识图谱 图谱约束生成 DeepSeek JSON Schema 约束
主办:中国建筑国际集团· 支持:学习强国学习平台· 赛事官网 →
Core Technology

四重机制,抑制 AI 幻觉

从「检索、生成、校验、兜底」四个环节层层把关,让回答「有据可查、可追溯验证」。

🕸️

安全知识图谱

97 条规范条文按「工程类别 → 风险类型 → 规范依据 → 条款要点」组织成图谱结构,每条含条款原文、条款解读、关联条款、注意事项与检索路径,覆盖 13 大类施工安全领域。

🔗

确定性检索

关键词加权 + 工程主体名词对齐,按标题、图谱路径、条款内容逐层定位。刻意不使用向量相似度检索——安全领域里「语义相近但条款号搞错」不可接受。命中哪一条、为什么命中,全程可解释、可复算。

🧠

约束式生成

检索到的条文是喂给大模型的唯一上下文,并要求按 JSON Schema 输出。服务端逐字段校验,未通过则重试一次,仍不通过就丢弃模型输出、直接回落条文原文——未经校验的模型输出永远不会出现在界面上

🛡️

拒答与转人工

领域内未收录的问题明确拒答,不给未经规范支撑的结论;涉及危大工程、深基坑、起重吊装、有限空间等 49 条高风险条文,答复强制附加「须经项目技术负责人复核」提示。

Features

核心功能

面向施工现场真实需求,让安全规范「问得到、审得准、学得会」。

01

智能问答

输入施工安全问题,系统在 97 条规范条文中确定性定位依据,返回结构化回答:规范条款 + 解读 + 关联条款 + 注意事项,并附带检索路径。

已完成并线上运行
02

反幻觉拒答

属于施工安全领域但知识库未收录的问题,系统明确回答「未收录、不给未经验证的结论」,而不是编一个似是而非的条款号。108 条评测用例中拒答准确率 100%。

已完成并线上运行
03

高风险分级 · 转人工

涉及危大工程、深基坑、起重吊装、有限空间等 49 条高风险条文,答复强制附加「须经项目技术负责人复核」提示——AI 不越权替人做施工决策。

已完成并线上运行
04

方案规范审查

上传专项施工方案,对方案条款与规范库做逐条一致性比对,输出问题清单与修改建议。

开发中(规则框架设计中)
Design

场景适配 + 人机协同

面向建筑施工场景定制,引入人机协同机制保障知识准确性。

🏗️ 13 大类知识体系

危大 危大工程管理 基坑 基坑土方 模板 模板支撑 架体 脚手架工程 高处 高处作业 临电 临时用电 起重 起重吊装 消防 消防动火 受限 有限空间 机械 施工机械 健康 职业健康与环境 管理 安全管理体系 专项 拆除/幕墙/钢结构等专项

知识库已结构化 97 条条文,源自 40 部国家标准与行业标准(GB / GB/T / JGJ 系列)及 3 部法规与规范性文件(住建部令第 37 号、国务院令第 493 号、建办质〔2018〕31 号),按工程类别组织为可检索的结构。

🤝 三阶段人机协同标注

1

LLM 预标注

大模型自动完成规范条文的初步结构化标注

2

验证器筛查

引入偏见治理框架,自动筛查标注中的错误与偏差

3

专家复核

领域专家人工复核,确保知识准确无误后入库

Progress

开发进度

下表为真实进度,可逐项核对;已完成项均可现场演示与复算。当前整体完成度约 70%

规范条文结构化入库
65%
已录入 97 条 / 13 大类,每条含条款原文、解读、关联条款、注意事项
安全知识图谱结构化
100%
97 条全部完成「工程类别 → 风险类型 → 规范依据 → 条款要点」结构化
确定性检索算法
100%
含工程主体名词加权;166 条评测集综合准确率 99.4%(见下方评测区)
大模型接入与约束生成
100%
已接入并线上运行;JSON Schema 校验 + 解析失败重试 + 确定性回落
智能问答四通路
100%
生成 / 离线 / 拒答 / 通用对话,任一环节异常自动降级,演示不中断
高风险分级与人工复核
100%
49 条高风险条文(危大 / 深基坑 / 起重 / 有限空间等)强制附加复核提示
方案审查功能
15%
规则框架设计中(条款级一致性比对)
移动端 / 小程序
0%
待开发(当前仅 Web 端)
Live Demo

在线体验 · 提问即答

输入施工安全问题,系统先检索知识图谱定位条文,再生成「规范条款 + 解读 + 关联条款 + 注意事项」四段式解答。已收录 97 条现行规范条文(源自 40 部国家标准与行业标准 + 3 部规范性文件),覆盖危大工程管理、基坑土方、模板支撑、脚手架、高处作业、临时用电、起重吊装、消防动火、有限空间等 13 大类。知识库未收录的领域问题会明确告知而非编造;打招呼、问身份等一般问题走通用对话;高风险主题强制提示人工复核。点击下方示例直接体验 ↓

施工规范智能问答 · 在线演示 知识图谱检索模式
系统 你好 👷 我是施工安全规范智能助手。请描述你的施工场景或安全问题,我会从知识图谱中检索对应的规范条文,并给出可追溯的解答。也可以先打个招呼——问问我是谁、能做什么都行。
(本演示基于已入库的规范知识图谱作答,未收录的领域问题会明确告知,不做臆测——这正是我们抑制大模型幻觉的核心设计;一般对话则走通用通道,不占用规范依据。)

回答由后端 确定性检索 定位规范条文,再由 大模型在条文约束下生成,输出经 JSON Schema 校验后才会展示 —— 校验不通过则丢弃模型输出、回落条文原文。领域内未收录的问题明确拒答,一般问题走通用对话并标注未引用规范,高风险主题强制提示人工复核。

Evaluation

质量评测 · 数字可复算

我们为系统建立了 166 条评测集,并把「好不好用」拆成五个可量化维度。评测脚本直接 import 部署产物本身(而非另写一份近似实现),因此本地跑出的数字与线上真实行为一致,任何人按同一条命令都能复现。

99.4%
综合准确率
165 / 166
99.0%
检索召回率
104 / 105
100%
反幻觉拒答率
18 / 18
100%
意图分类 + 边界健壮性
24 + 10 / 34
100%
高风险主题识别
9 / 9

为什么这样设计评测

  • 把「答得准」拆成召回 / 拒答 / 意图 / 健壮性 / 风险分级五个维度分别计分,不用一个均分掩盖问题。
  • 施工安全场景下,「该拒的没拒」比「该答的没答」严重得多——编造条款号的代价是人身伤害,所以拒答维度单独设卡。
  • 用例既包含真实工友口吻的问法,也包含空串、纯符号等边界输入,以及线上对抗探针(提示注入、伪造规范号)。

如何复算

node tools/build.mjs
node tools/eval.mjs

评测直接引用即将部署的 functions/api/chat.js 导出的检索与分类函数,并打印产物 sha256 指纹,确保「评测的数字」与「线上跑的行为」指向同一次构建。

未通过的 1 例已记录在案:问「混凝土浇筑完多久可以拆模」,系统命中「高大模板混凝土浇筑安全」而非「模板拆除条件与顺序」——属于相邻条文近似命中,改进方向是引入问句意图动词识别(时间性意图 → 归入拆模条件)。我们不隐藏失败用例。

Demo

演示案例

两个典型场景,展示系统的实际问答效果。

案例一 · 施工规范智能问答

用户输入 搭设高度 8 米的模板支撑体系,有什么安全要求?
系统输出
规范条款依据 JGJ162-2008《建筑施工模板安全技术规范》第 6.1.9 条:高度超过 8m 的模板支撑体系应编制专项施工方案,并组织专家论证。
条款解读8 米及以上高度的模板支撑属于危险性较大的分部分项工程,必须单独编制专项方案并经过专家论证后方可实施。
关联条款JGJ162-2008 第 6.2.3 条(支撑体系构造要求)、GB50204-2015 第 4.2.8 条(模板安装验收)。
注意事项建议关注:①支撑体系的基础承载力 ②剪刀撑设置间距 ③监测点布置与预警值。

案例二 · 施工方案规范审查

用户输入 上传一份模板支撑专项施工方案文档
系统输出
审查结果共检查 45 项条款,通过 38 项,发现问题 7 项。
问题清单
1. 未提及支撑体系基础承载力验算 → 违反 JGJ162-2008 第 6.1.5 条
2. 剪刀撑设置间距为 6 米 → 超过规范要求的 4.5 米 → 违反 JGJ162-2008 第 6.2.3 条
3. 未设置监测预警值 → 违反 GB50204-2015 第 4.2.10 条
修改建议补充基础承载力计算书、调整剪刀撑间距至 4.5 米以内、增加监测方案章节。
Team

团队分工

人机协同,各司其职。

雷顺杰

算法工程与系统架构
  • LLM 接口对接、提示词工程与结构化输出约束
  • 知识图谱结构设计与确定性检索算法
  • 后端 API 开发与 Cloudflare Pages Functions 部署
  • 评测集构建与检索链路的工程实现

张昊崇

产品设计与领域知识
  • 建筑规范文档采集与知识维度分类(十大知识主题)
  • 知识图谱数据标注与实体关系定义
  • 产品功能设计、交互流程与 UI 原型
  • 演示视频脚本与 PPT 材料制作
Roadmap

不足与优化方向

当前不足

  • 知识图谱覆盖的规范数量有限,目前仅覆盖 5 本核心规范
  • 移动端尚未适配,目前仅支持 Web 端访问
  • 语音输入功能尚未集成
  • 缺乏真实项目的规模化验证

优化方向

  • 知识库扩充至 300 条以上条文,覆盖更多地方标准与专项规范
  • 引入问句意图识别(时间性 / 数量性 / 程序性意图),解决相邻条文近似命中
  • 开发微信小程序端,降低一线工友使用门槛
  • 在 1-2 个真实在建项目中进行试点验证,采集真实使用数据回流评测集
  • 建立条文版本跟踪机制(规范修订后自动标记待复核条文)

让安全规范触手可及

本项目由零成本基础设施部署,绑定免费域名 sweetcloud.de5.net

返回顶部 ↑