从「知识组织、检索、生成、校验、复核」五个环节层层把关,让回答「有据可查、可追溯验证」,且答不出时敢说不知道。
97 条规范条文按「工程类别 → 风险类型 → 规范依据 → 条款要点」组织成图谱结构,每条含条款原文、条款解读、关联条款、注意事项与检索路径,覆盖 13 大类施工安全领域。
关键词加权 + 工程主体名词对齐,按标题、图谱路径、条款内容逐层定位。刻意不使用向量相似度检索——安全领域里「语义相近但条款号搞错」不可接受。命中哪一条、为什么命中,全程可解释、可复算。
检索到的条文是喂给大模型的唯一上下文,并要求按 JSON Schema 输出。服务端逐字段校验,未通过则重试一次,仍不通过就丢弃模型输出、直接回落条文原文——未经校验的模型输出永远不会出现在界面上。
领域内未收录的问题明确拒答,不给未经规范支撑的结论;涉及危大工程、深基坑、起重吊装、有限空间等 49 条高风险条文,答复强制附加「须经项目技术负责人复核」提示。
每条回答都给出置信度评分(由检索得分换算,高 / 中 / 低三档)。低置信度自动转人工复核,不把单薄匹配当结论。风险高低与置信度高低是两个维度——高风险 + 低置信度是最危险组合,系统会双重提示。
面向施工现场真实需求,让安全规范「问得到、审得准、学得会」。
输入施工安全问题,系统在 97 条规范条文中确定性定位依据,返回结构化回答:规范条款 + 解读 + 关联条款 + 注意事项,并附带检索路径。
已完成并线上运行属于施工安全领域但知识库未收录的问题,系统明确回答「未收录、不给未经验证的结论」,而不是编一个似是而非的条款号。166 条评测集中 18 条拒答用例全部通过(100%)。
已完成并线上运行涉及危大工程、深基坑、起重吊装、有限空间等 49 条高风险条文,答复强制附加「须经项目技术负责人复核」提示——AI 不越权替人做施工决策。
已完成并线上运行粘贴专项施工方案正文,系统按 12 项必备内容(其中 9 项为法定必备)逐项核对覆盖情况,输出完整度评分、缺失项清单与补齐建议,并自动判定危大工程是否需专家论证。
已完成并线上运行面向建筑施工场景定制,引入人机协同机制保障知识准确性。
知识库已结构化 97 条条文,源自 40 部国家标准与行业标准(GB / GB/T / JGJ 系列)及 3 部法规与规范性文件(住建部令第 37 号、国务院令第 493 号、建办质〔2018〕31 号),按工程类别组织为可检索的结构。
大模型把规范原文改写成「条款原文 / 解读 / 关联条款 / 注意事项」四字段结构,已入库 97 条
构建脚本校验字段完整性与标题唯一性;193 项检索回归测试 + 166 条评测集,自动拦截误召回与幻觉
危大工程阈值已按建办质〔2018〕31 号原文逐条核对;章节级引用不补写条款号,专业复核持续进行
聚焦具体岗位与真实人群,不写「面向全体建筑从业者」这类宽泛定义。
施工现场专职安全员、专业工长、项目技术负责人。他们要天天核规范,但不是法规检索专职岗,手边没有法规数据库。
班前安全交底、工序验收前查依据、隐患整改定整改方向、专项施工方案编制前核对条文。
习惯口语提问、不写长句、现场不便打字;对「AI 答得对不对」没有辨别手段——所以系统必须能主动说「不知道」,而不是编一条听着合理的条款。
不做「效率低、体验差」这类模糊描述,四个维度逐项落到可核对的依据上。
每个工序、每次验收与整改前都要核一次规范依据,属日常高频动作,不是偶发需求。
本系统收录的 97 条条文分散在 40 部标准 + 3 部规范性文件,共 43 个编号中。人工要定位一条,需在多份 PDF / 纸质规范间反复跳转比对。
依据引错(条款号记错、或被模型编造)→ 整改方向错、返工,严重时形成监管整改单。安全领域里「错得理直气壮」比「答不出」危险得多。
① 纸质 / PDF 规范:检索慢、无跨规范关联、无版本一致性保障;② 通用大模型问答:实测会顺着伪造的规范编号往下答(见下方实测证据)。
tools/probe-online.mjs)用一条不存在的《JGJ 999-2099 建筑施工宇宙安全规范》提问,通用大模型倾向顺着编造条款内容;本系统实测识别该编号不存在并明确拒答。检索准确率、拒答率、置信度分档均可由 node tools/eval.mjs 与 node tools/conf-stats.mjs 复算。尚未开展真实项目访谈式调研,「频率 / 耗时」为公开常识性判断,量化口径待试点校正。
下表为真实进度,可逐项核对;已完成项均可现场演示与复算。当前整体完成度约 83%。
输入施工安全问题,系统先检索知识图谱定位条文,再生成「规范条款 + 解读 + 关联条款 + 注意事项」四段式解答。已收录 97 条现行规范条文(源自 40 部国家标准与行业标准 + 3 部规范性文件),覆盖危大工程管理、基坑土方、模板支撑、脚手架、高处作业、临时用电、起重吊装、消防动火、有限空间等 13 大类。知识库未收录的领域问题会明确告知而非编造;打招呼、问身份等一般问题走通用对话;高风险主题强制提示人工复核。点击下方示例直接体验 ↓
回答由后端 确定性检索 定位规范条文,再由 大模型在条文约束下生成,输出经 JSON Schema 校验后才会展示 —— 校验不通过则丢弃模型输出、回落条文原文。领域内未收录的问题明确拒答,一般问题走通用对话并标注未引用规范。高风险主题或低置信度的回答,都会强制挂出「需人工复核」提示并说明判定依据。
把专项施工方案的正文粘贴进来,系统按 12 项必备内容(其中 9 项为法定必备)逐项核对覆盖情况,给出完整度评分、缺失项清单与补齐建议;涉及危大工程时自动提示是否需要专家论证。规则取自 住建部令第 37 号 与 建办质〔2018〕31 号,判定过程为确定性文本覆盖检测,可解释、可复核。
自检结果将显示在这里:完整度评分 · 逐项覆盖情况 · 缺失项与建议。
我们为系统建立了 166 条评测集,并把「好不好用」拆成五个可量化维度。评测脚本直接 import 部署产物本身(而非另写一份近似实现),因此本地跑出的数字与线上真实行为一致,任何人按同一条命令都能复现。
node tools/build.mjs
node tools/eval.mjs
评测直接引用即将部署的 functions/api/chat.js 导出的检索与分类函数,并打印产物 sha256 指纹,确保「评测的数字」与「线上跑的行为」指向同一次构建。
未通过的 1 例已记录在案:问「混凝土浇筑完多久可以拆模」,系统命中「高大模板混凝土浇筑安全」而非「模板拆除条件与顺序」——属于相邻条文近似命中,改进方向是引入问句意图动词识别(时间性意图 → 归入拆模条件)。我们不隐藏失败用例。
施工安全是敏感场景,因此把数据边界与责任边界写在明面上,而不是等评审来问。
问答请求不采集、不落库用户身份与项目信息,仅将问题文本传给模型用于本次生成;无账号体系,因此没有用户数据可泄露。
规范知识库已内嵌进前端页面,断网或模型不可用时仍可检索条文原文、演示不中断。敏感项目可整体私有化部署,不依赖外部模型接口。
未经 JSON Schema 校验的模型输出一律不上屏;答不出就拒答;高风险与低置信度强制转人工复核,不让 AI 直接产生作业指令。
检索得分、命中关键词、风险判定、置信度分档、schema 校验次数全部随响应返回并可复算;评测脚本打印产物 sha256 指纹,构建与线上行为一一对应。
两个典型场景,展示系统的实际问答效果。
人机协同,各司其职。