《Knowledge-Based Systems》:GOFAI meets generative AI: Development of expert systems by means of large language models
编辑推荐:
研究人员介绍了一种以受控且透明的方式使用大语言模型(LLM)开发专家系统的方法。通过限制领域并采用结构化的基于提示的提取协议,将 LLM 的知识蒸馏为符号化 Prolog 表示,该表示可由人类专家检查、验证和纠正,并由确定性推理引擎查询。研究人员沿三个互补维度
研究人员介绍了一种以受控且透明的方式使用大语言模型(LLM)开发专家系统的方法。通过限制领域并采用结构化的基于提示的提取协议,将 LLM 的知识蒸馏为符号化 Prolog 表示,该表示可由人类专家检查、验证和纠正,并由确定性推理引擎查询。研究人员沿三个互补维度评估该方法:首先通过人工专家审计评估事实准确性,并针对人工核查规模有限的问题,通过对 Wikidata 的大规模自动化交叉验证(覆盖 Claude Sonnet 3.7、GPT-4.1 和 Grok 3 三个 LLM 系列)报告 Wilson 置信区间,借助类型感知实体链接器显式分离实体链接错误与事实错误;其次证明所生成知识库在 SWI-Prolog 中支持真正的多跳演绎推理、失败即否定(negation as failure)与聚合,确认其作为可运行专家系统而非静态事实列表的行为;第三分析流水线的统计保证,显式说明 LLM 自回归、非独立生成如何影响集中界与置信区间。结果为一种透明混合方案,结合 LLM 的召回率与符号系统的精确性和可解释性,为敏感领域可信 AI 应用奠定基础。
研究背景与问题提出
自 20 世纪 70 年代 DENDRAL、MYCIN、XCON 等首批专家系统问世以来,基于知识的系统在医学、法律、教育等高 stakes 领域持续推进,但其知识获取长期依赖人类专家与问卷,成本高且难以扩展。2010 年后大语言模型(Large Language Model, LLM)凭借海量参数化知识极大降低了领域知识抽取门槛,但 LLM 存在幻觉(hallucination)——即自信地生成错误或未经验证事实——这一缺陷在需可审计输出的场景中是致命的。LLM 的幻觉源于数据失效、训练局限与生成阶段流畅性优先三类原因,传统缓解方案(外部事实核查、温度扰动、事实分类器)仍难兼顾召回与可解释性。为此,研究人员提出将旧式良好老式人工智能(Good Old-Fashioned AI, GOFAI)的符号主义与生成式 AI 结合:用受控提示将 LLM 蒸馏为 Prolog 规则库,交专家校正后由确定性引擎推理,从而在保留 LLM 广度的同时获得符号系统可验证、可解释、可纠错的特性。该文发表于《Knowledge-Based Systems》。
主要关键技术方法
研究人员构建 Python 驱动流水线:以根概念 T 为输入,设水平广度 h 与垂直深度 d 控制概念图扩展;通过递归提示链向 LLM(Claude Sonnet 3.7、GPT-4.1、Grok 3)请求 JSON 概念-关系,映射至受控谓词词汇(concept/1、related_to/2、implies/2、causes/2 及哲学/文学/历史等领域谓词)并转写 Prolog 事实,附 % Explanation 注释;以 SWI-Prolog 做语法校验。统计上把 LLM 视为概率知识预言机 O(c?,r,c?)=PL("true"|π(c?,r,c?)),用 Hoeffding 不等式与 PAC 框架推精度下界,并按主题分组建模自回归非独立性的设计效应 Deff=1+(n??1)ρ 得到依赖感知 Wilson 区间。验证分三层:25 主题各抽 10 条共 250 条人工核对;510 条事实(三模型各 170)经类型感知实体链接器对齐 Wikidata 做保守核算(仅真实矛盾计错,缺语句不计错);Plato 库上加领域无关规则层测多跳、连接、失败即否定与聚合。
研究结果
4.1 人工专家审计:Claude Sonnet 3.7 在 250 条中错 2 条(Aquinas 年份畸形、伪递归关系),精度 0.992,Wilson 95% 区间 [0.971,0.998],z 检验 p=1.6×10?14 拒 H?:p≤0.80;GPT-4.1 错 1 条,精度 0.996,区间 [0.978,0.999];两比例检验 p=0.56 无差异。
4.2 深度行为与原型可执行性:以 Plato 为根(h=30, d=0..3)概念数与关系数随深度增长,图可视化显露出 theory_of_forms、allegory_of_cave 等凝聚子团;Grok 3 同协议得相似但含 eros_platonic_love 等异质节点。25 个随机主题(含 Jane Austen、Black Death 等)生成的 .pl 文件在 SWI-Prolog 9.2.9 全部 consult 成功并 concept(X),!. 无错返回。
4.3 专家系统推理评估:Plato 库(199 概念、269 related_to)上加规则层,influenced_chain(aristotle,A) 经 cycle-safe 传递闭包推出 aristotle←plato←socrates 等 6 祖先;contested/3 连接 developed_by 与 criticized_by 得 theory_of_forms 被 Aristotle 批评;uncontested/1 用失败即否定筛出 25 条无批评柏拉图观念;aggregate_all(count, main_work(W,plato), N) 得 12 部主要作品。所有答案为确定性可复现分辨率证明。
4.4 大规模 Wikidata 交叉验证:三模型共 510 事实,可检 270 条;原始核实率 Claude 94.4%[86.4,97.8]、GPT-4.1 92.9%[86.0,96.5]、Grok 3 91.1%[83.9,95.2],合并 92.6%[88.8,95.2]。20 条矛盾中 18 条为同名实体误链(Jefferson Davis 1808 vs 1828、Frankenstein 1818 vs 再版),2 条为纪年口径差;链接校正后合并精度 99.3%(三模型分别 100.0%/99.0%/99.0%),与人工审计吻合。
4.5 实体链接隔离:朴素 top-1 链接器 P 69.4/R 78.8/F? 73.8;类型感知链接器按谓词隐含类型(人/著作/地点)重排、instance_of(P31) 校验、Wikipedia sitelink 破 tie,P 82.8/R 94.1/F? 88.1;链接器 relation-agnostic 不偏验证。
4.6 Claude 三档对比:Haiku 4.5/Sonnet 4.6/Opus 4.8 同九主题生成,可验证事实 142/179/211,Wikidata 可检精度 94.4%/91.7%/100.0%,错误全为出版年口径;档位越高覆盖越大且精度不降。
4.7 可扩展性:查询数 Q(h,d)=∑i=0dhi=O(hd);h=30,d=2 约 961 查询~1h~$10.5(GPT-4.1 计价),d≥3 不实用;Memoization 降本 15–25%。
讨论与结论翻译
讨论指出实体链接仍是全自动验证主要瓶颈,未来可接 BLINK/REL 提升覆盖;单专家标注与人文域局限需扩至多标注者协议与医学等技术域;各 LLM 相对信息增益可用话题熵减量化。结论部分译文如下:
本文提出一种混合专家系统构建法,将 LLM 结构化知识抽取与通过 Prolog 符号编码的人类验证相结合,以受控提示限制领域、将抽取信息转写为可逻辑查询形式,从而应对 LLM 幻觉与不可验证性。评估支持三点:抽取知识高精度(人工 250 条审计 Claude 99.2%、GPT-4 99.6%,Wikidata 三族交叉验证在分离实体链接错误后合并 99.3%);生成库为真专家系统(SWI-Prolog 加载、确定执行多跳演绎/失败即否定/聚合);统计保证诚实给出——显式建模自回归非独立并全程报依赖感知区间。该技术为医学、教育、法律等临界场景提供可纠错、可决定论推理、可控透明的符号知识库,弥补纯统计模型缺失属性。局限在于实体链接覆盖、单标注者与人文学科抽样,后续将引入专用链接器、多标注者协议与技术域迁移,并量化各模型对话题熵的边际降低。