Knowledge-Constrained Reasoner: Attempting to Enable LLMs to Parse Knowledge for Question Answering
本文介绍了知识约束推理器(Knowledge-Constrained Reasoner),这是一种通过单一对齐阶段将核心推理能力内化到大语言模型中的新颖方法,从而确保在问答过程中能够严谨且正确地利用外部知识,并将传统专家系统的可靠性与非参数化连续学习的灵活性结合在一起。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个聪明、反应极快的机器人如何破解谜题。你有两种主要的方法可以做到这一点。第一种方法就像是在机器人的大脑里植入一本厚重的百科全书:这种早期的“专家系统”极其严谨,能完美地遵循规则,但也非常僵化。如果询问它书中没有的内容,它就会陷入停滞。如果你想更新规则,就必须重写整本书,这既缓慢又昂贵。
第二种方法是今天我们使用现代 AI 的方式,比如你可能会与之交谈的聊天机器人。这些模型就像是“超级读者”,它们吞噬了整个互联网。它们灵活、幽默,且擅长对话。但它们有一个棘手的缺陷:它们有时会忘记刚刚学到的东西,或者当你交给它们一条新规则并要求它们严格执行时,它们会感到困惑。它们可能会根据自己“认为”正确的事实来猜测答案,而不是根据新规则“实际”所说的内容来回答。如果你的应用场景需要机器人扮演医生、飞行员或安全检查员,且必须严格遵守规则,那么这便是一个大问题。
这引出了一个名为“检索增强生成”(RAG)的新概念。把这想象成给机器人一张图书馆借书证。当你提问时,机器人在回答之前会迅速从图书馆中抓取相关的页面并阅读。这种方法比瞎猜要好,但机器人仍然需要决定“如何”去阅读那一页。有时它会忽略细则,有时它会漏掉步骤,有时它会表现得过于聪明,从而凭空捏造出一条并不存在的规则。科学家们正在探讨的核心问题是:我们能否教会机器人不仅仅是“阅读”图书馆,而是成为一名能够完美遵循规则的逻辑大师,而无需重写它自己的大脑?
知识约束推理器:教会 AI 成为规则的追随者
在这篇论文中,研究员 Zhiqiang Gan 试图通过构建一个被称为“知识约束推理器”(Knowledge-Constrained Reasoner)的模型来回答这个问题。其目标是将标准的语言大模型(LLM)转变为一个严谨、逻辑缜密的侦探,使其能够接收一套全新的规则(例如新的医疗方案或军事指令),并严格按照字面意思执行,而不产生困惑或捏造事实。
论文指出,与其试图将新事实强行塞进 AI 的记忆中(这会导致它遗忘旧知识),我们应该在一次性的训练任务中教会 AI 一套“元技能”或“超能力”。这就像训练一只狗。你不需要教这只狗应对世界上每一种可能情况的具体指令。相反,你要教它“倾听”的概念、“寻找零食”的概念以及“等待信号”的概念。一旦狗掌握了这些概念,你就可以给它一个新指令,即使它从未听过这个特定指令,它也能理解如何去执行。
五大超能力
为了让 AI 成为优秀的规则追随者,研究员利用包含虚构医生、士兵和工厂工人的 1,000 个模拟场景数据集,训练了它四种特定的逻辑“招式”(外加一种额外的招式)。以下是这些招式的简单解释:
情境语境化(“这与我有关吗?”检查):
在行动之前,AI 必须检查规则是否确实适用于当前情况。- 类比: 想象一个夜店保安。如果规则规定“禁止穿鞋入内”,而你穿着袜子走进来,保安必须判断:“袜子算不算鞋子?”
- 研究发现: AI 被训练去检查用户的处境是否与规则的条件完全匹配。它学会了如果规则针对的是“严重”事故而用户遭遇的是“轻微”事故时,应当回答“不适用”,从而防止误用错误的规则。它还学会了在无法给出答案时承认自己不知道,而不是为患者编造虚假的药物。
前向因果演绎(“如果 A,那么 B”的链条):
这是经典的逻辑:如果 A 发生,那么 B 必然发生。- 类比: 就像多米诺骨牌效应。如果你推倒第一块骨牌(患者发烧了),下一块就会倒下(给药)。
- 研究发现: AI 学会了观察情境、找到匹配的规则,并立即跳转到正确的行动。
后向因果溯源(“为什么会发生?”侦探工作):
有时你会看到结果,但需要寻找原因。- 类比: 你走进房间,看到花瓶碎在地上。你必须查阅家规来推断:“谁被允许在这个房间里,他们在做什么?”
- 研究发现: AI 可以观察一个结果(如“机器人手臂断电了”)并将其追溯到那条规则——“如果反应堆过热,则切断电源”。它成功地推断出原因是过热。
逻辑组合(“完成所有事项”清单):
现实生活是复杂的。有时一个情境会同时触发多个规则。- 类比: 想象一个游戏角色,当他受到攻击时,必须“失去生命值”且“掉落金币”。如果游戏只让他掉落金币,那就是一个 Bug。
- 研究发现: AI 学会了处理复杂规则,即一个情境需要同时进行诊断、隔离步骤以及向当局报告。它不再跳过步骤,而是开始执行完整的清单。
过滤(“只取事实”过滤器):
有时一条规则有一长串步骤,但你只需要其中的第一步。- 类比: 食谱说“预热烤箱、切洋葱、煎培根,然后上菜”。如果你问“我首先要做什么?”,AI 不应该把整个食谱都倒给你,它应该只说“预热烤箱”。
- 研究发现: AI 学会了忽略多余的噪音,仅提供用户要求的特定步骤。
结果:奏效了吗?
研究员将这种新的“推理器”与使用 AI 的标准方式(即不经过特殊训练直接提问)进行了对比测试。
- 标准方式: 当被要求遵循复杂规则时,常规 AI 的正确率约为 75%。它经常感到困惑、跳过步骤或直接放弃。
- 新方式: 经过单次训练后,“知识约束推理器”的正确率达到了约 88%。
论文指出,这种提升是真实且显著的。即使规则是关于“泰坦机甲”或“虚构金融”等虚构话题,AI 在遵循给定规则方面也表现得更出色。
局限性(以及它在哪里跌倒了)
必须指出的是,这篇论文并没有证明 AI 已经变得完美。论文明确指出,AI 在大约 12% 的案例中仍会犯错。
- 混淆: 有时 AI 会将规则的“结果”与应采取的“行动”搞混。例如,如果规则说“如果黑客入侵,市场将会崩盘”,而用户问“我们该怎么做?”,AI 有时只会回答“市场将会崩盘”,而不是说“我们应该锁门”。
- 精度差距: AI 有时会忽略微小的细节,比如将“轻微”问题与“严重”问题混淆,从而导致使用错误的应急预案。
论文认为,仅仅通过提供几个例子(即“提示工程/Prompting”)的方法不足以解决这些深层的逻辑错误。AI 需要进行“微调”(Fine-tuning)——本质上,它需要反复练习这些逻辑招式,直到它们成为一种习惯,而不仅仅是基于一些提示进行猜测。
大局观
这项研究的核心结论是:我们或许可以通过教授 AI 如何“运用规则进行思考”,而非仅仅“记忆规则本身”,从而构建出既具有人类般的灵活性,又具有计算机程序般的可靠性的 AI。研究员建议,如果我们能教会 AI 将其逻辑“锚定”在外部信息上,它就能在不遗忘旧知识的前提下,瞬间学习新知识。
然而,论文谨慎地表示,这仅是一个“初步尝试”和“初步证据”。这是一个非常有前景的步骤,旨在弥合传统专家系统的僵化安全性与现代 AI 的灵活创造力之间的鸿沟。它表明,通过适当的训练,AI 可以成为更好的规则追随者,但它尚未达到可以取代高风险领域人类专家的程度。通往真正可靠、不会遗忘的 AI 之路仍在继续,而这个新的“推理器”为未来的路径提供了一份新鲜的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。