Policy-as-logic for robust reasoning over rules
本文介绍了一种结合了用于事实提取的语言模型与用于逻辑推理的答案集求解器的混合符号方法,以确保人工智能响应符合书面政策,从而在显著降低现有方法令牌使用量的同时,实现了更高的准确性、可解释性和鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个非常聪明、但有点丢三落四的机器人如何遵守规则手册。这个机器人是一个大语言模型(LLM),它是某种类型的人工智能,擅长理解故事、笑话和人类对话。它可以读完一部千页的小说,并能准确告诉你角色当时的感受。然而,当你要求这个机器人进行严格的数学计算或遵循一套死板的“如果-那么”规则时——比如计算税款或判断行李是否超重——它有时会感到困惑。它可能会被一个有趣的词分了心,或者如果你改变了规则的顺序,它可能会给出完全不同的答案。对于航空、税务局或医院等现实世界的职业来说,这是一个问题,因为在这些领域,决策必须是完美、公平且一致的,无论你如何提问。
为了解决这个问题,科学家们正在将两种不同的思维方式结合起来。一种是 AI 的“创意型”大脑,它擅长阅读混乱的人类语言;另一种是“逻辑型”大脑,一个严格的计算机程序,它就像一个超级精确的计算器,或者一个永远不会疲倦或产生情绪的法官。研究人员提出的核心问题是:我们能否让这个具有创意的 AI 去阅读规则和混乱的问题,然后将实际的决策权交给那个严格的逻辑大脑?这篇论文探讨了正是这样一个想法,测试了将工作拆分为一个“创意阅读者”和一个“严格逻辑机器”是否能造就一个更聪明、更可靠的决策者。
“翻译官与法官”的方法
这项研究背后的研究人员 Rahul Nair、Bastian Lipka 和 Elizabeth Daly 提出了一种处理政策规则的高明新方法,他们称之为 Policy-as-Logic(逻辑即政策)。把它想象成一个两人小组:一个翻译官和一个法官。
在旧的方法中(他们称之为“Policy-as-Prompt”,即提示词即政策),你会直接把整个规则手册和用户的问题一股脑儿塞进 AI 的大脑里,然后祈祷它能搞定。这就像是要求一个才华横溢但注意力不集中的学生,在读小说的时候同时解一道复杂的数学题。有时他们能做对,但如果问题的措辞稍有变化,他们可能就会感到困惑并给出错误的答案。
新的“Policy-as-Logic”方法将工作进行了拆分:
- 翻译官(AI): 首先,AI 阅读用户的自然语言问题(例如“我有一个 20 公斤的包,我坐的是经济舱”)。它现在还不尝试解决问题。相反,它扮演一个翻译官的角色,将那句话转化为一份整洁、结构化的事实列表,就像一个 JSON 文件。它提取出重要的数字和类别,忽略掉那些废话。
- 法官(逻辑求解器): 一旦事实被提取出来,它们就会被移交给一个严格的逻辑引擎(具体来说是一个答案集求解器,Answer Set Solver)。这个引擎不在乎情感或文字游戏;它只关注硬性的事实和书面规则。它运行一次计算,以查看规则是否允许该行为。
- 判决: 逻辑引擎会给出一个明确的“是”或“否”,然后这个结果会被转化回人类易于理解的回答。
他们的发现:“鲁棒性”的胜利
团队在四个不同的现实场景中测试了这种方法:航空公司行李费、个人所得税计算、NBA 球员薪资规则以及 HR 内容审核(决定职场环境是否安全)。
结果显示,在处理硬性事实的世界时,“翻译官与法官”组合取得了巨大的成功。
- 准确性: 在航空公司和税务领域(其规则基于硬性数字,如重量和金额),他们的新方法几乎是完美的,得分在 0.94 到 1.00 之间。相比之下,旧的“Policy-as-Prompt”方法(直接询问 AI)表现挣扎,得分经常低于 0.40。即使是他们测试的最小的 AI 模型,在使用这种新流水线时,准确率也从 0.01 跳升到了 0.61。
- 鲁棒性(压力测试): 这是最令人兴奋的部分。研究人员尝试通过一些愚蠢的方式来误导系统——比如让语气变得欢快、沮丧,或者添加干扰性的细节。旧的 AI 方法崩溃了;当措辞发生变化时,它们在税务问题上的准确率降至 0.00。但“Policy-as-Logic”方法保持强劲,因为它保持了高准确率,因为逻辑求解器不会被语气所干扰。这就像一位法官,他会忽略律师是在大喊大叫还是在低声细语,而只看证据。
- 效率: 新方法运行起来也更便宜。因为 AI 只需要阅读一个小的“schema”(一个关于寻找目标的模板),而不是每次都阅读整个规则手册,所以它使用的 token(AI 处理文本的单位)减少了约 10 倍。例如,在航空公司问题上,旧方法使用了超过 11,000 个 token,而新方法仅使用了 1,175 个。
缺陷:当规则变得“模糊”时
然而,论文也发现了这种超能力的局限性。当他们在 HR 内容审核(规则具有主观性,例如“这条信息是否有害?”)进行测试时,新方法并没有提供太大的优势。在这些情况下,规则依赖于人类的信念和解释,而非硬性的数学。由于 AI 仍然需要进行最初的判断来提取事实,且逻辑求解器无法比 AI 更好地“思考”情感,因此两种方法的表现大致相同(约为 0.93 到 0.96 的准确率)。
作者认为,这证明了他们的观点:Policy-as-Logic 是处理客观、基于知识的规则(如数学和物理)的绝佳工具,但它并不能神奇地解决规则本身模糊或依赖人类观点的问题。
底线结论
这篇论文表明,对于我们世界中最关键的、基于规则的决策,我们不应该仅仅依赖单一的 AI 来完成所有工作。相反,我们应该让 AI 担任理解我们混乱语言的翻译官,然后将控制权交给严格的逻辑机器来做出最终裁决。只要遵循的规则是清晰且客观的,这种结合会让决策更加准确、更难被误导,并且运行成本显著降低。这提醒我们,有时候,AI 最聪明的事情就是知道何时停止猜测,开始计算。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。