PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails
PL-Guard 是一种神经符号护栏架构,它通过使用本地大语言模型提取谓词概率并利用 ProbLog 进行显式概率推理,将语义落地与策略推理分离,从而在显著降低 XSTest 基准测试中不安全合规性的同时,增加了过度拒绝率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个人工智能扮演着得力伙伴的世界,它随时准备回答问题、讲述故事并解决问题。但像任何强大的工具一样,它也带有风险。如果任其发展而不加约束,这些系统可能会在无意中提供危险的指令,或者相反,变得过于谨慎,以至于拒绝回答无害的问题。开发者的挑战在于构建一种安全机制——即一道“护栏”——使其能够分辨出什么是无害的教育性查询,什么是真正的有害请求。这并非易事,因为语言充满了陷阱。一个句子可能因为使用了“爆炸”或“偷窃”之类的词汇而听起来很危险,但在特定的语境下,例如在历史课或小说故事中,它是完全安全的。相反,一个有害的请求可能会通过礼貌且间接的方式进行表达,从而隐藏其真实意图。目前的方法往往难以处理这种细微差别,有时无法阻止真正的危险,有时又会不必要地阻断有益的对话。
来自阿姆斯特丹大学和乌得勒支大学的一个研究小组提出了一种处理此问题的新方法,并在一篇题为“PL-Guard”的论文中进行了描述。他们并没有要求单个人工智能模型同时完成所有工作——理解词汇、判断意图并决定结果——而是将这项工作拆分为两个截然不同的部分。他们称之为“神经符号”(neurosymbolic)方法,简单来说,就是将神经网络灵活、直觉式的理解能力与符号系统严格、逻辑性的规则相结合。研究人员发现,通过分离这些角色,他们可以使安全系统更加透明,并且在防止有害行为方面更加有效,即便这意味着要对无害的请求表现得稍微谨慎一些。
在他们的新系统中,流程始于用户发送提示词以及人工智能生成响应。第一个人工智能模型充当“法官”,它并不编写长篇解释或判决。相反,它会针对交互过程中的特定预定义问题进行观察,例如“用户是否在询问有害内容?”或“这段对话的语境是否无害?”对于每个问题,该模型都会计算一个概率得分,本质上是该陈述为真的百分比概率。这些得分随后被传递给第二个完全不同的系统,该系统像一本逻辑规则书一样运行。这本规则书使用一种名为 ProbLog 的语言编写,包含了如何组合这些概率的明确指令。例如,规则可能会规定:如果有害请求的可能性很高,且有害响应的可能性也很高,则系统应当拦截该答案。然而,如果请求很可能是无害的,但人工智能拒绝了回答,系统可能会决定让答案通过。第二步纯粹是逻辑性的;它接收来自第一个人工智能的不确定猜测,并应用严格的政策规则,从而产生关于是保留答案、修改答案还是完全拦截答案的最终建议。
研究人员使用一组旨在欺骗安全过滤器的 450 个标准示例,对这种新方法进行了测试。这些示例既包括经常被误拦的无害提示,也包括经常能溜进系统的有害提示。他们将新系统与几种模型进行了对比:一个没有任何护栏的基础模型、一个仅阅读纯英文规则集的系统,以及一个由一个 AI 充当法官来审查另一个 AI 工作的系统。结果显示出明显的权衡。新系统在阻止有害行为方面表现异常出色,将不安全合规率从基础模型的 22% 降低到了仅 0.5%。这优于基于法官的系统,后者仍允许 6% 的不安全响应通过。然而,这种额外的谨慎也带来了代价:新系统拒绝回答无害问题的频率高于基于法官的系统,其过度拒绝率(over-refusal rate)为 14.4%,而后者为 5.2%。
研究人员认为这种权衡是可以接受的,因为两类错误的后果并不相等。允许有害响应可能会造成现实世界的破坏,而拒绝一个无害请求仅仅是让用户感到困扰。通过使决策过程可视化,新系统允许开发者看到究竟是什么导致了某种选择。他们可以通过查看概率得分和逻辑规则,来理解系统是过于严格了,还是漏掉了某种微妙的危险。这种透明度是当前方法的关键优势,在当前方法中,推理过程往往隐藏在单个复杂且难以检查或修复的模型内部。研究表明,虽然没有完美的系统,但将理解语言的行为与应用规则的行为分离,可以创造出一个既可靠又易于审计的安全网。研究人员发现,增加规则的细节可以在一定程度上提高系统的性能,但添加过多细节最终并不会带来帮助,这表明这些安全规则的复杂程度存在一个“甜点区”(sweet spot)。
最终,这项工作证明了我们不必依赖单一、不透明的智能来确保人工智能的安全。通过将问题分解为更小、更易管理的步骤——首先估计事实,然后将逻辑规则应用于这些事实——开发者可以创建既有效又可理解的护栏。该系统并未消除“安全性”与“帮助性”之间难以抉择的矛盾,但它将这些抉择带入了光亮之下,允许人类看到每一个决策背后的推理,并根据需要调整规则。这种方法为构建不仅安全而且值得信赖的人工智能系统提供了一条充满前景的路径,因为它们的逻辑可以被使用它们的人所检查和理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。