← 最新论文
💬 NLP

DAR: Deontic Reasoning with Agentic Harnesses

本文介绍了规范性代理推理(Deontic Agentic Reasoning, DAR),这是一种使大语言模型能够根据需求与法规进行交互,从而提高其在复杂规范性推理任务上表现的代理框架,尽管文中指出这些益处并不均匀,并且可能导致较弱模型的数值性能下降及 Token 消耗增加。

原作者: Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangyao Dou, William Jurayj, Nils Holzenberger, Benjamin Van Durme

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探,但你唯一的线索是一本由晦涩法律术语编写的、长达 1,000 页的巨型规则手册。你的任务是找到适用于特定人物情况的具体规则,并计算出结果。

这篇论文旨在测试不同的“侦探”(AI 模型)在被允许使用一套特殊工具集与被直接交给整本书进行对比时,解决这些谜题的能力如何。

两种解谜方式

研究人员比较了两种不同的方法:

  1. “大堆叠”法(直接推理): 想象一下,把整本 1,000 页的书、案件事实和问题一次性全部交给侦探。侦探必须在脑海中阅读整个文本,找到正确的页面,然后立即写出答案。
  2. “搜索与挖掘”法(规范性代理推理或 DAR): 与其把整本书交给侦探,不如把书放在房间的一个书架上,并给他们一套工具(比如放大镜、搜索引擎和计算器)。侦探必须走到书架前,利用工具找到他们需要的那一页,阅读它,然后回来写下答案。他们可以根据需要这样做多次。

重大发现:这取决于你在问谁

研究人员针对两类侦探进行了测试:“超级天才”(顶尖、昂贵的 AI 模型)和**“学徒”**(较小的、开源的 AI 模型)。

1. 超级天才表现出色
当超级天才被允许使用“搜索与挖掘”工具时,他们解决谜题的能力大幅提升。

  • 原因: 他们足够聪明,知道该寻找什么。他们可以对自己说:“我需要找到关于税收抵免的部分”,然后使用 grep 工具直接跳转到那里,并忽略其余部分。
  • 结果: 他们的准确率显著提高(有时提升了 15–30%)。他们高效地使用工具来查找正确的规则并正确计算出答案。

2. 学徒陷入困境(甚至表现更差)
当学徒获得同样的工具时,他们的表现实际上比直接拿到整本书时还要

  • 原因: 他们被这种自由搞糊涂了。他们没有在找到线索后停止,而是不断挖掘,阅读无关的页面,并陷入死循环。他们花费了大量的“精力”(计算资源),自信满满地写出冗长且错误的答案。
  • 结果: 他们的准确率剧烈下降(有时甚至降至接近于零)。他们消耗了高达 4 倍的计算机资源,却只得到了一个更糟的答案。

“信心放大器”的比喻

论文指出,对于较弱的模型,这些工具起到了**“信心放大器”**的作用。

  • 想象一个不知道数学题答案的学生。如果他们只需要写下答案,他们可能会猜测并继续下一步。
  • 但如果你给他们一个计算器和一本教科书,并对他们说:“去找到答案。”他们可能会开始疯狂地翻页,进行随机的计算,并说服自己是对的,尽管他们其实是错的。工具让他们觉得自己在努力工作,但实际上他们只是在原地打转。

出错的代价

论文强调了一个主要的成本问题。

  • 超级天才非常高效。他们利用工具快速找到了正确答案。
  • 学徒则非常浪费。他们利用工具生成了大量的文本,在没有提高准确率的情况下白白消耗了计算机资源(Token)。在某些情况下,他们在完成思考之前就耗尽了时间。

总结

论文得出结论:给 AI 一个用于查找规则的“工具箱”并不是对所有人都有魔力的。

  • 如果 AI 本身已经非常聪明,工具箱能让它大放异彩。
  • 如果 AI 还在学习阶段,工具箱反而可能让它变得过度自信、浪费资源且准确性降低。

研究人员警告说,我们不应假设给 AI 更多工具会自动让它在处理像税法或移民规则这类复杂任务时变得更好。对于较弱的模型,这可能只会让它们变得更昂贵,并且更容易犯下自信满满的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →