← 最新论文
💬 NLP

DeonticBench: A Benchmark for Reasoning over Rules

本文提出了 DeonticBench,一个涵盖美国联邦税收、航空行李政策、移民管理及州住房法等真实领域的大规模基准测试,旨在评估大语言模型在长上下文、高风险场景下的义务推理能力,并支持通过自由文本推理或生成可执行 Prolog 程序进行符号化求解。

原作者: Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 DEONTICBENCH 的新工具,它就像是一个专门用来“考试”人工智能(AI)的超级法律与规则模拟器

想象一下,现在的 AI 很聪明,能写诗、能画画,甚至能解数学题。但是,如果你让它扮演一个税务官移民法官或者航空公司客服,去处理那些充满复杂条款、必须严格照章办事的任务时,它往往会“翻车”。

这篇论文就是为了解决这个问题而诞生的。以下是用通俗语言和比喻对这篇论文的解读:

1. 核心问题:AI 是个“聪明的糊涂虫”

现在的 AI 就像是一个博闻强记但缺乏常识的学生

  • 它的强项:能背诵整本《税法》或《移民法》。
  • 它的弱项:当面对一个具体案例(比如“爱丽丝在 2017 年要交多少税?”),它容易胡编乱造(幻觉),或者在简单的逻辑推理上犯错。
  • 后果:在医疗、法律、金融这些高风险领域,AI 犯错的代价太大了。如果 AI 算错了税,或者错误地批准了移民申请,后果不堪设想。

2. 解决方案:DEONTICBENCH(规则推理大考)

作者们(来自约翰斯·霍普金斯大学等机构)制作了一个包含 6,232 道考题 的“题库”。

  • 考什么? 四个真实世界的领域:
    1. 美国联邦税务(像做复杂的数学题,但规则是法律)。
    2. 航空行李政策(比如超重费怎么算,头等舱能带几个包)。
    3. 美国移民管理(判断申请是否被批准)。
    4. 美国州住房法(比如房东能不能赶租客)。
  • 怎么考? 题目不是让 AI 直接猜答案,而是要求它像律师一样思考,或者像程序员一样写代码

3. 两种“解题模式”

这个考试有两种玩法,就像学生做题可以“直接写答案”或者“列公式计算”:

  • 模式一:直接回答(Direct Reasoning)

    • 比喻:就像让 AI 凭直觉和记忆直接回答“爱丽丝要交多少钱?”。
    • 结果:AI 经常因为“想当然”而犯错,或者编造不存在的法律条款。
  • 模式二:写代码解题(Symbolic/Prolog)

    • 比喻:这是论文的亮点。AI 不能直接给答案,它必须先把法律条文翻译成一种叫 Prolog 的编程语言(就像把中文法律翻译成机器能懂的逻辑公式),然后让计算机去运行这段代码算出结果。
    • 好处:如果代码写错了,计算机就会报错,这样我们就能知道 AI 是哪里理解错了,而不是它瞎编了一个数字。这就像让 AI 先写出解题步骤,再算出答案,过程透明可查。

4. 考试结果:AI 表现如何?

作者测试了目前世界上最先进的 AI 模型(包括 GPT-4.1, GPT-5, Claude, Kimi 等),结果令人深思:

  • 成绩一般:即使是顶尖的 AI,在“困难模式”下的正确率也只有 40% 多(甚至有的不到 10%)。
  • 越努力越容易错:有些 AI 被要求“多思考一会儿”(增加推理步骤),结果反而错得更多。
  • 训练也没用:作者尝试用“特训”(微调训练)来教这些 AI,虽然它们写代码的格式变好看了,但依然无法可靠地解决复杂的规则问题

比喻:这就好比给一群天才学生做了一套逻辑陷阱题。他们能背下所有公式,但一旦题目稍微变个花样(比如把“已婚”和“单身”的条件混在一起),他们就会晕头转向,要么算错数,要么直接放弃。

5. 为什么这很重要?

这篇论文告诉我们一个残酷的现实:目前的 AI 还不足以独立处理高风险的法律和规则任务。

  • 信任危机:如果我们把 AI 直接用于法庭判决或税务申报,它可能会因为“幻觉”而制造冤假错案。
  • 未来方向:我们需要开发新的方法,让 AI 不仅能“说话”,还能严格地、可验证地执行逻辑规则。就像给 AI 配一个“逻辑检查员”,确保它每一步推理都有据可依,而不是靠“感觉”在猜。

总结

DEONTICBENCH 就像是一个照妖镜,它揭示了当前最聪明的 AI 在面对死板的规则复杂的现实案例时,依然像个容易犯错的实习生

它提醒我们:在让 AI 真正接管法律、税务等严肃工作之前,我们还有很长的路要走。目前的 AI 更适合做“助手”(提供建议),而不是做“法官”(直接下结论)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →