← 最新论文
🤖 AI

Neurosymbolic Learning for Inference-Time Argumentation

本文介绍了推理时论证(ITA),这是一种神经符号框架,它整合形式论证语义以训练大语言模型生成和评分论证,从而实现确定性、可信赖的三元主张验证,其性能优于现有基线,同时提供透明且可审查的推理过程。

原作者: Gabriel Freedman, Adam Dejl, Adam Gould, Mansi, Lihu Chen, Jianqi Jiang, Francesca Toni

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Freedman, Adam Dejl, Adam Gould, Mansi, Lihu Chen, Jianqi Jiang, Francesca Toni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名法庭法官,但你的助手不是人类律师,而是一个非常聪明、语速极快的机器人助手。你的工作是判断一个陈述是,还是你信息不足无法判断。

在过去,如果你问这个机器人:“吃胡萝卜能改善夜视能力吗?”它可能会基于其内部记忆脱口而出“真”或“假”。如果它错了,除了说“我就是这么觉得的”之外,它其实无法真正解释为什么会这么认为。

这篇论文介绍了一种训练机器人的新方法,称为推理时论证(Inference-Time Argumentation, ITA)。这相当于教导机器人像一个辩论俱乐部那样运作,而不是像一台 trivia 问答机器。

核心理念:辩论俱乐部

机器人不再猜测答案,而是被训练去:

  1. 生成论证:它列出支持该主张的理由(支持者)和反对该主张的理由(攻击者)。
  2. 评估论证:它为每个论证分配一个“强度分数”(就像秤上的重量)。
  3. 计算裁决:它使用一个特定的数学规则(一个“语义”引擎)来权衡这些论证。
    • 如果“真”的论证足够重,裁决就是
    • 如果“假”的论证更重,裁决就是
    • 如果秤保持平衡或证据薄弱,裁决就是不确定

这篇论文的奇妙之处在于,机器人不仅仅是利用这个辩论俱乐部来解释它的答案;它是在训练过程中学习如何成为一个更好的辩手。

两大核心工具

研究人员构建了一个包含两个主要部分的系统,这两个部分共同学习:

1. 论证生成器(发言者)
这是负责撰写“支持”和“反对”观点的部分。

  • 如何学习:研究人员使用了一种称为强化学习的技术。想象机器人正在玩电子游戏。每当它写出一条有助于最终裁决落在正确一面的好论证,它就能获得“积分”。如果它写出一条导致裁决混乱的坏论证,它就会失去积分。久而久之,它学会了撰写更好、更有帮助的论证。

2. 基础评分模型(法官)
这是负责决定每个论证有多强的部分。

  • 如何学习:在旧系统中,机器人只是猜测论证的强度。在这里,机器人通过观察最终结果来学习如何分配分数。如果机器人给一个薄弱的论证打了高分,并导致最终裁决错误,系统就会说:“嘿,你给那个论证的分数太高了!再试一次。”它学会了校准自己的评分,使最终的辩论合乎逻辑。

为什么“不确定”是一件好事

通常,人工智能会强行给出一个答案。但在现实生活中(例如在医学或金融领域),有时信息就是混乱或缺失的。

  • 类比:想象一名侦探试图破案。如果没有指纹也没有目击者,聪明的侦探会说“我暂时还不知道”,而不是猜测“是管家干的”。
  • 在这篇论文中,“不确定”标签被视为一种有效且诚实的答案。该系统被设计为承认,当辩论不足以支持任何一方时,就应承认这一点。

结果:它奏效了吗?

研究人员将这种新的“辩论俱乐部”机器人与另外两种类型的机器人进行了测试:

  1. 直接猜测者:那些不写论证、直接尝试猜测“真/假/不确定”的机器人。
  2. 旧式辩论机器人:那些会写论证但不懂得如何良好评分的机器人(它们仅使用固定的、未经训练的方法)。

发现

  • 新的ITA 系统(那个学会辩论和评分的系统)表现非常出色。
  • 在某些测试中,它甚至优于“直接猜测者”,这令人印象深刻,因为直接猜测者的任务更简单(只需猜测答案)。
  • 最重要的是,ITA 系统提供了可信的解释。因为最终答案是根据它撰写的论证通过数学计算得出的,你可以查看辩论过程,确切地看到为什么它做出了那个决定。它不仅仅是说“我认为这是真的”;它展示了天平如何向“真”倾斜。

总结

这篇论文提出了一种使人工智能更加诚实和透明的方法。它不再是一个吐出答案的“黑盒”,而是构建了一个“玻璃盒”,你可以看到论证、看到它们如何被加权,并见证数学如何决定裁决。它教导人工智能,有时最正确的答案就是承认:“证据过于混杂,无法做出决定。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →