← 最新论文
💬 NLP

Explanation Generation for Contradiction Reconciliation with LLMs

该论文提出了“调和性解释生成”新任务,旨在让大语言模型生成能化解矛盾陈述的解释,并通过利用现有 NLI 数据集构建评估体系,发现当前模型在此类推理能力上表现有限且单纯增加计算量收益递减,从而揭示了提升 LLM 在社交及专业领域应用潜力的关键方向。

原作者: Jason Chan, Zhixue Zhao, Robert Gaizauskas

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jason Chan, Zhixue Zhao, Robert Gaizauskas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)出的一道**“高难度情商测试题”**。

通常,我们觉得 AI 很聪明,能写诗、能写代码。但在这项研究中,作者发现 AI 在处理人类思维中一个非常微妙的能力时,表现得还不够好:当面对两个看似矛盾的说法时,AI 能不能想出一个合理的解释,把它们“圆”回来,而不是简单地判其中一个为错?

为了让你更轻松地理解,我们可以用几个生活中的比喻来拆解这篇论文:

1. 核心问题:AI 是“法官”还是“侦探”?

  • 现状(AI 像法官):
    现在的 AI 遇到矛盾时,通常像个铁面无私的法官

    比如:你说“我不喝咖啡”,又说“我每天买咖啡”。
    AI 的常规反应是:“这俩话打架了,肯定有一句是错的,我判你输。”
    它倾向于二选一,直接裁决谁对谁错。

  • 人类的做法(AI 应该像侦探):
    但在现实生活中,我们更像侦探

    面对同样的情况,我们会想:“等等,也许她虽然不爱喝咖啡,但她是给全办公室同事买的?”
    这个“给同事买”的解释,就是调和矛盾的解释。它让两句话同时变得合理。

这篇论文的核心任务就是: 训练并测试 AI,看它能不能从“法官”变成“侦探”,主动生成这种“圆场”的解释。

2. 他们是怎么做的?(把旧玩具玩出新花样)

作者没有重新造轮子,而是很聪明地利用了现有的**“自然语言推理(NLI)数据集”**。

  • 比喻: 想象有一堆以前用来训练 AI 做“判断题”的试卷(比如:A 句推导出 B 句吗?)。以前,如果 AI 觉得 A 和 B 矛盾,就打个叉。
  • 新玩法: 作者把这些“打叉”的题目挑出来,告诉 AI:“别急着打叉!请发挥你的想象力,编一个故事(解释),让 A 和 B 能同时成立。”
  • 巧妙之处: 他们利用了人类标注者对这些题目意见不一的特点。有时候人类也会觉得“好像有点矛盾,但又好像能解释通”。作者把这种“分歧”变成了训练 AI 的素材,而不是把它当作错误数据扔掉。

3. 怎么给 AI 打分?(让 AI 当裁判)

既然要测试 AI 编的故事好不好,谁来打分呢?作者没有找一堆人来读(太慢太贵),而是让 AI 自己当裁判

  • 裁判规则:
    1. 有效性(Effective): 加上你编的解释后,原来的两句话还能同时成立吗?(比如加上“给同事买”,两句话就都通了)。
    2. 连贯性(Coherent): 你编的解释本身,和原来的第一句话矛盾吗?(比如不能编“她其实是个机器人”,因为前提里说她是人)。
  • 结果: 如果裁判 AI 觉得解释通过了这两关,就算成功。

4. 实验结果:AI 的表现如何?

作者测试了 18 种不同的 AI 模型,发现了一些有趣的现象:

  • 大厂模型(闭源)更强: 像 GPT-5 这种闭源的大模型,在这个任务上表现最好,它们更像“老练的侦探”,能想出很巧妙的理由。
  • 开源模型还在努力: 很多开源模型(如 Llama, Qwen 等)虽然能编出解释,但经常编得“前言不搭后语”,或者解释本身就很牵强。
  • 一个反直觉的发现(关于“思考”):
    • 现在的 AI 流行一种“慢思考”模式(先想一步,再回答)。
    • 结果: 对于中等大小的模型,“慢思考”确实有帮助,让它们想得更深。
    • 但是: 对于特别大的模型,或者特别小的模型,“慢思考”反而没用甚至起反作用
    • 比喻: 这就像让一个小学生做数学题,让他“先列草稿再算”可能算得准;但让一个数学天才“先列草稿”,他反而可能因为想太多把自己绕晕了,或者因为太自信而忽略了细节。

5. 为什么这很重要?

这不仅仅是个游戏,它关系到 AI 未来能不能真正帮到人类:

  • 聊天机器人: 如果用户说“我讨厌迟到,但我今天迟到了”,AI 如果只会说“你自相矛盾”,体验会很差。如果 AI 能说“也许是因为路上发生了意外,你其实很着急”,这就更有同理心。
  • 科学发现: 科学史上很多突破(比如光既是波又是粒子),都是因为科学家没有把矛盾当错误,而是去寻找能解释矛盾的“新理论”。AI 如果具备这种能力,可能成为科学家的得力助手。

总结

这篇论文告诉我们:目前的 AI 还很擅长“做判断题”,但在“做阅读理解”和“圆场”这种需要灵活变通、理解潜台词的任务上,还像个刚学会走路的孩子。

作者希望未来的 AI 不仅能分辨对错,更能像人类一样,在充满矛盾和复杂信息的现实世界中,找到那个让万物和谐共存的“第三种解释”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →