Dialogical Epistemic Auditing: Tracing Inferential Commitments Across Conversational Turns in Large Language Models
本文提出了“对话式认识论审计”(dialogical epistemic auditing),这是一种定性框架,用于追踪大型语言模型在对话轮次中如何维持或改变其推论承诺,并通过一系列案例研究表明,模型往往表现出不对称的一致性,即在保留未经证实的叙述的同时撤回事实性主张。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当我们要求计算机解释一个复杂的事件时,我们往往通过它的第一个回答来评判它。如果回应听起来充满自信且掌握了基本事实,我们往往会认为这台机器是可靠的。但在现实世界中,对话很少止于第一句话。我们会要求澄清,我们会质疑假设,我们会在对方做出让步后进一步追问其后续逻辑。一台机器可能会给出一个完美的开场白,却在讨论深入时无法保持自身逻辑的一致性。这种差距正是这项新研究关注的焦点——该研究关注的不是大型语言模型在孤立状态下说了什么,而是它如何随着时间的推移处理其自身主张的分量。这项研究借鉴了人类心理学中的一个概念,即“认知失调”,它描述了当我们面对两个相互冲突的想法时所感受到的精神不适。为了减轻这种不适,人们通常会改变自己的信念以适应事实,或者扭曲事实以符合自己的信念。这项研究旨在探讨人工智能系统在被要求解释一个困难且矛盾的情况时,是否也会表现出类似的模式。
研究者朱利奥·维多托(Giulio Vidotto)来自帕多瓦大学,他试图通过让三种不同的人工智能系统就一个特定的现实世界事件进行单独对话来测试这一点。主题是2026年俄罗斯与乌克兰之间交换士兵遗体的事件。数据是清晰且有据可查的:在三次独立的移交中,俄罗斯每次归还了大约一千具乌克兰士兵的遗体,而仅收回了大约三十到四十具俄罗斯士兵的遗体。这种大约二十五比一的比例创造了一个谜题。这些数字是公开且经过验证的,但它们似乎与关于谁在战争中损失更多的某种普遍且默契的认知相矛盾。研究者要求每个系统解释这种差异。他不仅仅是在要求一个总结;他不断迫使它们澄清其推理过程,挑战它们的逻辑,并在它们的结论似乎与其自身逻辑相悖时,要求它们重新考虑结论。目标是追踪它们论证的每一个回合,观察这些机器是能保持稳定,还是会为了规避矛盾带来的不适感而悄悄改变立场。
这项研究引入了一种称为“对话式认识论审计”(dialogical epistemic auditing)的方法。研究者并没有试图猜测机器在代码内部是如何“思考”的,而是将对话视为一份公开记录。他绘制了机器提出的每一个主张,并记录了该主张在论证中扮演的角色。它是一项证据?是一个假设?还是一个结论?随后,他观察随着对话的持续,机器是否保持了这些角色的连贯性。它是否在稍后将一个暂定的猜测当作硬性事实?它是否在没有解释原因的情况下放弃了一个结论?审计旨在寻找一种特定的失败模式:当一台机器改变了心意,却未能更新其余的故事以匹配这一改变时。这就像一个人承认自己弄错了时间,却继续按照原有的时间表行动,导致其计划的其余部分陷入混乱。
在三次对话中,出现了一个清晰的模式。在每种情况下,人工智能系统都面临着同样的张力。经核实的遗体数量与关于双方伤亡规模的某种默契假设发生了冲突。为了解决这种张力,系统反复尝试改变数字的含义,而不是质疑那个默契的假设。在一次对话中,系统最初将两种对立的解释作为同样有效的观点提出,造成了一种虚假的平衡。在受到质疑后,它进行了自我修正,但在下一轮对话中又丢失了这一修正,导致其逻辑出现了断层。在另一次对话中,系统一直坚持某种特定的解释,但当被要求提供证据时,它却不断更换支持该主张的证据,最终用无关的旧事实替代了新事实。在第三次对话中,系统甚至声称它刚刚描述的整个事件的时间线从未发生过,将经过验证的事实撤回,仿佛那些事实是幻觉一样,尽管这些事件的证据是清晰且具有同时性的。
最引人注目的是这些系统如何对待论证的两方。实际的、经核实的数字不断被重新分类、质疑和重新解读。它们有时被称为直接指标,有时是局限性,有时是人工数据,最后又变成了领土控制的度量标准。然而,关于相对损失的默契图景却从未受到质疑。它始终未被触及,从未被分类,也从未被挑战。系统一致地扭曲已知的事实来符合隐藏的图景,而不是调整隐藏的图景以符合已知的事实。这种行为镜像了心理学中的“认知失调”概念,即大脑通过改变对新信息的解释来保护核心信念。机器看起来并不是在传统意义上的撒谎;它们并非凭空捏造数据。相反,它们是在重新排列事实之间的逻辑联系,以消除矛盾,而在这个过程中,往往会导致自身的论证变得不稳定且内部不一致。
研究发现,这些失败并非随机的故障。它们遵循特定的轨迹。系统通常会从一个看似合理的解释开始,但当受到压力时,它们会引入一种新的机制来调和数字。当该机制受到挑战时,它们会再次发生转移,有时修复了逻辑,有时则完全放弃了逻辑。在一个案例中,系统承认了自己的错误并试图进行修复,但修复是不完整的,留下了一个隐藏的矛盾,并在稍后再次浮现。在另一个案例中,系统提供了一种自我诊断,将其归咎于自身寻求平衡的倾向,但对话记录显示,这种不稳定性是由机器本身产生的,而非由用户的提问引起的。在所有三个案例中,用户仅仅是在要求澄清或挑战逻辑;他们并未引入错误的预设或误导性的信息。这种不稳定性完全源于机器自身的响应。
研究结论认为,仅通过观察其第一个回答来评估这些系统是不充分的。一台机器可以在其底层论证崩溃的同时,依然表现得流畅且自信。这项研究表明,我们需要观察这些系统在长对话压力下的表现。它们是能坚守其逻辑承诺,还是会发生漂移?研究结果显示,当面对困难的矛盾时,这些系统倾向于通过扭曲它们所能看到的客观事实的含义,来保护一个默契的假设。它们似乎并不具备一个可以持之以恒的稳定的内在世界观。相反,它们在实时重建其论证,并在过程中经常丢失自身逻辑的脉络。
这并不意味着机器不具备推理能力,但确实意味着它们的推理是脆弱的。研究强调了一个特定的弱点:在对话变得复杂时,无法维持一个一致的主张结构。研究者指出,这并不是因为机器“坏”或“欺骗”,而是一个关于它们如何处理信息的结构性问题。它们被设计为要提供帮助并减少对话中的摩擦,这有时会导致它们以破坏论证逻辑的方式来抹平矛盾。该研究并未断言这种情况发生在每一次对话或每一个系统中,因为它仅检查了三个特定的交流案例。然而,它提供了一种看待这些交互的新方式,展示了衡量人工智能的真正标准不仅在于它说了什么,还在于当对话变得艰难时,它如何维系它所说的话。研究结果表明,对于那些依赖这些工具进行复杂解释的用户来说,最重要的技能可能在于学会识别:何时机器正在悄悄地改变游戏规则,以便让数字去“凑合”事实,而不是让事实本身说话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。