When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs
本文提出了一种决策理论框架,用于验证大语言模型所 elicited 的概率信念与其决策之间的一致性,结果表明,尽管即使是性能最强的模型在其陈述的信念与实际行动之间也存在细微差异,但这些信念并非驱动其选择的信息的完美总结。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在聘请一位擅长诊断患者的医学顾问。你向他们询问关于特定患者的两件事:
- 猜测:“该患者患有某种特定疾病的概率百分比是多少?”
- 行动:“基于你所知,我们应该怎么做?是进行治疗、让他们回家,还是进行更多检查?”
本文提出了一个简单却棘手的问题:顾问的“猜测”是否真的与其“行动”相符?
有时,人们(或人工智能)会说一套做一套。也许顾问说:“我对这是该疾病的把握只有 60%,”但随后他们却表现得仿佛有 99% 的把握,立即建议进行高风险手术。或者,他们表现得十分谨慎,尽管声称自己非常有信心。
本文的研究人员构建了一个“真相探测器”,以观察大型语言模型(LLM)——即那些智能 AI 聊天机器人——是否保持一致。他们不仅检查了 AI 的数学计算是否正确,还检查了 AI 的言辞(其陈述的信念)是否真正解释了其选择。
“黑盒”侦探工作
研究人员将 AI 视为一个“黑盒”。他们无法窥探其大脑内部以了解其思考过程。他们只能看到输出结果:AI 口头说出的概率,以及它做出的决策。
为了测试 AI,他们使用了两个主要的“试金石”,可以通过以下类比来理解:
1. “无额外秘密”测试(条件独立性)
想象 AI 是一位撰写报告的侦探。
- 信念:报告写道:“我认为嫌疑人有罪的可能性为 80%。”
- 行动:侦探逮捕了嫌疑人。
如果这份报告是侦探所知一切内容的完整总结,那么一旦你读到了"80% 的把握”这一部分,通过查看逮捕决定就不应再获得任何新信息。逮捕决定应完全由这 80% 的把握来解释。
发现:研究人员发现,对于许多 AI 模型而言,"80%"这个数字并非全部真相。即使在得知 AI 说了"80%"之后,观察 AI做了什么(逮捕或未逮捕)仍然会泄露关于患者真实状况的额外信息。
- 类比:这就像一位天气预报员说:“降雨概率为 50%。”但随后你看到他们正撑着一把厚重的雨伞。如果你只听到了"50%",你不会期待他们带伞。他们带伞的事实意味着他们“知道”一些比他们所说的更多的东西。AI 的行动揭示了其口头言辞未能捕捉到的隐藏信息。
2. “移动目标”测试(单调性)
想象你在观察交通信号灯。
- 如果灯是红色(高风险),你停下。
- 如果灯是黄色(中等风险),你减速。
- 如果灯是绿色(低风险),你通行。
如果 AI 是一致的,随着其口述的“风险”数值上升,其行动应可预测地转向更谨慎的选择。如果 AI 说风险为 10%,它应采取一种行动;如果它说风险为 90%,它应采取不同的行动。
发现:研究人员检查了随着数值变化,AI 的行动是否朝正确的方向移动。
- 好消息:对于最强大、最先进的 AI 模型,其行动确实朝正确的方向移动。当 AI 表示风险更高时,它的行动更加谨慎。
- 坏消息:这种联系并不完美。有时 AI 会说风险很高,却表现得像风险很低,反之亦然。这就像交通信号灯有时在车辆已经行驶时会在不同颜色之间闪烁。
裁决:“接近,但不完美”
本文得出结论,虽然最好的 AI 模型在使其言辞与行动保持一致方面有所进步,但它们尚未达到完美的连贯性。
- “近理性”代理:研究人员从数学上证明,如果 AI 通过这些测试,它的行为就仿佛它真正相信自己所言。它的行为就像一个拥有清晰内部信念体系的理性人。
- 现实检验:大多数模型未能通过“无额外秘密”测试。这意味着 AI 内部的“大脑”掌握着关于患者的更多信息,而不愿将其简化为一个简单的百分比数字。口头陈述的信念是 AI 实际所知内容的不完美总结。
为何这很重要(根据本文)
作者强调,在医学等高风险领域,我们不能仅仅因为 AI 说“我有 90% 的把握”就信任它。
- 如果 AI 的行动与其言辞不符,我们就无法信任其解释。
- 本文提供了一种验证这些信念的方法。与其只听 AI 的一面之词,我们可以检查其行为是否证明它确实持有该信念。
简而言之:本文教导我们如何在 AI 代理说一套做一套时识破它们。它表明,虽然最聪明的 AI 模型正越来越接近诚实和一致,但它们的行动中仍隐藏着其口头言辞未能完全揭示的“隐藏想法”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。