CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models
本文介绍了 CARD,这是一种诊断方法,它揭示了视觉语言模型无法有效地将其内部信念表示路由到其动作预测中,这一局限性是通过一个名为 Relay Chain 的新协作网格世界基准测试识别出来的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能这一不断发展的领域中,研究人员正日益关注机器是否能够理解他人的思想。这种被称为“心智理论”(theory of mind)的能力,使人能够推断出另一个人看到了什么、知道什么或想要什么,即使这些信息对自身而言是隐藏的。它是让合作成为可能的心理纽带,让我们能够基于对方的视角而非仅仅基于自身的视角,来预测伙伴的下一步行动。随着人工智能系统被部署到人类身边工作——作为机器人助手、驾驶副驾驶或团队成员——科学家们需要知道这些系统是否也具备这种能力。如果人工智能无法真正理解其伙伴所知的信息,那么无论它在其他方面看起来多么智能,它都无法进行有效的协作。
为了调查这一点,斯图加特大学的一个研究小组开发了一种观察现代视觉语言模型“大脑”的新方法。这些是能够同时理解图像和语言的高级计算机程序。研究人员想知道,这些模型在决定下一步采取什么行动时,是否真的使用了其对伙伴心理状态的内部理解。他们创建了一个名为“接力链”(Relay Chain)的新型测试环境,这是一个在数字网格上进行的协作游戏。在这个游戏中,两个智能体握着杠杆,为第三个智能体开门。成功完全取决于智能体是否知道他们的伙伴能否看到旅行者正在穿过。如果一个智能体看不见穿过过程,它必须握住杠杆;如果它能看见穿过过程,它必须释放杠杆。这种设置迫使人工智能必须基于它认为伙伴看到了什么来做出决策,而不仅仅是基于世界上正在发生的事情。
研究人员使用了一种称为“激活转向”(activation steering)的技术来探测模型。想象一下,人工智能的内部思想是一片由信号组成的广阔景观。团队识别出了代表“信念”的特定信号——即人工智能关于其伙伴所见之物的内部记录。然后,他们在人工智能玩游戏时,人为地增强或削弱了这些信念信号,本质上是在通过微调模型的内部状态,使其对伙伴视角的确定程度更高或更低。如果人工智能确实利用其对伙伴思想的理解来做出决策,那么改变其内部信念应该会改变人工智能选择的行动。例如,如果模型被引导去相信伙伴能看到旅行者,它就应该释放杠杆。如果被引导去相信伙伴看不见,它就应该握住杠杆。
结果揭示了这些模型运作方式中的一个关键缺陷。实验表明,这些模型确实拥有清晰、可读的关于伙伴信念的表征。当被直接问到“你的伙伴看到旅行者了吗?”时,模型回答正确,研究人员甚至可以通过转向内部信号来改变答案。然而,当模型被要求执行协作动作——即决定是释放杠杆还是握住杠杆时——它们的内部信念信号却被完全忽略了。即使研究人员强行改变了模型关于伙伴所见之物的内部信念,模型在决定做什么方面的决策仍然保持完全不变。它的表现就像它对伙伴的视角有着完美的记忆,但只是在采取行动时选择不使用这段记忆。
这种脱节在测试的四种不同类型的开源模型(从较小规模到较大规模的系统)中都是一致的。这些模型失败的原因并非缺乏信息,而是因为它们没有将该信息路由到负责决策的部分。研究人员排除了其他几种可能性,例如模型被问题的措辞所迷惑,或者转向方法太弱而无法产生影响。他们测试了数十种不同的指令措辞方式,发现没有任何提示词能迫使模型使用其内部信念来指导行动。在采取行动时,这些模型实际上是对自己的知识“盲目”的。
研究结论指出,虽然这些人工智能系统可以接受训练来描述伙伴的心智状态,但它们并不会自动将这种描述与自身的行为联系起来。它们可以谈论别人知道什么,但并不利用这些知识来决定做什么。这表明,仅仅教模型回答关于信念的问题,不足以创造出一个真正的协作智能体。为了让人工智能与人类无缝协作,对他人的内部理解必须直接接入决策过程,而目前的模型似乎缺乏这种连接。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。