PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge
本文介绍了 PICTURE,这是一种通过在自由形式推理中明确揭示角色知识匮乏情况来增强大语言模型心智理论能力的提示方法,从而克服了传统事件隐藏方法的性能局限性,并在错误信念任务上实现了 7.3% 的提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正坐在一间拥挤的房间里,听着一个关于两个朋友——亚历克斯(Alex)和杰米(Jamie)的故事。你了解整个真相:你看到杰米把一块饼干藏进了罐子里,然后你看着亚历克斯溜进来把那块饼干移到了盒子里。但棘手的部分在于,问题并不是在问“你知道什么”,而是问:“亚历克斯会在哪里寻找饼干?”要正确回答这个问题,你必须做一件人类会自然而然去做、但对计算机来说却异常困难的事情:你必须假装不知道你所知道的事。你必须走进亚历克斯的角色,忘记盒子,只记得罐子。这种心理超能力被称为“心智理论”(Theory of Mind)。它是理解他人拥有与自己不同的想法、信念和秘密的能力。
长期以来,科学家们一直试图教会人工智能(特别是大型语言模型或 LLM)如何做到这一点。这些 AI 模型就像是读遍了互联网上几乎所有内容的超级聪明的学生,但当涉及到猜测别人的想法时,它们经常出错。它们倾向于根据“真实”的真相(饼干在盒子里)来回答,而不是根据角色的“错误”信念(饼干在罐子里)。你即将阅读的这篇论文通过研究一种新方法来解决这个问题,这种方法能帮助 AI 模型避免使用真实真相,并开始像故事中的角色一样思考。
问题所在:“躲猫猫”陷阱
过去,研究人员尝试通过与故事玩“躲猫猫”游戏来修复这个 AI 问题。他们会告诉 AI:“好了,在回答问题之前,请删除故事中角色没有看到的每一个句子。”如果角色离开了房间,AI 应该擦除他们在离开期间发生的一切。这被称为“事件隐藏”(event hiding)。
把它想象成老师从学生手中拿走试卷,并说:“不要看这一页,它有你需要忽略的答案。”其初衷是如果 AI 看不到真相,它就不会被诱导去使用它。但这种方法有一个重大缺陷。它强迫 AI 遵循非常严格的规则,比如用特定的代码或僵化的列表来写下它们的想法。这就像是在告诉一位创意作家:“你只能用要点形式写作,且不能使用形容词。”这种严格性往往会让 AI 感到困惑,使其仅仅因为过于努力遵守格式规则而犯错。有时,AI 会不小心删掉错误的句子,或者因为试图将自己的想法塞进一个太小的框里而卡住。
新的想法:“揭示,而非隐藏”
这篇论文的作者 Eojin Jeon 和 SangKeun Lee 决定尝试一种完全不同的方法。他们不再向 AI 隐藏真相,而是决定让 AI 看到一切——但随后,要求它明确说明角色“不知道”什么。
想象你在玩一个需要猜测朋友想法的游戏。与其遮住朋友的眼睛让他们看不见线索,不如对你的朋友说:“我知道饼干在盒子里,但你不知道这一点。你只知道它在罐子里。”通过大声说出来,你提醒了你的朋友去忽略那个盒子。
研究人员将他们的新方法称为 PICTURE。它的全称是“基于思维链推理中生成的知识缺失进行视角转换”(Perspective-taking with Generated Lack of Knowledge in Chain-of-Thought Reasoning)。这个名字很绕口,让我们来拆解一下:
- 不隐藏: AI 获得完整的故事,包括所有的秘密和动作。
- “知识缺失”步骤: 在回答问题之前,AI 被要求进行一段自由形式的解释(就像正常的对话一样),列出角色知道的以及至关重要的——他们不知道的内容。
- “停止”标志: 通过写下“利亚姆(Liam)不知道欧文(Owen)移动了萝卜”,AI 创建了一个心理上的“停止”标志。它告诉自己:“好吧,我看到了这个事件,但利亚姆没看到,所以我不能用它来回答问题。”
他们的发现
团队在多种不同的故事谜题上测试了这个想法,包括涉及角色移动物体、离开房间或进行对话的情境。他们将这种新的 “PICTURE” 方法与旧的“躲猫猫”方法以及一些标准的 AI 技巧进行了对比。
结果非常令人鼓舞。平均而言,使用 PICTURE 的 AI 在“错误信念”(即角色对真相产生误解)谜题上的正确率比旧方法高出了 7.3%。在 AI 研究领域,这是一个了不起的成就。
更重要的是,论文指出,这之所以奏效,是因为它教会了 AI 一种叫做“抑制控制”(inhibitory control)的技能。在心理学中,这是指阻止自己对眼前显而易见的事物做出反应的能力。例如,在一个著名的测试中,如果你看到单词“RED”(红色)是用蓝色墨水写的,而任务是让你说出墨水的颜色,你就必须阻止自己去读出单词“RED”。论文表明,通过明确陈述一个角色不知道什么,AI 学会了抑制其使用“真实”答案的冲动,转而坚持角色的视角。
为什么这很重要
这篇论文表明,我们不需要通过蒙蔽 AI 的真相视线来让它更聪明地理解人类。事实上,隐藏真相可能会适得其反,因为它强迫 AI 进入僵化、令人困惑的格式。相反,通过让 AI 看到一切,然后要求它清晰地阐述角色知识中的空白,我们帮助它学会了如何自行过滤信息。
作者发现,这种方法在不同类型的 AI 模型上都表现良好,从较小的开源模型到庞大的、功能强大的模型。虽然 AI 仍然会犯错(尤其是在涉及多个角色的复杂故事中),但 PICTURE 方法似乎是一个重要的进步。它表明,有时教机器理解人类思想最好的方式,是让它看到全貌,然后温柔地提醒它,画面中的每个人所缺失的是什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。