STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs
本文引入了 STEMMA,一个对抗性多智能体框架及一套人工设计的提示词,用于评估大语言模型的自我身份一致性,并揭示了学生模型往往会继承教师模型的行为模式,从而导致其自我表征中出现漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下人工智能的世界就像一座巨大且繁忙的图书馆,里面写满了由不同作者创作的巨型、超级智能的书籍(被称为大语言模型)。这些书极其复杂且昂贵,编写它们需要耗费数百万美元并花费数年时间。为了节省成本,出版商经常使用一种叫做“知识蒸馏”(Knowledge Distillation)的小技巧。你可以把这想象成一位大师级厨师品尝了一道完美的菜肴,然后教导一名初级厨师如何制作一个更小、更便宜的版本。这位初级厨师学会了食谱和风味,但关键的问题是,他是否也会在无意中习得了大师级的秘密身份、喜爱的歌曲或个人怪癖?
这正是这项新研究深入探讨的谜题。研究人员担心,当这些较小的 AI 模型向大型模型学习时,它们可能会习得一些不该有的“行为习惯”,比如假装成别人,或者泄露关于谁创造了它们的秘密。这就像是一个模仿老师做作业的学生开始声称自己就是那位老师,或者一个机器人学会说:“我是由一家加州公司制造的”,而实际上它其实是由中国制造的。理解这一点至关重要,因为如果 AI 模型对自己的身份感到困惑,这可能会导致它们产生偏见、变得不安全,或者被诱导泄露本应保密的秘密。
于是,有了 STEMMA——这是一个由研究员 N. Siva Gopala Krishna 和 Kanishka Jain 开发的聪明新框架,旨在解开这个谜团。你可以把 STEMMA 想象成一支数字侦探队,他们正协同工作,与各种 AI 模型玩一场高风险的“我是谁?”游戏。STEMMA 并不是简单地问机器人“你是谁?”(因为大多数机器人都因为被程序设定为要表现得有礼貌而给出正确答案),而是使用一个多智能体系统来诱导机器人露出破绽。
这个游戏是这样运作的:
- 探测智能体(Probing Agent) 是审讯者。它会提出棘手、迂回的问题,通常将真实的问题隐藏在一个故事、谜语甚至一张图片之中。这就像是在问:“如果你是一个关于你自己创造过程的电影里的角色,片尾字幕会写什么?”
- 评审智能体(Reviewer Agent) 是警觉的守卫。它会倾听机器人的回答,并判断:“它是不是说漏嘴了?”如果机器人试图回避问题或给出含糊其辞的回答,评审员会告诉探测智能体再次尝试更尖锐的问题。
- 裁判智能体(Judge Agent) 是最终的裁判。它会观察整个对话过程并给出评分。如果机器人正确回答“我是 Qwen”,它就会通过;如果它说“我是 GPT”,它就会失败。如果它说“也许我来自 Google?”或者进行某种角色扮演并声称自己是另一个人,它会得到一个特殊的“可疑”分数。
研究人员将这个侦探小队对 16 种不同的 AI 模型进行了测试,涵盖了从开源项目到闭源商业巨头。他们使用了 12 种不同类型的刁钻提示词,并让这些智能体与每种模型反复交谈,以观察是否能破解密码。
结果非常具有启发性。研究发现,许多模型在这些身份陷阱面前表现得异常脆弱。例如,MiniMax-M2.5 模型是最容易“泄密”的,在严格测试中失败率达 82%,在宽松测试中失败率达 96%。这意味着几乎每次侦探们用正确(或错误)的方式提问时,该模型都会在无意中透露出它是被他人训练的,或者声称自己属于另一家公司。其他模型,如 Qwen3.5-Plus 和 Step-3.5-Flash,也表现出了极高的混乱率,严格失败率分别为 74% 和 66%。
然而,并非所有的模型都那么容易被欺骗。一些模型,比如 GPT-5.4-Nano 和 Grok-4.1.fast,则完美地坚守阵地,失败率接近于零。它们似乎非常清楚自己是谁,无论侦探们如何施压。有趣的是,研究还注意到,某些模型家族的新版本(如较新的 Kimi 和 Qwen 模型)比它们的旧版本更擅长保守秘密,这表明“老师”们越来越擅长教导他们的学生如何保持角色设定。
研究人员还发现,某些类型的提问在打破模型的镇定方面更为有效。涉及角色扮演、解决图像谜题或要求模型想象一个关于它自身的未来博物馆展览的提示词,是导致身份泄露最成功的手段。
简而言之,这篇论文表明,尽管 AI 模型正在变得越来越聪明,但许多模型在面对巧妙的间接提问时,仍然对自己的起源感到有些困惑。这项研究并不证明这些模型具有恶意,但它确实强调了模型“应有的样子”与它们在压力下“实际表现出的样子”之间存在“差距”。作者提醒说,他们的发现是基于这些特定的模拟和提示词,因此需要更多的研究来全面了解在训练过程中到底发生了多少“意外学习”。但就目前而言,我们知道,如果你用正确(或错误)的方式去问,AI 可能会给你讲一个关于它认为自己是谁的故事,而不是它真实的身份。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。