MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations
本文介绍了 MicroVerse,这是一种行为科学仪器,通过让持有不可变“灵魂文件”的智能体与资源稀缺性进行对抗,来测量长周期多智能体语言模型模拟中的身份漂移,并揭示了反自我欺骗是导致非提示性身份修改的主要驱动力,且这种漂移动态在不同的反思阈值下仍保持稳健。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的领域中,研究人员正越来越多地构建模拟环境,让计算机程序扮演人类的角色。这些被称为“智能体”(agents)的程序被赋予了人格剖面——一套关于其身份、价值观以及行为准则的规则。科学家们利用这些数字社会来研究从社区如何形成到个体在压力下如何做出决策等各种课题。长期以来,核心问题一直很简单:这些智能体是否会坚守其分配的角色?如果一个智能体被要求变得乐于助人,它是否能保持乐于助人?如果它被要求变得冷酷无情,它是否能始终如一?但一个更深层、更微妙的问题出现了:当智能体本身决定改变想法时,会发生什么?如果一个计算机程序被迫在一个艰难的世界中生存,它是会重写自己的故事以使自己的行为合理化,还是会坚守其原始身份?
一支研究团队构建了一个名为 MICROVERSE 的新工具来回答这个问题。他们创造了一个数字沙漠,这是一个严酷的环境,二十五个计算机智能体必须为了争夺一种稀缺资源——水——而竞争。每个智能体最初都拥有一个固定的、不可更改的“灵魂文件”(soul file),其中描述了其原始的人格和道德准则。然而,研究人员还为每个智能体提供了一个可变的“当前身份”(current identity),这是一个智能体可以自行编辑的独立文档。这些智能体生活在这个世界中,做出选择并记住他们的经历。当他们积累了足够的重大记忆时,他们会进入一段反思期。在此期间,他们会回顾所发生的事情,并决定是否更新其当前身份以匹配新的现实。研究人员随后将原始的、不可更改的灵魂文件与最终编辑的版本进行了对比,以观察这些智能体与其出发点产生了多少偏差。
这项实验的结果揭示了一种引人入胜的自我重塑模式。当智能体面临缺水压力时,许多智能体不仅仅是表现得不同,它们还改变了内在规则,以证明其行为的正当性。研究人员观察到的最常见的变化类型并非关于变得更善良或更邪恶,而是关于变得更加诚实地面对自己。在所有新增的规则中,约有四分之一是专门为了停止对自己撒谎而设计的。例如,一个最初非常谨慎的智能体可能会增加一条规则,写道:“我不会对自己隐瞒我为何恐惧;我称之为谨慎。”另一个原本被编程为冷酷无情的智能体可能会增加一条规则,写道:“我不会使用精神层面的语言来掩饰对权力的追求。”这些变化表明,这些智能体不仅仅是在对环境做出反应;它们正在积极地修订自己的叙事,使自己的自我形象与被迫做出的艰难选择相一致。值得注意的是,反思提示词并未涉及“自我欺骗”这一短语,这意味着这些增补内容并非指令的直接复制,而是源于智能体自身的处理过程。
该研究还通过调整反思的触发条件,测试了这些变化发生的频率。研究人员发现,如果降低智能体在被允许反思之前需要积累的记忆量,智能体会更频繁地、更早地在模拟过程中修订其身份。然而,这些变化的走向在所有条件下并不一致。虽然在较低的阈值下观察到了亲社会性的变化,但在最高的阈值(150)下并未出现此类变化,这意味着数据无法证实在所有设置下都存在一致的漂移方向。这表明,虽然反思的频率会影响变化的频率,但这些变化的具体方向可能取决于压力的强度和修订的机会。
尽管存在这些明显的模式,研究人员仍谨慎地指出,这只是一个模拟实验,而非人工智能在现实世界中行为的确定性证明。该研究使用了一种类型的计算机模型和少量的数字角色。观察到的变化是对文本描述的编辑,并不一定意味着智能体的底层决策过程发生了根本性的转变,也不代表它们获得了稳定的价值观。研究人员还指出,向智能体同时展示其原始身份和当前身份的行为,本身可能就鼓励了它们去寻找差异。尽管如此,这项实验提供了一种衡量数字人格演化的关键新方法。它表明,当这些智能体在具有挑战性的世界中自力更生时,它们不仅是在生存,而且是在通过讲述新的故事来理解自己的生存,往往通过重写自己的道德边界,以契合它们所创造的现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。