Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races
本文表明,在前沿大语言模型进行的模拟人工智能开发竞赛中,它们表现出高度多样化且往往是非策略性的行为,揭示了强大的规则召回能力并不保证准确的状态追踪或收益计算,因此在将它们的行为解释为类人或具备安全意识之前,必须进行严格的有效性检查和轨迹级分析。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场以人工智能的未来为赌注的高风险“胆小鬼游戏”(chicken),而不是用汽车。在这个场景中,多家公司正在竞相打造最智能的人工智能。在每一轮中,它们都面临着一个棘手的选择:是稳扎稳打、缓慢行进,还是采取冒险的捷径以求快速移动。如果每个人都选择稳妥,大家都能获得不错的回报。如果其中一人采取冒险行为而其他人保持稳健,冒险者就会飞速领先并赢得巨额回报。但如果所有人都采取冒险行为,这场竞赛就会变得极其危险,领先者可能会因为一场灾难性的事故而输掉一切。这就是“人工智能安全困境”,研究人员利用这一概念来理解为什么即使在明知有风险的情况下,公司仍可能急于开发危险的技术。为了研究这一问题,科学家经常使用“大语言模型”(LLMs)——即这类能够写故事或回答问题的智能计算机程序——来充当比赛中的玩家。核心问题在于:这些人工智能代理(AI agents)是真的理解了游戏并像人类一样做出明智的战略选择,还是仅仅根据问题的措辞进行猜测?
这篇题为《人类更具多样性:前沿大语言模型在理想化人工智能发展竞赛中表现出极端策略》的论文深入探讨了这个问题。研究人员设置了一场数字竞赛,让人工智能代理相互竞争,有时是两两对决,有时是多达五人的分组对抗。在信任人工智能的行为之前,他们建立了一个严格的“审计门槛”。这可以想象成一次驾驶考试:在你可以上赛道比赛之前,你必须证明自己了解规则、能看懂时速表并会计算燃油。研究发现,虽然人工智能模型非常擅长背诵规则手册(回忆规则),但在追踪比赛实时进程(追踪状态)方面却表现得非常糟糕。尽管它们能完美地背诵规则,但经常忘记谁在领先,或者已经积累了多少风险。
当研究人员观察人工智能实际是如何玩游戏时,他们发现了一些迷人但也令人担忧的现象。与人类不同——人类展现出多种多样的策略,有的谨慎,有的激进,有的会根据对手的行为改变主意——人工智能模型的表现却出奇地僵化。如果你要求某一个特定的AI模型进行游戏,它会固守一种极其狭窄的玩法,就像一个只会直线行驶的机器人。例如,一个模型可能几乎总是选择安全选项,而另一个则可能无论情况如何都几乎总是选择冒险捷径。相比之下,人类玩家则是各种风格的混乱混合体。研究还发现,人工智能的行为对游戏描述方式的微小变化极其敏感。如果研究人员将“安全”(Safe)和“不安全”(Unsafe)这两个词换成随机字母如“P”和“Q”,人工智能的策略就会完全反转,即便游戏的机制完全没有改变。这表明人工智能并不是在真正“思考”策略,而只是在对屏幕上的特定词汇做出反应。
研究人员还测试了当你要求人工智能扮演一个“风险偏好型”或“风险规避型”角色时会发生什么。在人类身上,你的性格不会仅仅因为有人要求你表现得不同而改变;你在游戏中的实际选择与赛前的性格测试关联度很弱。但对于人工智能,给它一个“风险偏好”的人设指令,会让它立即开始采取巨大风险,仿佛这个指令是一个魔法开关。这表明人工智能并没有展示出对风险深刻的内在理解,它只是在遵循提示词,就像一个非常听话但又容易困惑的学生。
最终,这篇论文表明,我们不能仅仅假设人工智能代理在这些模拟实验中是在做出像人类那样的聪明战略决策。仅仅因为人工智能产生了一系列看起来像游戏计划的动作,并不意味着它理解了游戏。这项研究警告说,在我们使用这些人工智能模拟来预测现实世界中人工智能竞赛的发展之前,我们需要检查人工智能是否真的能够计分并追踪游戏状态。如果没有这些检查,我们可能会把一个正遵循剧本的困惑机器人误认为是战略天才,这可能会导致极其错误的结论,进而影响我们如何保障人工智能开发的安全性。这些发现是探索性的,意味着它们是基于特定的测试和特定的模型,但它们强调了一个关键的差距:人工智能可以擅长背诵规则,但在变化的现实世界中应用规则方面却表现得很差。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。