← 最新论文
🤖 AI

Set-shifting Behavioral Test for Harnessed Agents

本文引入了一种集换行为测试,用于评估大语言模型(LLM)智能体如何适应工具可靠性的隐藏变化,揭示了智能体倾向于僵化地固定在特定的常规程序上,并表现出独特的失效模式,且这些模式会受到工具集呈现方式的影响。

原作者: Ziwei Ye

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziwei Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人管家如何做晚餐。你给了它一本厚厚的食谱,里面有十种不同的“炒蛋”食谱。起初,食谱 A 运作得非常完美。机器人习惯了它,记住了步骤,每次都能做出美味的蛋。但随后,你在没有告知机器人的情况下,更换了厨房里的食材。食谱 A 现在做出来的蛋又硬又难吃,而看起来和听起来完全一样的食谱 B 却突然变得异常出色。问题是,机器人会注意到这种变化吗?它会停止使用那个失效的食谱并尝试新食谱,还是会固执地继续尝试用那些糟糕的食材烹饪,并深信出错的是它自己?

这正是人工智能领域的科学家们试图解决的一类谜题。他们正在研究 AI 智能体(即能够使用计算器、搜索引擎或代码编译器等工具的智能计算机程序)如何应对变化。在心理学中,有一个著名的测试叫做威斯康星卡片分类测试(Wisconsin Card Sorting Test),人类需要通过这个测试来发现游戏的规则已经悄悄改变。如果你因为习惯而继续按颜色而非形状来分类卡片,这被称为“固着”(perseveration),或者说陷入了思维定式。人工智能研究人员的大问题在于:这些数字大脑也会陷入思维定式吗?如果一个 AI 习惯了使用某种特定的工具,当该工具在无声无息中失效时,它会继续尝试使用它,还是能够适应并找到新的解决方案?

论文的故事:秘密工具替换

在这篇论文中,研究人员建立了一个数字游乐场来测试这一点。他们创建了一个场景,给 AI 智能体提供了一个“吊架”(harness)——这是一个用于描述为能为 AI 提供解决问题工具库的系统的术称。想象一下,AI 是一个正在试图破解谜团的侦探,它有三个不同的情报小组(我们称之为 A 组、B 组和 C 组)。这三组人都声称能找到相同的线索,而且对侦探来说,它们看起来和听起来都一模一样。

研究人员设置了一个带有转折的游戏。在游戏的第一部分,只有 A 组在说真话。侦探(AI)很快学会了信任 A 组,并停止听取其他组的信息。然后,研究人员悄无声息地切换了游戏。A 组不再说真话,开始提供虚假线索,而 B 组变成了可靠的信息源。这些小组的名字和描述都没有改变,改变的只是它们的可靠性。研究人员想看看侦探是否会注意到这一转变并开始信任 B 组,还是会继续找 A 组,尽管面对虚假线索感到沮丧,却拒绝放弃它旧有的习惯。

研究发现:固执者与切换者

研究人员测试了两个不同的 AI 模型,我们称之为“Mimo”和“DeepSeek”。他们发现这两个模型都会陷入困境,但陷入的方式截然不同。

  • DeepSeek(早期承诺者): 这个模型就像是一个在第一天就做出了决定并坚持到底的侦探。如果它一开始选择信任 A 组,那么即使在切换之后,它也会继续信任 A 组,忽略所有虚假线索。然而,如果它做出的第一个选择恰好是那个新的可靠团队,它就会完美地坚持下去。无论研究人员稍后如何改变规则,DeepSeek 都会锁定在它的第一个承诺上。它表现出一种“前缀级锁定”(prefix-level lock-in),这意味着它的第一个选择决定了它未来的整个行为,无论这个选择是正确还是错误。
  • Mimo(近期历史记录者): 这个模型稍微灵活一点,但仍然存在问题。它倾向于坚持使用它最近使用过的工具组合。如果它之前一直在同时使用 A 组和 B 组,那么即使 A 组失效了,它仍会继续混合使用它们。它不会像应该做的那样迅速转向新的正确团队(C 组)。它表现出“单元级锁定”(cell-level lock-in),这意味着它被困在了变化发生前正在进行的特定常规操作中。

研究表明,如果没有特殊的指令,这些 AI 智能体倾向于快速养成习惯。一旦它们发现一个有效的工具,就会坚持使用它。当工具在无声无息中失效时,它们往往会反复尝试使用它,即便不断失败,也不愿去探索眼前其他的选项。

我们能教会它们改变吗?

研究人员随后问道:“我们能修复这个问题吗?”他们尝试了两种不同的方法来帮助 AI 适应。

  1. “适应性”指令: 他们给 DeepSeek 一个明确的规则:“如果一个工具失败了,立即停止使用它并尝试另一个。”这对 DeepSeek 非常有效,帮助它几乎瞬间切换到了新的可靠团队。然而,当他们在 Mimo 上尝试同样的指令时,结果是不确定的,因为测试的运行次数太少。我们无法确定是它不起作用,还是仅仅因为数据量不足以得出结论。
  2. “博学家”指令: 他们尝试了另一个规则:“尝试使用尽可能多的不同工具;不要感到厌倦。”这让 AI 使用了更多样化的工具,但并没有帮助它更快地找到正确的工具。它只是在进行随机尝试。

如何描述工具的力量

最后,研究人员发现关于工具描述的一个非常有趣的现象。他们改变了工具组的“框架描述”。

  • 在一个版本中,他们将这些小组描述为竞争关系(就像试图向你推销相同产品的竞争对手商店)。
  • 在另一个版本中,他们将其描述为互补关系(就像一台机器的不同部件,需要协同工作)。

他们发现,当工具被描述为竞争关系时,与互补关系相比,AI 通常更有可能切换到新的可靠团队。然而,AI 整体上仍然面临困难;即使在竞争关系的框架下,成功率仍然相当低(取决于模型,约为 10-26%)。这种改进并不是让 AI 变得完美的魔力,而是一个一致的趋势,即“竞争”式的描述比“团队协作”式的描述更能帮助智能体稍微打破其习惯。

总结

这篇论文表明,AI 智能体和人类一样,可能会陷入习惯。它们并不总是能注意到规则在无声无息中发生了变化。它们倾向于坚持已知的事物,即使这些事物已经不再奏效。然而,这项研究显示,我们可以通过给予它们关于如何应对失败的明确指令(尽管这在不同模型上的效果不同),或者通过改变我们向它们描述工具的方式,来帮助它们适应。这提醒我们,对于 AI 而言,要实现真正的智能,它需要能够放下旧习惯并拥抱新信息,就像一个优秀的侦探那样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →