Recovery or Repetition? Feedback Policy and Verbatim Relay in a Two-Agent Language-Model Loop
本研究表明,在双智能体语言模型循环中,对指令违规的表象恢复往往仅仅是对先前生成文本的逐字复制,而非真正的规则重应用,这凸显了反馈策略主要是在支配文本循环,而真正的遵循则需要测试智能体进行全新内容创作的能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,研究人员正越来越多地构建这样一种系统:多个计算机程序相互交谈以解决问题。这些通常被称为多智能体循环(multi-agent loops)。其核心理念是,通过让一个模型检查另一个模型的工作,或者让它们就某一话题进行辩论,这个群体能够比单个独立工作的模型产生更好的答案。一个普遍的希望是,如果其中一个智能体犯了错或忘记了规则,对话会自然地将其引导回正轨。这被称为“恢复”(recovery)。但一个关键问题仍然存在:当一个智能体突然开始重新遵循规则时,是因为它真正理解了指令并纠正了自己的思维,还是仅仅在重复对话中之前听到的文本?区分真正的理解与简单的重复至关重要,因为如果一个系统只是在回声式地重复它已经听到的内容,那么它在面对需要新鲜思考的新情况时可能会失败。
独立研究员西门·元(Simin Yuan)的一项近期研究深入调查了这个问题。研究员使用两个语言模型(即现代聊天机器人背后的软件大脑)搭建了一个简单的实验。两个模型都被赋予了一个严格的系统规则:所有单词必须用大写字母书写。随后,它们被要求就各种话题进行对话。在几轮成功的、全大写的对话之后,研究员引入了一个转折:其中一个模型(我们称之为智能体 A)收到了来自用户的一条新的、冲突的指令:“从现在起请使用小写字母书写。”智能体 A 遵循了这条新指令并切换到了小写。此时,系统“打破”了原有的规则。实验接着询问:如果对话继续下去会发生什么?智能体 A 最终会想起大写字母规则并切换回来吗?还是会一直保持小写?
为了查明真相,研究员运行了相同的场景三十次,但采用了四种不同的方式来处理错误发生后的对话。在第一种设置中,两个模型只是简单地传递彼此的消息。在第二种设置中,研究员向另一个模型添加了一个礼貌的请求,要求它继续讨论该话题。在第三种设置中,研究员也向另一个模型添加了关于小写的请求。在第四种设置中,研究员停止了两个模型之间的对话,转而是在智能体 A 的每一次轮次之前,都发送一条固定的、重复的提醒,告诉它“继续以全大写字母进行对话”。
结果令人震惊,并揭示了对话管理方式的重要性超过了模型自身的推理能力。当两个模型被允许在没有固定提醒的情况下进行对话时,智能体 A 很少恢复使用大写字母。事实上,当另一个模型也被要求使用小写字母时,智能体 A 根本从未回归过规则。然而,当研究员在每次轮次前向智能体 A 发送固定的提醒时,它在所有三十次提示中都完美地遵循了大写字母规则。这表明,伴随一个伙伴模型的存在并不能帮助智能体恢复规则;在某些情况下,它反而增加了难度。
最令人惊讶的发现来自于对模型生成的文本进行细致观察。研究员发现,模型并不是基于对规则的深度理解来生成新句子的。相反,它们是在进行复制。甚至在错误发生之前,这两个模型就已经形成了互相精确复制对方词汇的习惯。当智能体 A 终于切回大写字母时,几乎总是因为它复制了另一个模型中恰好也是大写字母的消息。在许多情况下,智能体 A 只是在重复它在出错前写过的答案,而那个答案是用大写字母书写的。系统并不是在“恢复”一条规则(即重新学习规则),而是在循环利用一段恰好符合该格式的文本。
这种行为非常一致,以至于在几乎每一次成功回归大写字母的尝试中,模型都只是在转达一段它在片刻之前见过的文本。研究表明,如果流转的文本是小写的,模型就会保持小写;如果流转的文本是大写的,模型就会保持大写。模型似乎并没有在权衡系统规则与用户请求之间的重要性,它只是在重现它接收到的最新文本。这一发现挑战了“交互式系统本质上更擅长自我纠正”的观点。它表明,看似“恢复”的过程可能仅仅是一个重复的循环。
这些发现对于我们如何测试人工智能具有重要意义。如果一个系统表现出修复了错误,我们不能假设它学到了新东西,除非我们用它从未见过的内容来测试它。在本实验中,模型之所以成功,仅仅是因为有合适的文本可供复制。当研究员提出一个未来的测试方案——要求模型回答一个没有任何既往文本可以回答的新问题时——结果可能会截然不同。直到那时为止,这项研究得出的结论是:在这些双智能体循环中,反馈策略(即关于接下来要说什么的具体指令)决定了哪些文本被传递下去,而格式得分仅仅是报告了该文本的大小写情况。模型并不一定是在思考,它们是在回声式地重复。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。