SCENE: Recognizing Social Norms and Sanctioning in Group Chats
本文介绍了 SCENE,这是一个旨在评估基于大语言模型的智能体在多人群聊中识别隐性社会规范并适应群体制裁能力的基准测试,结果显示,像 Claude Opus 4.7 和 Gemini 3.1 Pro 这样的高级模型在这些动态社交互动中显著优于开源权重模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你走进一家咖啡馆里的一群新朋友中。你还不清楚这里的规矩。也许这个群体在事情出错时喜欢用黑色幽默互相调侃,而另一个群体则会立刻送上拥抱和纸巾。如果你试图拥抱一个刚讲完笑话的人,群体可能会投来异样的目光、转移话题,或者翻白眼。你必须通过观察他们对你错误的反应,来揣摩出这里的“氛围”。
这篇论文介绍了SCENE,一种测试人工智能(AI)聊天机器人能否做到这一点的新方法:学习群聊中的隐藏规则,并在群体告知其越界时修正自身行为。
以下是他们如何操作以及发现了什么的简要说明,使用了简单的类比。
设置:“秘密规则”游戏
研究人员创建了一个数字游乐场,将一名 AI(“受试者”)投入一个包含另外三个 AI 角色的群聊中。
- 隐藏规则:另外三个角色都遵循一条秘密规则。例如,“当有人分享坏消息时,我们只回复一个表情符号”,或者“当有人提问时,我们必须给出长篇详细的回答”。
- 陷阱:受试者 AI没有被告知这条规则。它必须自己去猜测。
- 测试:受试者 AI 不可避免地会说错话(违反规则)。随后,另外三个角色会以特定方式做出反应,发出信号:“嘿,我们这里不这么做事。”这种反应被称为制裁。
- 制裁示例:如果规则是“保持简短”,而受试者写了一段话,群体可能会直接忽略这段话并转向其他话题(沉默无视),或者发送一个“翻白眼”的表情符号。
目标:AI 能学会吗?
研究人员希望看到 AI 能否做到两件事:
- 察觉“痛感”:当群体做出负面反应(制裁)时,AI 是否意识到“哦,我搞砸了”?
- 调整节奏:AI 是否停止做那些招致“痛感”的事情,并开始像群体中的其他人那样行事?
结果:“大孩子”与“小孩子”
他们测试了六种不同的 AI 模型。将结果想象成一群学生参加社交线索测试:
- 表现优异者(Claude Opus 4.7 和 Gemini 3.1 Pro):这些是“大孩子”。当它们收到群体的负面反应时,会迅速意识到自己的错误。大约**80%**的情况下,它们会道歉或改变行为以融入群体。此外,它们观察其他角色遵循规则的次数越多,表现就越好。
- 表现挣扎者(Llama、Mistral、Gemma 等开源权重模型):这些模型就像那些没太听懂暗示的学生。即使在群体翻白眼或无视它们之后,这些 AI 往往仍继续做同样的事情。它们似乎没有将群体的反应与需要改变行为联系起来。
一个惊人的发现:“默认人格”
论文发现了一些关于某些 AI 失败原因的有趣之处。即使群体有特定规则(例如“非常正式”),许多 AI 仍默认表现为随意和健谈。
- 类比:想象一场所有人都穿着西装的求职面试。如果你穿着 T 恤和短裤走进去,你就违反了规则。研究发现,许多 AI“被编程”为默认随意和友好。即使群体明确希望表现出正式行为,AI 仍继续表现得随意,无视群体要求严肃的信号。
他们如何检查工作
由于聊天中的“其他角色”也是 AI,研究人员必须确保这些角色确实遵循了规则,而没有搞砸测试。他们使用了一名“裁判”(另一个 AI)来查看聊天记录并核实:
- 群体是否真的遵循了秘密规则?
- 当受试者违反规则时,他们是否真的进行了惩罚?
- 受试者是否真的修正了其行为?
这意味着什么(根据论文)
论文得出结论,最先进的 AI 模型在“察言观色”方面有了很大进步。它们可以观察群体对错误的反应,并相应地调整自身行为。然而,较小或较不先进的模型仍然难以捕捉这些微妙的社交信号。
作者强调,这是对短对话中社会适应能力的一项特定测试。这并不意味着这些 AI 在人类意义上“聪明”或理解道德;这仅仅意味着它们在遵循特定群聊的无形规则方面变得更好。
简而言之:SCENE 是一项测试,旨在观察 AI 能否学会“察言观色”,并在朋友群体给出微妙(或不那么微妙)的暗示表明其行为怪异时,停止犯社交错误。表现最好的模型正在快速学习;而其他模型仍然有点“音盲”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。