NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs
本文介绍了 NICE,这是一个基于理论构建的诊断基准,包含 11 个维度共 137 个项目,用于评估大语言模型的社会智能,结果显示尽管它们取得了较高的总体准确率,但在多轮交互、非语言线索和同步性等特定沟通方面却表现出一致的弱点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一位新助理,帮助你在复杂的人际关系世界中游刃有余。你不仅想知道他们能否正确回答问题;你还想知道他们能否“察言观色”,理解未言明的规则,并懂得何时该发言、何时该保持沉默。
本文介绍了NICE(规范、互动、认知、经验),这是一份专为测试大型语言模型(LLM,即 AI 聊天机器人背后的“大脑”)处理这些社交情境能力而设计的全新“成绩单”。
以下是研究人员所做工作及发现结果的简要说明,并辅以简单的类比:
1. 问题所在:“盲人”测试
在 NICE 出现之前,测试 AI 的社交技能就像参加一场只要求你进行平行停车的驾驶考试。
- 旧测试:有些测试仅检查 AI 是否知晓特定事实(例如“什么是礼貌的问候?”)。另一些则将 AI 置于混乱、开放式的对话中,让人无法判断它失败的具体原因。
- 问题所在:如果 AI 得分较低,研究人员无法分辨它是缺乏理解情感的能力、不善于遵循规则,还是仅仅不擅长表达。这就像只说“你驾驶考试不及格”,却不知道你是因为看不见、不会打方向盘,还是不懂交通法规。
2. 解决方案:“社交 X 光”(NICE)
研究人员构建 NICE 是将其作为一种诊断工具,而不仅仅是一张记分卡。你可以把它想象成一张 X 光片,它将“社交智能”分解为具体部分,以便医生(研究人员)能精准定位“骨折”之处。
他们基于心理学构建了一个框架,将社交技能组织为4 个主要类别和11 个具体维度:
- 规范(Norms):知晓游戏规则(礼貌、伦理)。
- 互动(Interaction):你如何与他人交谈和行事。
- 认知(Cognition):理解他人的想法或感受。
- 经验(Experience):从过去的互动中学习。
NICE 不再要求 AI 撰写长篇故事,而是给它一个简短的情境(例如在拥挤的电梯中等待),并要求它从“最佳”到“最差”对三种可能的回应进行排序。这迫使 AI 展示它理解社交行为的界限,而不仅仅是“正确”的答案。
3. 实验:AI 对决人类
研究人员测试了 5 个当时最智能的 AI 模型(如 GPT-5.5 和 Claude-Opus-4.7),并与一组真实人类进行了对比。
- 令人惊讶的是:总体而言,AI 模型的得分实际上高于人类!在记忆事实、遵循伦理规则以及在理论层面上管理人际关系方面,它们表现得更好。
- 但有个问题:当研究人员查看"X 光片”(即具体维度)时,他们发现了一个巨大且一致的弱点。
4. 重大发现:“沟通鸿沟”
虽然 AI 在规则(规范)和逻辑(认知)方面表现出色,但它在**沟通(D3)**方面却表现糟糕。
这就好比一个学生背熟了整本《如何成为朋友》的教科书,但在真正与朋友交谈时却不及格。
- AI 的失败之处:模型在以下方面表现尤为糟糕:
- 多轮沟通:在多个回合中自然地维持对话。
- 非语言沟通:理解语气、肢体语言或言外之意(即使在文本中)。
- 同步性:匹配人类互动的节奏和流动感。
“鞠躬”示例:
论文举了一个有趣的例子:在一个情境中,某人鞠躬过深(180 度),人类立刻意识到这很奇怪且不恰当。然而,顶级 AI 模型却认为这实际上是一个好或中性的回应。AI 过于专注于表现得“礼貌”,却忽略了那条社交界限,即“这太过分了!”
5. 结论
NICE 证明,即使是最聪明的 AI 模型也存在特定的“盲点”。它们非常擅长根据规则知道说什么,但在如何说以使其听起来自然且像人类一样方面,往往显得笨拙。
论文得出结论:要使 AI 真正具备社交智能,我们不能仅仅让它们整体变得更聪明;我们需要专门训练它们来弥补这些沟通鸿沟,就像教练会专注于球员的弱势脚,而不仅仅是告诉他们“打得更好”一样。
简而言之:AI 是社交理论的杰出学生,但在实际的社交场合中仍显得有些笨拙。NICE 正是那个最终告诉我们为什么的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。