← 最新论文
🤖 AI

NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs

本文介绍了 NICE,这是一个基于理论构建的诊断基准,包含 11 个维度共 137 个项目,用于评估大语言模型的社会智能,结果显示尽管它们取得了较高的总体准确率,但在多轮交互、非语言线索和同步性等特定沟通方面却表现出一致的弱点。

原作者: Yunjin Qi, Zhaojun Jiang, Xuan Wu, Hanxi Pan, Yixuan Wang, Yanfang Liu, Xiang Ji, Churu Yu, Chunyuan Zheng, Yingze Chen, Jie He, Liuqing Chen, Zaifeng Gao

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunjin Qi, Zhaojun Jiang, Xuan Wu, Hanxi Pan, Yixuan Wang, Yanfang Liu, Xiang Ji, Churu Yu, Chunyuan Zheng, Yingze Chen, Jie He, Liuqing Chen, Zaifeng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一位新助理,帮助你在复杂的人际关系世界中游刃有余。你不仅想知道他们能否正确回答问题;你还想知道他们能否“察言观色”,理解未言明的规则,并懂得何时该发言、何时该保持沉默。

本文介绍了NICE(规范、互动、认知、经验),这是一份专为测试大型语言模型(LLM,即 AI 聊天机器人背后的“大脑”)处理这些社交情境能力而设计的全新“成绩单”。

以下是研究人员所做工作及发现结果的简要说明,并辅以简单的类比:

1. 问题所在:“盲人”测试

在 NICE 出现之前,测试 AI 的社交技能就像参加一场只要求你进行平行停车的驾驶考试。

  • 旧测试:有些测试仅检查 AI 是否知晓特定事实(例如“什么是礼貌的问候?”)。另一些则将 AI 置于混乱、开放式的对话中,让人无法判断它失败的具体原因。
  • 问题所在:如果 AI 得分较低,研究人员无法分辨它是缺乏理解情感的能力、不善于遵循规则,还是仅仅不擅长表达。这就像只说“你驾驶考试不及格”,却不知道你是因为看不见、不会打方向盘,还是不懂交通法规。

2. 解决方案:“社交 X 光”(NICE)

研究人员构建 NICE 是将其作为一种诊断工具,而不仅仅是一张记分卡。你可以把它想象成一张 X 光片,它将“社交智能”分解为具体部分,以便医生(研究人员)能精准定位“骨折”之处。

他们基于心理学构建了一个框架,将社交技能组织为4 个主要类别11 个具体维度

  • 规范(Norms):知晓游戏规则(礼貌、伦理)。
  • 互动(Interaction):你如何与他人交谈和行事。
  • 认知(Cognition):理解他人的想法或感受。
  • 经验(Experience):从过去的互动中学习。

NICE 不再要求 AI 撰写长篇故事,而是给它一个简短的情境(例如在拥挤的电梯中等待),并要求它从“最佳”到“最差”对三种可能的回应进行排序。这迫使 AI 展示它理解社交行为的界限,而不仅仅是“正确”的答案。

3. 实验:AI 对决人类

研究人员测试了 5 个当时最智能的 AI 模型(如 GPT-5.5 和 Claude-Opus-4.7),并与一组真实人类进行了对比。

  • 令人惊讶的是:总体而言,AI 模型的得分实际上高于人类!在记忆事实、遵循伦理规则以及在理论层面上管理人际关系方面,它们表现得更好。
  • 但有个问题:当研究人员查看"X 光片”(即具体维度)时,他们发现了一个巨大且一致的弱点。

4. 重大发现:“沟通鸿沟”

虽然 AI 在规则(规范)和逻辑(认知)方面表现出色,但它在**沟通(D3)**方面却表现糟糕。

这就好比一个学生背熟了整本《如何成为朋友》的教科书,但在真正与朋友交谈时却不及格。

  • AI 的失败之处:模型在以下方面表现尤为糟糕:
    • 多轮沟通:在多个回合中自然地维持对话。
    • 非语言沟通:理解语气、肢体语言或言外之意(即使在文本中)。
    • 同步性:匹配人类互动的节奏和流动感。

“鞠躬”示例
论文举了一个有趣的例子:在一个情境中,某人鞠躬过深(180 度),人类立刻意识到这很奇怪且不恰当。然而,顶级 AI 模型却认为这实际上是一个中性的回应。AI 过于专注于表现得“礼貌”,却忽略了那条社交界限,即“这太过分了!”

5. 结论

NICE 证明,即使是最聪明的 AI 模型也存在特定的“盲点”。它们非常擅长根据规则知道说什么,但在如何说以使其听起来自然且像人类一样方面,往往显得笨拙。

论文得出结论:要使 AI 真正具备社交智能,我们不能仅仅让它们整体变得更聪明;我们需要专门训练它们来弥补这些沟通鸿沟,就像教练会专注于球员的弱势脚,而不仅仅是告诉他们“打得更好”一样。

简而言之:AI 是社交理论的杰出学生,但在实际的社交场合中仍显得有些笨拙。NICE 正是那个最终告诉我们为什么的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →