← 最新论文
💬 NLP

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

本文介绍了 SNIC,一个用于评估大语言模型在基于规范的指代消解能力的、经过人工验证的测试平台,揭示了即使是尖端模型也难以一致地识别并应用对于情境化、具身交互至关重要的内隐社会规范。

原作者: Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正和朋友在一个繁忙的厨房里。你问道:“能把那个杯子递给我吗?”柜台上放着三个杯子:一个是洁净闪亮的,另外两个则沾满了干涸的咖啡渍。

如果你是一个人,你会瞬间明白你的朋友会递给你那个干净的杯子。你不需要他们特意说“把干净的那个递给我”,因为你们之间共享着一个不成文的规则:不要喝别人的脏杯子。 这个看不见的规则就是一个社会规范(social norm)

这篇题为**《当规范与指代碰撞》(Where Norms and References Collide)**的论文提出了一个简单但棘手的问题:现代人工智能(特别是大语言模型或 LLM)能否在没有被明确告知的情况下,分辨出你指的是哪一个杯子?

以下是他们研究结果的解读,使用了日常类比:

问题所在:AI 的“盲点”

把 LLM 想象成一个非常聪明的学生,他读过图书馆里的几乎所有的书。他们擅长回答常识问题和解决逻辑谜题。然而,这个学生从未在厨房、图书馆或餐厅里真正“生活”过。他们知道什么是“杯子”,但他们并没有学到人们在这些地方行为时那些微妙且不言而喻的规则。

研究人员将这种缺失的技能称为基于规范的指代解析(Norm-Based Reference Resolution, NBRR)。这是指观察一个混乱的场景,理解“社会语法”(行为规则),并推测某人指向的对象的能力。

实验设计:构建一个“规范陷阱”

为了测试这一点,团队创建了一个名为 SNIC(情境化规范上下文)的数据集。

  • 设定: 他们创建了 9,000 个涉及日常任务(如清洁、服务食物或整理)的小故事(短剧)。
  • 陷阱: 在每个故事中,他们提出了一个看似具有歧义的问题。例如,“拿起那个盘子。”
    • 场景 A: 房间正在进行清洁工作。AI 应该拿起脏的盘子。
    • 场景 B: 房间正在进行餐饮服务。AI 应该拿起干净的盘子。
  • 人类测试: 在信任 AI 之前,他们先让 210 名真实的人类来解决这些谜题。人类在大多数情况下都对“符合规范”的答案达成了一致(例如:“因为我们在打扫卫生,所以要拿脏的那个”),这证明了这些规则对人类来说是非常清晰的。

结果:没有地图,AI 会迷失方向

研究人员在这些 9,000 个故事中测试了几种顶尖的 AI 模型(如 GPT-4、Llama 和 Phi)。结果就像是在观察一个试图在从未去过的城市中导航的 GPS:

  1. “猜谜游戏”的失败: 当 AI 仅被给予故事并被要求选择正确的物体时,它表现得很挣扎。它平均正确率不到一半。它经常无法区分“清洁任务”和“服务任务”,因为它不理解任务背后的“规范”。
  2. “形式语言”的死胡同: 研究人员尝试给 AI 提供一种极其精确、数学化的场景描述(使用一种名为 Prolog 的代码语言)以消除所有歧义。令人惊讶的是,这并没有什么帮助。这就像是给了司机一份完美的地图,却告诉他们:“你仍然不知道交通规则。” AI 了解事实,但仍不知道“交通规则”。
  3. “小抄”的成功: 当研究人员明确地给 AI 一份需要遵循的规则清单(例如,“规则:在清洁任务中,拿起脏的物品”)时,AI 的表现大幅飙升。它突然就能答对题目了。

核心结论

论文得出结论:目前的 AI 模型像是优秀的百科全书,却是糟糕的邻居

  • 它们知道什么是杯子。
  • 它们知道什么是清洁。
  • 但除非你明确告诉它们规则,否则它们并不天生懂得人们在社交语境下如何使用杯子。

作者认为这是一个“盲点”。AI 模型是基于文本训练的,但社会规范通常是内隐的(从未写下来)且与物理世界挂钩的(与真实的物体和动作相关联)。因为这些规则在书籍中并不总是被清晰地陈述,所以 AI 会错过它们。

为什么这很重要(根据论文所述)

论文指出,如果我们希望机器人或 AI 助手能在现实家庭或办公室中工作,它们需要学习这些隐形的社会规则。目前,当你在要一杯饮料时,它们可能会递给你一个脏杯子,这并不是因为它们“笨”,而是因为它们还没有学会那条不成文的社会契约——即“我们不这样做”。

简而言之: 这篇论文构建了一个测试,旨在观察 AI 是否理解日常生活的“潜规则”。研究发现,虽然 AI 很聪明,但除非你先向它说明规则,否则在依赖这些潜规则进行交流时,它目前还非常难以准确猜测你的意图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →