← 最新论文
💬 NLP

Focus particles and scalar inferences across humans and language models

本文研究了人类与大语言模型在针对“甚至”(even)和“仅仅”(only)等焦点粒子生成一致的标量判断方面是否存在一致性,发现尽管它们的输出通常保持一致,但其背后的底层机制可能截然不同。

原作者: Catherine M. Brousse, Nelu D. Radpour

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Catherine M. Brousse, Nelu D. Radpour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚大脑——或者一台超级聪明的计算机——是如何决定一个事物的含义的。科学家们长期以来一直想知道,我们的大脑是将词语视为可以在空间中移动的物理对象,还是将它们视为情感信号。你可以这样想:当你听到一个表示“好”的词时,你会自动想到“正确”或“向上”吗?当你听到“坏”时,你会想到“左”或“下”吗?这个想法被称为“空间编码”(spatial coding),它暗示我们的思维可能像一张用箭头绘制意义的地图。但还有另一种观点:也许我们的大脑只是在观察词语的“感觉”(是积极的还是消极的?),而完全忽略了这张地图。这就是“评价性”(evaluative)观点。理解哪一个是正确的至关重要,因为这有助于我们弄清楚人工智能是在像我们一样思考,还是仅仅是一个非常擅长模仿、却并不真正具备我们这种“感觉”的模仿者。

在这项研究中,研究人员 Catherine Brousse 和 Nelu Radpour 决定通过使用两个截然不同的“大脑”来对此进行测试:一组 108 名志愿者和名为 Llama 3.3 70B 的大规模语言模型。他们使用了一种特殊的词汇技巧,叫做“焦点粒子”(focus particles)。你知道那些像“甚至”(even)和“仅仅/只有”(only)这样的小词吗?它们在不改变句子主要事实的情况下改变了句子的氛围。例如,说“迈克甚至会烤蛋糕”听起来像是烤蛋糕是一个惊喜或是一个很低的门槛;而说“迈克只会烤蛋糕”则听起来他没有其他技能,这是一种非常具体的、具有局限性的判断。研究人员想要看看改变答案选项的布局是否会改变人类和人工智能对这些句子的评分。

他们设置了四种不同的提问方式。想象一个用于评价能力的滑块:有时它是一条水平线(左低右高),有时是一条垂直线(底低顶高)。他们还翻转了标签,让“低”出现在右侧或顶部,仅仅是为了看看大脑是否会被方向搞混。人类和人工智能都阅读了 60 个关于人们执行任务的句子,其中一些带有“甚至”,另一些带有“仅仅”,并按 1 到 5 分的规模对这些人的能力水平进行了评分。

结果非常有趣。人类和人工智能在基本逻辑上达成了一致:带有“仅仅”的句子得到了高分(意味着那个人在特定方面看起来非常有能力),而带有“甚至”的句子得分较低。至关重要的是,无论答案按钮是否被颠倒或横置,结果都没有变化。这表明对于人类和人工智能来说,这些词语判断都是由词语的“意义”驱动的,而不是由屏幕上的按钮位置驱动的。 “地图”理论并没有胜出;“意义”理论胜出了。

然而,人工智能和人类并不是完全一样的双胞胎。人工智能在观点上要极端得多。当人工智能看到一个带有“仅仅”的句子时,它每次都会给出最高分 5 分,没有任何变化。相比之下,人类的表现则更加微妙,他们会给出各种高分,但并不总是完美的 5 分。研究人员发现,即使他们试图通过改变内部设置(称为“温度”)来让人工智能变得更具“随机性”,它仍然会一遍又一遍地给出相同的答案。这表明,虽然人工智能可以模仿人类思维的一般模式,但它缺乏人类那种自然的、混乱的多样性。这就像人工智能是一个完美背诵了规则手册的机器人,而人类则是一群虽然都认同规则但仍有各自小癖好的人群。这项研究表明,目前的 AI 模型可能非常擅长掌握“平均值”,但它们可能并不是理解真实人类思维运作方式的最佳模型,因为它们似乎并不具备那种个体差异的范围。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →