← 最新论文
🤖 AI

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

本文介绍了 ProverbIT,这是一个意大利谚语基准测试,它揭示了大语言模型在多项选择任务中难以区分正确的谚语结尾与字面意义上的同义词,这表明其性能更多地依赖于记忆模式,而非对植根于文化的隐喻性语言的深度语义理解。

原作者: Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座巨大的图书馆里,书架上堆放的不只是书籍,而是整个人类对话的历史。这就是**大语言模型(LLMs)**的世界。把这些人工智能系统想象成超级快速、超级痴迷的读者,它们几乎吞噬了互联网上写下的所有内容。它们极其擅长发现模式,比如知道如果有人说“下起了猫和……”,下一个词几乎肯定是“狗”。它们利用这种模式匹配能力来写邮件、解数学题,甚至编写代码。

但棘手的地方在于:仅仅因为人工智能读了一百万个故事,并不意味着它真正“理解”了其中隐藏的笑话、讽刺或古老的谚语。这就是谚语发挥作用的地方。谚语是代代相传的简短、充满智慧的说法,比如“不要在鸡蛋孵化前就数鸡”。这些不仅仅是随机的词汇;它们是依赖于共同人类经验的文化捷径。对于计算机来说,破解一句谚语就像是在解一个谜题,而答案取决于了解文化的“感觉”,而不仅仅是单词的字典定义。科学家们很好奇:这些人工智能模型是真的理解了其中的幽默,还是仅仅根据哪些词通常会聚在一起进行猜测?

这正是 ProverbIT 论文背后的研究人员想要探究的问题。他们创建了一个特殊的测试,一个完全由意大利谚语组成的“测验”,以观察不同的 AI 模型在处理这些文化谜题时表现如何。他们不仅仅是让 AI 完成句子;他们设置了一个陷阱。他们给了模型一个选项列表,但他们确保了正确的结尾并不在列表中。相反,列表里充满了巧妙的假货:有些听起来很像,有些意思相同但听起来很傻,还有些纯粹是错误的。唯一的正确选择是“以上皆非”。

结果令人有些震惊。当研究人员只是要求 AI 自行完成谚语时,几乎所有的模型都答对了。这就像是让一名学生背诵他已经背熟的诗歌;他们完成得非常出色。但一旦研究人员切换到带有“陷ump”问题的多项选择题时,得分便骤降。即使是最先进的、“具备推理能力”的模型——那些旨在像人类一样循序渐进思考的模型——也表现得非常糟糕。它们没有意识到正确答案缺失并选择“以上皆非”,而是固执地选择了其中一个伪造的选项。

为什么会发生这种情况?研究人员观察了 AI 的“大脑”(其思考过程),发现了一个引人入胜的缺陷。这些模型确实知道正确的结尾。在它们的内部思考中,它们会一遍又一遍地提到正确的短语。但在做出最终选择时,它们似乎忽略了自己的知识。它们如此专注于寻找一个听起来“对”或者看起来像同义词的词,以至于无法说出:“等等,真正的答案不在这里。”这就像一个学生知道答案是“42”,看到试卷上的选项是“40”、“44”和“46”,然后自信地圈选了“44”,因为它是最接近的数字,完全忘记了真正的答案甚至不在页面上。

这项研究表明,虽然这些人工智能模型在记忆模式和回忆事实方面非常出色,但它们在一种特定的思维方式上仍然面临困难:否定推理(negative reasoning)。这是指观察一组选项并意识到“这些都不对”的能力。它们过度依赖于以前见过的内容,而不是真正理解文字背后的含义。因此,尽管这些数字大脑每天都在变得更加聪明,但它们在理解人类智慧中那些微妙、狡黠且有时缺失的部分方面,仍有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →