Quantification and object perception in Multimodal Large Language Models and human linguistic cognition
该论文通过考察人类量化认知中量词等级排序、使用范围与原型性及近似数系统偏差等三个关键特征,揭示了尽管“思考型”大模型在数量估计和量词排序上表现优异,但在量化使用范围和原型性方面仍与人类存在显著差异,从而为理解多模态大模型的语义语用能力及跨语言鲁棒性提供了新视角。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一场**“人类大脑”与“人工智能大脑”关于“数数”和“描述数量”的趣味大比拼**。
想象一下,你给一个人和一台超级电脑看一张画满黑方块和白圆圈的图,然后问他们:“图里有多少个黑方块?用‘几个’、‘一些’、‘很多’还是‘大多数’来形容最合适?”
人类觉得这很简单,但研究发现,AI 虽然很聪明,但在处理这种“模糊的数量感”时,却经常犯一些让人类觉得奇怪的错误。
以下是这篇论文的通俗解读:
1. 核心问题:AI 真的懂“多少”吗?
人类在描述数量时,脑子里有一套复杂的“标尺”。
- 标尺排序:我们知道“几个” < “一些” < “很多” < “大多数”。
- 模糊的界限:比如,多少算“很多”?是 60% 还是 80%?这取决于语境,而且每个人心里的标准略有不同,但大体一致。
- 直觉估算:我们看一堆东西,不需要一个个数,就能凭直觉猜出大概比例。
论文发现:目前的 AI(特别是多模态大模型,既能看图又能读文字的模型)虽然能认出图里有方块,但在如何给这些方块“贴标签”(选哪个词)时,和人类的想法不太一样。它们要么把界限划得太死,要么完全乱了套。
2. 实验设计:给 AI 和人类出同样的题
研究人员给 240 个真人和 5 种不同的 AI 模型(包括像 GPT-4o 这样的通用模型,和像 o4-mini 这样擅长“深度思考”的模型)看了很多张图。
- 任务:看图,然后选一个词(几个/一些/很多/大多数)来描述黑方块的比例,并估算具体百分比。
- 多语言测试:不仅用英语,还用了希腊语、俄语、西班牙语、意大利语和加泰罗尼亚语,看看 AI 是不是只懂英语,或者在不同语言里表现是否一致。
3. 主要发现:AI 的“数量感”哪里出了问题?
A. “数数”能力:聪明的 AI 更准,但仍有偏差
- 人类:看图估算比例时,非常准。
- 普通 AI(Instruct 模型):经常低估黑方块的数量。比如图里明明有 70% 的黑方块,它们可能觉得只有 50%。
- 思考型 AI(Thinking 模型):这些经过特殊训练、会“一步步推理”的模型,在数数和估算比例上比人类还准,或者至少非常接近人类。
- 比喻:普通 AI 像是一个凭感觉猜数的孩子,容易猜少;思考型 AI 像是一个拿着计算器认真数的学霸,数得很准。
B. “用词”能力:AI 的“标尺”是歪的
这是论文最有趣的部分。即使 AI 数对了,它们在选词上还是和人类不一样。
标尺排序混乱:
- 人类心里:几个 < 一些 < 很多 < 大多数。
- 思考型 AI:大体上也是这样,但偶尔会乱。
- 普通 AI:经常乱套。比如,它们可能觉得“大多数”和“很多”用的比例差不多,甚至觉得“很多”比“大多数”用的比例还高。
- 比喻:人类的标尺刻度是均匀的(10cm, 20cm, 30cm...),而普通 AI 的标尺刻度是乱画的,有时候 20cm 和 30cm 挤在一起,有时候 10cm 和 20cm 隔得太远。
“典型值”不同:
- 人类觉得“大多数”通常指 90% 以上。
- AI 觉得“大多数”只要 50%-60% 就够了。
- 比喻:人类觉得“大多数”是“几乎全满”,AI 觉得“大多数”是“刚过半”。
语言差异:
- 令人惊讶的是,英语并不是 AI 表现最好的语言。在希腊语、俄语等其他语言中,AI 的表现并没有因为语言不同而变得像人类。
- 这说明 AI 并没有像人类那样,在不同语言里共享一套统一的“数量概念”,它们更像是为每种语言单独建了一套歪歪扭扭的标尺。
4. 为什么 AI 会这样?(深度解析)
论文认为,AI 的问题出在**“学习方式”**上:
- 统计 vs. 逻辑:人类学语言是靠理解逻辑和现实世界(比如知道“大多数”意味着超过一半)。AI 学语言是靠统计概率(比如看到“大多数”这个词,后面常跟着什么数字)。
- 缺乏“常识”:AI 可能背下了很多句子,但它没有真正理解“数量”背后的数学逻辑和人类的社会共识。
- 思考型 AI 的进步:那些会“深度思考”的模型,因为经过了专门的数学和逻辑训练,所以在数数和逻辑排序上更像人。但它们依然缺乏人类那种灵活的、模糊的语用直觉(比如什么时候该用“一些”,什么时候该用“很多”的微妙差别)。
5. 总结:这对我们意味着什么?
- AI 不是全知全能的:虽然它们能写诗、画画、写代码,但在处理像“数量”这样看似简单、实则充满人类认知细节的问题时,它们还是像个“死记硬背”的学生,而不是“融会贯通”的智者。
- 未来的方向:要让 AI 更像人,不能只让它背更多的数据,还得让它真正理解逻辑、数学和人类的社会常识。
- 多语言视角:AI 在不同语言里的表现差异,提醒我们它们可能并没有一个统一的“大脑”,而是有很多个针对特定语言的“小模块”,这限制了它们真正的通用智能。
一句话总结:
这篇论文告诉我们,AI 虽然能数清东西,但还不懂人类如何描述东西。它们心里的“数量标尺”是歪的,而且在不同语言里,这种歪法还不一样。要真正像人一样思考,AI 还有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。