Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models
该研究指出,尽管多模态语言模型在词汇任务上已接近人类水平,但在需要视角转换和空间推理的指示词与所有格等“视角性词汇”的使用上,其表现远逊于人类,暴露了其在语用和社会认知能力上的显著短板。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的人工智能(AI)和人类做一场特殊的“语言体检”。
研究人员发现,虽然现在的 AI 已经能像人一样看图说话,但在一种非常微妙、充满“人情味”的语言能力上,它们还像个还没长大的孩子,甚至有点“笨手笨脚”。
为了让你更容易理解,我们可以把这篇论文的研究内容想象成三个不同难度的**“指路游戏”**:
🎮 游戏一:认名字(词汇任务)
- 场景:桌子上放着一个杯子、一艘船。
- 任务:AI 或人需要说出:“这是杯子"或“那是船"。
- 结果:
- 人类:满分。
- AI:也是满分。
- 比喻:这就像让一个刚学会走路的孩子和一位老教授去认苹果。大家都认识苹果,因为“苹果”就是苹果,不管谁在看,它都是苹果。AI 在这方面的表现已经非常完美了。
🎮 游戏二:分东西(所有格任务)
- 场景:桌子上有两把勺子。一把在“我”(说话的人)手里,一把在“你”(听话的人)手里。
- 任务:说话的人要指着一把勺子说:“这是我的"或者“那是你的"。
- 难点:这里的关键不是勺子长什么样,而是**“谁在说话”**。如果换个人说话,刚才那把勺子就从“我的”变成“你的”了。
- 结果:
- 人类:做得很好(93% 正确)。
- AI:开始犯迷糊了(最好的 AI 只有 85%)。
- 比喻:这就像玩“角色扮演”。AI 有时候会搞混“我是谁”、“你在哪”。它知道那是把勺子,但有时候忘了“现在是我在说话,所以这把勺子是我的”。它缺乏那种**“换位思考”**的直觉。
🎮 游戏三:指远近(指示词任务)
- 场景:桌子上放着四个一模一样的杯子,有的离说话的人近,有的远。
- 任务:说话的人要指着杯子说:“这是这个(离得近的)”或者“那是那个(离得远的)”。
- 难点:这不仅要看**“谁在说话”(视角),还要判断“距离有多远”**(空间感)。
- 结果:
- 人类:虽然有点难,但大部分能搞定(83%)。
- AI:彻底晕了(最好的 AI 只有 70%,很多甚至接近瞎猜)。
- 比喻:这就像让 AI 在拥挤的房间里指路。它不仅能分清“谁在说话”,还得瞬间计算出“哪个东西离说话的人最近”。这对 AI 来说太难了,它就像个**“路痴”**,明明看着很近的东西,却可能指着说“那个”,或者完全搞反了方向。
🔍 为什么 AI 会输得这么惨?
研究人员给 AI 做了“手术”(也就是消融实验),看看它到底是哪里出了问题:
它太依赖文字,不太信眼睛:
- 如果把图片里的距离提示(比如用绿框标出远近)去掉,只靠文字描述,AI 还能猜对一点。
- 但如果把文字里的距离提示去掉,只给图片,AI 就彻底懵了。
- 比喻:人类是“眼观六路,耳听八方”,眼睛和耳朵一起工作。但 AI 更像是个**“只读说明书的机器人”**,它更相信文字描述,而不是图片里真实的距离感。
它不懂“换位思考”:
- 当研究人员把“谁在说话”这个信息藏起来时,AI 的表现就直线下降。
- 比喻:人类天生知道“我是我,你是你”。但 AI 有时候像个**“失忆症患者”**,它忘了自己现在的身份,所以分不清“我的”和“你的”。
🛠️ 能教好它吗?(提示词实验)
研究人员试着用两种方法教 AI:
- 给例子(少样本学习):给它看几个做对的例子。
- 效果:一般般,甚至有的 AI 越学越差。
- 给指令(提示工程):直接告诉它:“记住!你是说话的人,离你近的是‘这个’,离你远的是‘那个’。”
- 效果:
- 对于“分东西”(我的/你的),AI 进步很大,几乎赶上人类了。
- 对于“指远近”(这个/那个),AI 虽然能分清“谁在说话”,但在判断**“距离”**上依然很笨。
- 效果:
💡 总结:这说明了什么?
这篇论文告诉我们一个残酷但有趣的事实:
- AI 很擅长“背单词”(认物体、颜色、名字)。
- AI 不擅长“懂人情”和“看位置”(分清谁是谁的,哪个近哪个远)。
核心比喻:
现在的 AI 就像一个**“超级博学的图书管理员”,它认识图书馆里所有的书(词汇),也能快速找到书的位置。但是,如果你让它“站在读者的角度”,指着书架说“这本离我最近的书是我的**",它就会卡壳。
因为它没有身体,没有在真实世界里和人互动的经历,所以它很难真正理解“这里”、“那里”、“我的”、“你的”这些词背后那种鲜活的、基于视角的体验。
未来的方向:
要想让 AI 真正像人一样交流,光靠给它读更多的书(训练数据)是不够的,可能需要让它拥有**“身体”,或者在虚拟世界里真正地去“走”和“看”**,学会像人类一样感知空间和视角。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。