← 最新论文
💬 NLP

LaViSA: A Language and Vision Structural Ambiguity Benchmark

本文介绍了 LaViSA,这是一个包含七个类别中的歧义句子及其对应消歧图像的基准测试,旨在评估视觉语言模型解决结构歧义的能力,并揭示了尽管当前模型展现出一定的能力,但仍难以应对特定的歧义类型和细微的视觉差异。

原作者: Lee Sangmyeong, Shun Inadumi, Koichiro Yoshino

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Lee Sangmyeong, Shun Inadumi, Koichiro Yoshino

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一张马和鸟的照片。这时有人递给你一张便条,上面写着:“一匹马和一只在飞的鸟。

现在,停下来思考一下。这到底是什么意思?

  • 解释 A: 马在飞,鸟也在飞。
  • 解释 B: 马站在地上,只有鸟在飞。

这就是语言学家所说的结构歧义(structural ambiguity)。这个句子是一个有两个有效解的谜题,在没有更多线索的情况下,你无法知道哪一个是正确的。人类非常擅长处理这种情况;如果我们看到的图片中马正站在地上,我们的脑海会瞬间选择解释 B。

但人工智能也能做到吗?这正是这篇名为 LaViSA 的论文试图回答的问题。

问题所在:AI 的“盲点”

作者创建了一个新的测试集,称为 LaViSA(语言与视觉结构歧义)。你可以把它想象成一个 AI 模型的“健身房”,让它们同时练习眼睛(视觉)和耳朵(语言)。

在这个健身房里,AI 会得到:

  1. 一个棘手的句子(比如马和鸟的例子)。
  2. 一张能够澄清含义的图片。
  3. 一个关于该句子可能含义的多选题列表。

AI 的任务是观察图片,阅读句子,并选出正确的含义。这就像是在玩一场“猜故事”的游戏,而图片是唯一的提示。

实验:谁通过了测试?

研究人员测试了各种各样的 AI 模型,从那些超级聪明、昂贵的“专有型”模型(如最新的 GPT 和 Gemini 版本),到免费的开源模型。

以下是他们的发现,使用了简单的类比:

  • “聪明”的模型(专有型): 这些模型就像努力学习的学生。它们通常表现得非常好,尤其是在处理“简单”谜题时。例如,如果句子涉及的是关于某个物体是如何“连接/附着”在一起的(比如“那个男孩用哨子叫那个女孩”),它们通常能通过观察图片判断出是男孩还是女孩拿着哨子。
  • “挣扎”的模型(开源型): 一些较小的开源模型就像是学习不足的学生。它们经常表现得像是在随机猜测,或者感到困惑,尤其是在图片是卡通画而非真实照片时。
  • “思考型”的模型: 研究人员还测试了那些旨在“先思考再回答”的模型(就像一个会写出解题步骤的学生)。令人惊讶的是,这些模型并不总是比标准模型做得更好。有时,过度思考反而会将它们带入错误的路径。

核心揭示:AI 在哪里卡壳了

虽然 AI 模型正在进步,但它们仍有一个主要的盲点。论文发现,AI 擅长识别“物体”,却极其不擅长理解“关系”。

想象一个场景,里面有一个女孩、一台笔记本电脑、一支钢笔和一本书。

  • 句子: “女孩拿着笔记本电脑,或者拿着钢笔和书。”
  • 陷阱: 在图片中,女孩拿着钢笔和书。笔记本电脑只是静静地放在附近的架子上。
  • AI 的错误: 因为笔记本电脑在视觉上是“存在”的(它就在照片里),AI 会被分散注意力。它会想:“哦,笔记本电脑在图片里,所以女孩一定也拿着它!”它未能理解“拿着”是一个特定的动作,而不只是“靠近”。

论文将此称为对**并列范围(Conjunction Scope,即词语的组合方式)省略(Ellipsis,即省略部分词汇)**的处理难题。

  • 并列范围: 当句子中出现“或(or)”和“和(and)”时,AI 无法理清哪些物品属于哪种动作。
  • 省略: 如果句子说“狮子吃鸡。还有猫”,AI 会难以判断这只猫是在“吃”那只鸡,还是仅仅“被吃”。它会被视觉细节迷惑,从而忽略了语法逻辑。

结论

论文得出结论:视觉场景是帮助 AI 理解语言的强大工具。当图片清晰时,AI 通常可以解开谜题。

然而,目前的 AI 仍然像是一个只能识别地标却不了解当地文化的游客。它看到了图片中的物体,但往往无法将这些物体与句子中的正确“故事”联系起来。它很难理解:“仅仅因为物体出现在画面中,并不意味着它正在执行句子所描述的动作。”

作者构建这个基准测试,是为了向我们展示这些 AI 模型究竟在哪些地方失败,以便未来的研究人员可以教导它们去观察得比表面现象更深。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →