Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery
本文表明,为视觉语言模型提供真实图像语境往往会通过引入对虚假视觉线索的敏感性而降低其在具体性和意象性词汇判断上的表现,这表明需要更好地校准视觉输入应在何时为这类任务提供信息。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在参加一场测试,需要猜测某个特定词汇的“具体性”或“可想象性”程度。例如,单词"apple(苹果)”容易想象吗?是的。单词"freedom(自由)”容易想象吗?不太容易。
现在,想象你在参加这场测试时,有人在你看到的单词旁边展示一张随机图片。
本文探讨了当现代人工智能模型(称为视觉 - 语言模型)参加这场测试时会发生什么。研究人员希望了解,向 AI 展示图片是有助于它更好地理解单词,还是图片实际上会分散它的注意力,导致它给出更差的答案。
以下是他们研究发现的简要说明,使用了简单的类比:
1. 设置:“分心的课堂”
研究人员给 AI 提供了一份单词列表,并要求它在一个“具体程度(真实/可触摸)”或“想象难易程度”的量表上对这些单词进行评分。
- 对照组:AI 仅看到单词(或看到一个空白的白色方块)。
- 测试组:AI 看到单词 加上 一张从互联网检索到的真实照片。
巨大的惊喜:
你可能会想:“如果我向 AI 展示一张‘狗’的图片,它应该更擅长知道‘狗’是一个具体的单词。”对于简单、具体的单词,AI 的表现确实尚可。
然而,对于抽象单词(如“正义”、“自由”或“自然”),图片反而让 AI 的表现变差了。
- 类比:想象一名学生正在参加数学考试。如果你在他回答"2+2 等于几?”这个问题时,递给他一张计算器的图片,他可能会答对。但如果你问他:"‘诚实’这个概念是难以想象还是容易想象?”并递给他一张日落的图片,这名学生就会感到困惑。他看着美丽的日落,会说:“哦,那非常具体和真实!”并给单词“诚实”打高分,认为它很“真实”,尽管这个词本身并非如此。这张图片就像一个大声喧哗、制造干扰的邻居,喊出了错误的答案。
2. “人类与机器人”的对比
为了确保这不仅仅是 AI 特有的怪异问题,研究人员让真实的人类参加了同样的测试。
- 结果:人类也受到了图片的轻微干扰,但他们没有崩溃。他们知道图片只是装饰。
- AI 的问题:然而,AI 将图片视为确凿的证据。它无法区分“一张狗的图片”(这证明了单词‘狗’是真实的)和“一张日落的图片”(这与单词‘自由’毫无关系)。AI 开始根据图片的内容而非单词的含义进行猜测。
3. 为什么会发生这种情况?(“内部故障”)
研究人员查看了 AI 的“大脑”(其内部数据层),以了解问题出在哪里。
- 转变:当 AI 看到真实图片时,它对单词的内部理解实际上发生了偏移。这就像 AI 的大脑突然决定:“哦,我现在在看图片,所以我应该根据我所看到的来回答,而不是根据我所读到的。”
- 敏感性:AI 对“虚假线索”变得过度敏感。这是一种委婉的说法,意指它抓住了照片中与单词毫无关系的随机细节。对于抽象单词,这导致 AI 高估了该单词的“真实”程度。
4. 解决方案:“教师的便条”
由于 AI 容易分心,研究人员尝试了一个简单的技巧。他们在提示词中添加了一条微小的指令,就像来自教师的一张便条:
“嘿,这张图片可能与单词无关。请忽略图片,仅对单词本身进行评分。”
结果:
- 这张简单的便条起到了心理过滤器的作用。它告诉 AI 停止关注那个分心的邻居,专注于测试问题。
- AI 的表现显著提高,尤其是对于那些棘手的抽象单词。虽然它没有完美地解决所有问题,但它阻止了 AI 犯下最大的错误。
总结
该论文得出结论,虽然我们通常认为给 AI 提供图片会使其更聪明,但有时图片实际上是一个陷阱。
- 对于具体事物(例如一张猫的图片有助于你识别单词“猫”),图片是有帮助的。
- 对于抽象事物(例如一张风暴的图片有助于你识别单词“和平”),图片会让 AI 感到困惑,使其依赖错误的线索。
解决方案不是停止使用图片,而是教会 AI 何时忽略它们。就像一名好学生知道何时查看图表,何时闭上眼睛思考概念一样,这些 AI 模型需要学会何时视觉上下文是一个有用的提示,而何时它仅仅是噪音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。