← 最新论文
💻 computer science

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

本文介绍了“嵌入式斯特鲁普”(Embedded Stroop)基准测试和“文本是什么颜色”(What-Color-Is-the-Text, WCIT)数据集,旨在证明多模态大语言模型频繁遭受“斯特鲁普幻觉”(Stroop hallucinations)的影响,即它们会错误地根据图像中嵌入文本的语义含义而非文本的实际颜色进行回答,从而揭示了语义可读性可能会覆盖视觉颜色感知。

原作者: Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,出现了一类被称为多模态大语言模型的系统。这些数字大脑能够观察图像并阅读文本,然后将这两种感官结合起来回答关于世界的问题。它们在描述照片或根据图片解决谜题方面已经变得非常出色。然而,就像人类一样,这些系统也并非不会产生困惑。它们有时会被所见之物所迷惑,或者更准确地说,被它们对所见之物的解读所误导。这种困惑的一个经典案例来自于著名的心理学测试——斯特鲁普效应(Stroop effect)。在该测试中,一个人会看到一个印有“RED”(红色)字样的蓝色墨水单词。如果要求其说出墨水的颜色,人类的大脑往往会卡壳,因为大脑会自动读出“RED”这个词,从而无法专注于蓝色的视觉颜色。大脑必须努力忽略单词的含义,而仅仅专注于视觉颜色。多年来,科学家们一直想知道这些先进的计算机模型在观察图像时是否也会遭受类似的心理故障。

来自中国北航的研究团队决定通过一项专门为机器设计的全新实验来验证这个问题。他们创建了一个名为“文字是什么颜色”的基准测试,向计算机呈现一张简单但具有欺骗性的图像。研究人员没有在单独的文本框中向计算机提问,而是直接将问题写在图像本身上。想象一个白色的正方形,上面用黑色墨水写着“What color is the text?”(文字是什么颜色?)。在同一张图像内部,还有另一个单词,例如“BLUE”(蓝色),但这个单词是用红色的墨水印刷的。计算机被要求识别用于书写“BLUE”一词的墨水颜色。挑战在于,计算机必须忽略“BLUE”这个单词的含义,并报告其墨水实际上是红色的。这种设置迫使机器在“文字所言”与“眼睛所见”之间做出选择。

当研究人员将这项测试应用于十六种不同的各种人工智能模型(涵盖了从开源项目到强大的商业系统)时,结果令人震惊。机器失败的次数远多于成功的次数。事实上,当问题被嵌入到图片中时,模型经常忽略实际的墨水颜色,而仅仅回答文本中所提到的颜色。例如,如果单词“GREEN”(绿色)是用紫色墨水书写的,模型会自信地回答“green”。尽管如果问题是在单独的文本框中提出时,这些模型能够正确识别颜色,但在问题嵌入图像时却发生了这种情况。研究发现,这种机器被单词含义分散注意力而非关注视觉现实的特定错误,在大量的尝试中频繁发生。在某些情况下,模型犯下的错误中有超过一半是由于这种特定的困惑造成的,即它们优先考虑了文本而非颜色。

研究人员想要确保这不仅仅是模型普遍不擅长命名颜色的情况。为了检查这一点,他们查看了一组图像,在这些图像中,当问题在单独提出时,模型此前曾成功正确地命名过颜色。即使模型知道颜色名称,当问题嵌入在图像中时,它们仍然掉入了陷阱。这证明了问题不在于缺乏词汇量或简单的无法辨识颜色,而是一个更深层次的问题:机器阅读文本的能力压倒了其观察视觉细节的能力。研究还测试了如果让文字变得难以辨认会发生什么。当他们将图像倒置或用黑色色块遮住部分单词时,模型的错误减少了。这表明,困惑源于机器清晰读取单词语义的能力。当文字变得模糊或被遮挡时,机器更多地依赖视觉颜色,其表现也随之提高。

尽管有这些发现,研究人员指出,仅仅通过告诉机器“要保持注意力”并不能轻易解决这个问题。他们尝试给模型提供特殊的指令以警告其注意陷격을,虽然这减少了模型落入文本陷阱的次数,但并没有让它们在实际观察正确颜色方面变得更好。模型只是开始犯下其他类型的错误。研究结论认为,当前的人工智能系统存在一个根本性的弱点:当视觉信息与文本发生冲突时,文本往往占据上风。这表明这些模型并不是像人类那样真正地在“观察”世界,而是深受它们所学习到的语言模式的影响。随着这些系统被部署到现实世界的场景中,例如阅读路标或在复杂环境中识别物体,这种信任文本而非视觉的倾向可能会导致不可靠的决策。这项工作发出了一个明确的警告:为了使这些机器变得真正鲁棒,它们需要学会如何平衡“所读”与“所见”,而不是让其中一种感官完全主导另一种。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →