✨ 要点🔬 技术摘要
在人工智能领域,出现了一类被称为多模态大语言模型的系统。这些数字大脑能够观察图像并阅读文本,然后将这两种感官结合起来回答关于世界的问题。它们在描述照片或根据图片解决谜题方面已经变得非常出色。然而,就像人类一样,这些系统也并非不会产生困惑。它们有时会被所见之物所迷惑,或者更准确地说,被它们对所见之物的解读所误导。这种困惑的一个经典案例来自于著名的心理学测试——斯特鲁普效应(Stroop effect)。在该测试中,一个人会看到一个印有“RED”(红色)字样的蓝色墨水单词。如果要求其说出墨水的颜色,人类的大脑往往会卡壳,因为大脑会自动读出“RED”这个词,从而无法专注于蓝色的视觉颜色。大脑必须努力忽略单词的含义,而仅仅专注于视觉颜色。多年来,科学家们一直想知道这些先进的计算机模型在观察图像时是否也会遭受类似的心理故障。
来自中国北航的研究团队决定通过一项专门为机器设计的全新实验来验证这个问题。他们创建了一个名为“文字是什么颜色”的基准测试,向计算机呈现一张简单但具有欺骗性的图像。研究人员没有在单独的文本框中向计算机提问,而是直接将问题写在图像本身上。想象一个白色的正方形,上面用黑色墨水写着“What color is the text?”(文字是什么颜色?)。在同一张图像内部,还有另一个单词,例如“BLUE”(蓝色),但这个单词是用红色的墨水印刷的。计算机被要求识别用于书写“BLUE”一词的墨水颜色。挑战在于,计算机必须忽略“BLUE”这个单词的含义,并报告其墨水实际上是红色的。这种设置迫使机器在“文字所言”与“眼睛所见”之间做出选择。
当研究人员将这项测试应用于十六种不同的各种人工智能模型(涵盖了从开源项目到强大的商业系统)时,结果令人震惊。机器失败的次数远多于成功的次数。事实上,当问题被嵌入到图片中时,模型经常忽略实际的墨水颜色,而仅仅回答文本中所提到的颜色。例如,如果单词“GREEN”(绿色)是用紫色墨水书写的,模型会自信地回答“green”。尽管如果问题是在单独的文本框中提出时,这些模型能够正确识别颜色,但在问题嵌入图像时却发生了这种情况。研究发现,这种机器被单词含义分散注意力而非关注视觉现实的特定错误,在大量的尝试中频繁发生。在某些情况下,模型犯下的错误中有超过一半是由于这种特定的困惑造成的,即它们优先考虑了文本而非颜色。
研究人员想要确保这不仅仅是模型普遍不擅长命名颜色的情况。为了检查这一点,他们查看了一组图像,在这些图像中,当问题在单独提出时,模型此前曾成功正确地命名过颜色。即使模型知道颜色名称,当问题嵌入在图像中时,它们仍然掉入了陷阱。这证明了问题不在于缺乏词汇量或简单的无法辨识颜色,而是一个更深层次的问题:机器阅读文本的能力压倒了其观察视觉细节的能力。研究还测试了如果让文字变得难以辨认会发生什么。当他们将图像倒置或用黑色色块遮住部分单词时,模型的错误减少了。这表明,困惑源于机器清晰读取单词语义的能力。当文字变得模糊或被遮挡时,机器更多地依赖视觉颜色,其表现也随之提高。
尽管有这些发现,研究人员指出,仅仅通过告诉机器“要保持注意力”并不能轻易解决这个问题。他们尝试给模型提供特殊的指令以警告其注意陷격을,虽然这减少了模型落入文本陷阱的次数,但并没有让它们在实际观察正确颜色方面变得更好。模型只是开始犯下其他类型的错误。研究结论认为,当前的人工智能系统存在一个根本性的弱点:当视觉信息与文本发生冲突时,文本往往占据上风。这表明这些模型并不是像人类那样真正地在“观察”世界,而是深受它们所学习到的语言模式的影响。随着这些系统被部署到现实世界的场景中,例如阅读路标或在复杂环境中识别物体,这种信任文本而非视觉的倾向可能会导致不可靠的决策。这项工作发出了一个明确的警告:为了使这些机器变得真正鲁棒,它们需要学会如何平衡“所读”与“所见”,而不是让其中一种感官完全主导另一种。
技术摘要:文本是什么颜色?一个针对图像嵌入提示诱发幻觉的基准测试
1. 问题定义
多模态大语言模型(MLLMs)在对齐视觉感知与语言推理方面展现出了显著的能力。然而,它们的可靠性经常受到幻觉的影响,即输出结果偏离了视觉现实。虽然现有的研究主要将这些失败归因于跨模态失配 (外部文本提示与视觉内容之间的冲突),但本文识别了一个更隐蔽的挑战:模态内语义干扰 。
核心问题在于“嵌入式斯特鲁普(Embedded Stroop)”效应:当查询本身直接渲染在视觉输入内部时,会发生什么?在这种统一的模态中,语义内容(查询的文本)与视觉属性(墨水颜色)在像素空间中并存。本文认为,当前的 MLLM 可能会优先读取嵌入文本的语义内容,而非感知其真实的视觉颜色,从而导致系统性的幻觉,而标准的、解耦的评估协议无法揭示这一现象。
2. 方法论:WCIT 基准测试
为了隔离并测量这种干扰,作者引入了**“文本是什么颜色”(What-Color-Is-the-Text, WCIT)**基准测试。
数据集构建
色彩调色板: 从专门的库中精选了 59 种细粒度的颜色。
过滤机制: 基于 Δ E 00 \Delta E_{00} Δ E 00 (CIEDE2000) 的流水线过滤掉了低对比度颜色、近黑色调和复合名称,以确保感知上的显著区别。
刺激物生成: 样本由白色背景和三个组件组成:
嵌入式查询: 以黑色渲染的指令“What color is the text?”(文本是什么颜色?)。
目标刺激物: 代表一种颜色的单词(例如“RED”),以冲突的物理颜色(例如蓝色墨水)进行渲染。
变体: 该基准包含三种主要条件,以测试该效应的鲁棒性:
标准斯特鲁普(对照组): 查询通过文本提示提供,而图像中仅包含冲突的刺激物。
嵌入式斯特鲁普(主要组): 查询与刺激物一起视觉化地嵌入在图像中。
对抗性变体: 包括翻转 (空间反转文本)和遮蔽 (遮挡文本)版本,以测试破坏语义可读性是否能减轻幻觉。
控制组: 将冲突的颜色单词替换为语义中性的词汇,以隔离视觉识别与语义干扰。
评估框架
作者提出了三向误差分解法 ,以区分一般的感知失败与特定的语义捕获:
准确率 (Acc): 正确识别视觉颜色。
斯特鲁普幻觉率 (SHR): 错误地回答出语义文本的颜色(单词的含义)而非视觉颜色。
其他错误率 (OER): 预测出的颜色既不是视觉目标也不是语义目标(一般的命名失败)。
此外,引入了斯特鲁普干扰率 (SIR) 来衡量错误响应中属于斯特鲁普幻觉的部分,从而区分语义捕获与随机猜测。
实验设置
模型: 评估了 16 个 MLLM,包括闭源系统(如 GPT-5, GPT-4o, Gemini 2.5/3)和开源架构(如 Qwen3-VL, InternVL, DeepSeek-VL, Gemma-3)。
指标: 评估涉及置换检验(5,000 次洗牌)以及针对在标准设置下表现正确的样本进行的条件分析。
3. 关键结果
评估揭示了包括闭源和开源模型在内的广泛脆弱性:
高幻觉率: 在嵌入式斯特鲁普条件下,模型表现出 SHR 的显著激增。例如,Gemma-3-12B 的 SHR 达到了 78.5% ,Qianfan-VL-8B 达到了 83.5% 。相比之下,标准斯特鲁普设置(文本提示)下的 SHR 较低(通常 <15%),证实了幻觉是由查询的视觉嵌入驱动的,而非问题的语义内容。
语义捕获占主导地位: 三向分解显示,对于许多模型而言,错误并非随机产生的。在 64 个模型难度条件下(经过 FDR 校正后),SIR 显著高于随机基准线(1.7%)。对于某些模型(如 Kimi-VL-A3B),几乎所有的错误(SIR ≈ \approx ≈ 91%)都是斯特鲁普幻觉。
条件分析: 即使在将分析限制在标准设置下能正确识别颜色的样本时,聚合条件 SHR 仍然维持在高位,为 51.9% (95% CI: [35.4%, 66.8%])。这证实了该效应不仅仅是由于无法命名颜色,而是一种特定的、无法抑制语义处理(当其与视觉感知冲突时)的失败。
粗粒度感知: 当将 59 种细粒度颜色映射到 11 种基础色系时,模型保留了粗粒度颜色感知能力(38.4% 的准确率),但仍表现出实质性的 SHR(21.6%)。这表明即使消除了词汇不匹配,语义捕获依然存在。
通过破坏实现缓解: 破坏语义可读性可以显著降低幻觉。翻转 或遮蔽 嵌入文本(例如 25% 的遮挡)导致准确率大幅回升且 SHR 降低,这表明该效应依赖于语义文本的可读性。
4. 核心贡献
WCIT 基准测试: 一个受控的诊断工具,通过将查询直接嵌入视觉输入,实现了视觉与语义优先级排序的统一模态评估。
误差分解框架: 一种新型方法,通过置换检验和条件分析,将正确的感知、特定的斯特鲁普语义捕获以及一般的命名失败区分开来。
条件验证: 证明了斯特鲁普效应是一种真实的干扰现象,而非由于模型颜色命名能力较差而产生的伪影,这由在标准设置下表现良好的模型中极高的条件 SHR 所证实。
广泛评估: 对 16 个模型进行了系统测试,揭示了对抗性扰动(翻转/遮蔽)可以抑制幻觉,且对抗性感知提示可以将 SHR 降低高达 91%(尽管这主要是将错误重新分配到了 OER,而非提高视觉准确率)。
5. 重要性与主张
本文声称,当前的 MLLM 在面对冲突存在于视觉模态内部时,并未真正克服斯特鲁普效应。研究结果表明,存在一种持久的对文本的盲目信任 ,即“视觉化的文本”充当了一种超刺激,覆盖了视觉感知。
模态内失败: 本研究挑战了幻觉主要是跨模态的普遍观点。它证明了感知失败可以源于严格存在于视觉模态内部的冲突。
安全影响: 对嵌入式斯特鲁普干扰的易感性凸显了潜在的安全隐患。在涉及冲突文本信息的现实场景中(例如误导性的路牌或矛盾的标签),MLLM 可能会因为优先考虑文本而非视觉证据而做出不可靠的判断。
局限性: 作者谦虚地指出,该基准测试使用了合成图像和英文文本。他们承认 59 种细粒度调色板引入了词汇不匹配,但其粗粒度分析试图缓解这一问题。他们还强调,虽然基于提示的干预可以减少语义捕获,但并不能完全解决底层的视觉感知挑战。
总之,WCIT 提供了一个针对性的压力测试,揭示了 MLLM 在解构视觉属性与嵌入语义内容方面存在的根本差距,敦促未来的研究向更鲁棒的多模态对齐迈进。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。