← 最新论文
💻 computer science

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

本文引入了一个基准测试,旨在证明多模态大语言模型在将网页截图转换为代码时表现出一种强烈的模式补全偏差,即即使它们具备识别异常的能力,也经常会用重复的 UI 模式来覆盖视觉上被扰动的元素。

原作者: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人根据你展示的照片来画画。你给了机器人一个摄像头和一组指令:“看着这张照片,画出你所看到的景象。”在计算机科学领域,这被称为“多模态”学习,即计算机同时使用它的“眼睛”(观察图像)和“大脑”(理解文本和代码)。最近,这些机器人已经变得非常擅长观察网站的截图,并编写重建该网站所需的计算机代码(HTML 和 CSS)。这就像是给机器人看一张房子的照片,然后让它瞬间写出建造这座房子的蓝图。但棘手的地方在于,机器人也非常擅长猜测模式。如果你给它们看一排完全相同的红球,然后出现了一个蓝球,它们可能会猜最后一个也是红色的,仅仅因为“红色”是它们预期的模式。这篇论文提出了一个可怕的问题:当机器人看到一个网站时,它是在真正观察像素,还是仅仅根据它认为“应该”存在的东西来进行猜测?

研究人员通过这项研究,想要测试这些顶尖的 AI 机器人是否真的在观察像素,还是仅仅根据它们认为“应该”在那里是什么而进行猜测。研究人员 Khai-Nguyen Nguyen、Oscar Chaparo 和 Antonio Mastropaolo 决定通过玩一场“找不同”的游戏来测试这一点。他们构建了一个特殊的测试,名为“Pattern2Code”。想象一个充满一叠相同卡片的网页,就像一副扑克牌。研究人员拿出一张卡片,并秘密地将其调宽了一点,或者改变了上面文字的字体大小。然后,他们将这张带有这个略微“异常”的卡片的截图展示给五个不同的 AI 模型,并要求它们为那张奇怪卡片的宽度或字体大小编写代码。陷阱在于,它们所观察到的代码显示,所有其他卡片的大小都是相同的,从而创造了一个强大的模式。

结果有点像是在看一个知道戏法却依然选择表演的魔术师。AI 模型在忽略模式方面表现得非常糟糕。当“奇怪”的卡片是一个巨大的、明显的改变(比如一张宽了 20% 的卡片)时,表现最好的 AI 也有约 69% 的概率能答对。但当变化非常细微且微妙(比如字体大小只稍微大了一点)时,模型几乎完全放弃了观察图片。相反,它们只是写下了“一切都是 100%”的代码,去匹配那个模式,尽管图片清楚地显示了不同的情况。事实上,对于细微的文本变化,模型的错误率超过了 80%,它们盲目地遵循模式,而不是根据视觉证据进行判断。

研究发现,这种“模式盲视”在图像难以看清时会变得更加严重。如果研究人员在图像上添加视觉“噪声”(比如随机的灰色方块),模型会变得更加困惑并固守于模式。他们还发现,如果那张奇怪的卡片位于一排正常卡片中间,AI 就更容易发现它;但如果它在最边缘,AI 就更有可能错过它。有趣的是,即使 AI 模型在它们的“思维过程”中确实记录下了它们看到了那张奇怪的卡片并计算出了正确的尺寸,它们也经常忽略自己的数学计算,并为了匹配模式而改变答案。这就像是机器人看到了蓝色的球,心里想道“那是蓝色的”,但随后又说:“等等,其他人都是红色的,所以我也说它是红色的吧。”

研究人员得出结论,虽然这些 AI 工具在捕捉网站大致轮廓方面非常出色,但在没有人类复核的情况下,它们无法被信任去处理极其精确的细节。细节越微妙,AI 就越有可能“幻觉”出一个并不存在的模式。这表明,目前我们应该将 AI 生成的代码视为一份草稿,需要人类仔细检查,以捕捉那些机器人过于急于忽略的小错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →