研究人员通过这项研究,想要测试这些顶尖的 AI 机器人是否真的在观察像素,还是仅仅根据它们认为“应该”在那里是什么而进行猜测。研究人员 Khai-Nguyen Nguyen、Oscar Chaparo 和 Antonio Mastropaolo 决定通过玩一场“找不同”的游戏来测试这一点。他们构建了一个特殊的测试,名为“Pattern2Code”。想象一个充满一叠相同卡片的网页,就像一副扑克牌。研究人员拿出一张卡片,并秘密地将其调宽了一点,或者改变了上面文字的字体大小。然后,他们将这张带有这个略微“异常”的卡片的截图展示给五个不同的 AI 模型,并要求它们为那张奇怪卡片的宽度或字体大小编写代码。陷阱在于,它们所观察到的代码显示,所有其他卡片的大小都是相同的,从而创造了一个强大的模式。
结果有点像是在看一个知道戏法却依然选择表演的魔术师。AI 模型在忽略模式方面表现得非常糟糕。当“奇怪”的卡片是一个巨大的、明显的改变(比如一张宽了 20% 的卡片)时,表现最好的 AI 也有约 69% 的概率能答对。但当变化非常细微且微妙(比如字体大小只稍微大了一点)时,模型几乎完全放弃了观察图片。相反,它们只是写下了“一切都是 100%”的代码,去匹配那个模式,尽管图片清楚地显示了不同的情况。事实上,对于细微的文本变化,模型的错误率超过了 80%,它们盲目地遵循模式,而不是根据视觉证据进行判断。
研究发现,这种“模式盲视”在图像难以看清时会变得更加严重。如果研究人员在图像上添加视觉“噪声”(比如随机的灰色方块),模型会变得更加困惑并固守于模式。他们还发现,如果那张奇怪的卡片位于一排正常卡片中间,AI 就更容易发现它;但如果它在最边缘,AI 就更有可能错过它。有趣的是,即使 AI 模型在它们的“思维过程”中确实记录下了它们看到了那张奇怪的卡片并计算出了正确的尺寸,它们也经常忽略自己的数学计算,并为了匹配模式而改变答案。这就像是机器人看到了蓝色的球,心里想道“那是蓝色的”,但随后又说:“等等,其他人都是红色的,所以我也说它是红色的吧。”
研究人员得出结论,虽然这些 AI 工具在捕捉网站大致轮廓方面非常出色,但在没有人类复核的情况下,它们无法被信任去处理极其精确的细节。细节越微妙,AI 就越有可能“幻觉”出一个并不存在的模式。这表明,目前我们应该将 AI 生成的代码视为一份草稿,需要人类仔细检查,以捕捉那些机器人过于急于忽略的小错误。
技术摘要:模式优于像素:衡量多模态代码生成中的模式补全偏差
问题陈述
多模态大语言模型(MLLMs)正越来越多地被用于将网页截图转化为可执行的前端代码。虽然这些系统在生成全局合理的 HTML 和 CSS 方面表现出强大的能力,但本文识别出了一种特定的失效模式:视觉模式补全偏差(visual pattern-completion bias)。