← 最新论文
🤖 AI

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

该论文介绍了 UI2App,这是首个旨在评估视觉语言模型仅凭静态 UI 截图推断可执行交互行为能力的基准测试,揭示了当前模型在视觉重构能力与生成复杂的、状态连贯的 Web 应用程序能力之间存在显著差距。

原作者: Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:从“看起来”到“做起来”

想象你是一位顶级大厨。桌上放着一张精美且复杂的蛋糕照片。

  • 旧方法(文本驱动): 你要求大厨:“请根据这张照片做个蛋糕,要有三层,是巧克力味的,而且里面还要有一个隐藏按钮,按下去会喷出糖豆。” 大厨需要你用文字描述每一个细节。如果你忘了提到那个隐藏按钮,大厨就不会把它做出来。
  • 新方法(图像驱动): 你直接把照片递给大厨。大厨看一眼照片,然后尝试把它烤出来。

长期以来,AI 模型(就像故事中的“大厨”)已经非常擅长观察照片并做出一个在外观上与照片完全一致的蛋糕。它们可以完美地匹配颜色、奶油旋涡和形状。

但问题在于: 仅仅因为蛋糕看起来很真实,并不代表它真的能“运作”。

  • 那个隐藏按钮真的能喷出糖豆吗?
  • 如果切下一块,里面是巧克力的味道,还是仅仅一个空壳?
  • 如果移动其中一层,其他层还会保持连接吗?

UI2App 这篇论文指出:“我们不能只检查蛋糕‘看起来’对不对,我们需要检查蛋糕是否真的‘能用’。”

新的基准测试:UI2App

研究人员创建了一个名为 UI2App 的新测试。他们不再要求 AI 根据冗长的书面指令来构建网站,而是给 AI 一叠截图(网站的照片),并说:

“请根据这些照片,构建一个可以运行、可以点击的网站,使其行为与这些照片完全一致,而无需我们告诉你按钮是如何工作的。”

AI 必须仅通过观察图片来破解其中的“隐藏魔法”。例如,如果一张照片显示购物车里有 1 件商品,而下一张照片显示有 2 件,AI 必须意识到:“啊,一定有一个隐藏的系统在记录我添加的东西!”

四项评分报告

为了给 AI 的表现打分,研究人员不仅观察最终成品,还使用了一份包含四个部分的清单:

  1. 能否运行?(可执行性/Executability): 代码是否真的能跑通,还是会立即崩溃?这就像是在品尝蛋糕前,先检查烤箱是否插好了电。
  2. 能否跳转?(导航可达性/Navigation Reachability): 如果照片中有个“联系我们”页面,你是否真的可以通过点击链接到达那里?还是说链接是失效的?
  3. 外观是否正确?(视觉保真度/Visual Fidelity): 网站看起来是否像照片里的样子?(这是旧有的测试方式,大多数 AI 在这方面表现良好)。
  4. 行为是否正确?(交互推理得分/Interaction Inference Score - IIS): 这是最重要的全新部分。 如果你点击“加入购物车”,商品数量会增加吗?如果你登录,页面会记住你吗?这测试了 AI 是否理解了“行为”,而不仅仅是“外观”。

令人震惊的结果

研究人员测试了六个目前最顶尖的 AI 模型。以下是他们的发现:

  • “貌似”陷阱: 那个在让网站“看起来”最完美(视觉保真度最高)的模型,在让网站“运作”(交互能力)方面竟然排名第四
    • 类比: 想象一个模型用粘土造了一辆假车。它看起来完全像一辆法拉利(闪闪发光,形状完美),但如果你试图启动引擎,却什么反应也没有。它只是一个“静止的门面”。
  • “实干家”胜出: 另一个完全不同的模型,在让网站“运作”(添加商品到购物车、记住密码、切换页面)方面表现最好。
  • “记忆”难题: 对所有 AI 来说,最难的部分是跨路径状态(Cross-Route State)
    • 类比: 想象你在玩电子游戏。你在“森林”关卡捡起了一把剑。当你走到“城堡”关卡时,聪明的 AI 会记得你还带着那把剑。但在这次测试中,AI 经常会忘掉。它们构建了一个你在森林里可以捡到剑的世界,但当你走到城堡时,剑消失了,游戏表现得好像你从未捡过它一样。
    • 结果: 有一半的模型在这个特定技能上得了 零分。它们无法在你切换不同页面时追踪信息。

为什么这很重要

论文总结道:视觉保真度并不等于智能。

仅仅因为一个 AI 能画出一个完美的按钮,并不意味着它知道点击按钮后会发生什么。当前这一代的 AI 擅长成为一名艺术家(模仿外观),但在成为一名工程师(构建逻辑)方面仍处于挣扎阶段。

UI2App 基准测试是一个新的工具,旨在迫使 AI 停止仅仅“假装”,开始真正地“去做”。它强调了目前 AI 面临的最大差距不在于让事物看起来漂亮,而在于理解那些让网站产生“生命感”的隐形规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →