← 最新论文
🤖 AI

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

本文介绍了 EvoGUI,这是一个通过从归一化轨迹中提取视觉问答探针,来评估 GUI 智能体状态转移理解能力的诊断基准测试,揭示了显著的性能差距以及模型规模与这一特定能力之间缺乏相关性。

原作者: Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何玩电子游戏。你不仅希望机器人能赢得最终关卡,你还想知道它是否真的理解了当你按下按钮时游戏世界是如何变化的。它知道点击“开始”按钮会让菜单出现吗?还是它只是猜测菜单可能在那里,因为它看起来像个菜单?这就是“GUI智能体”(GUI agents)的核心——这些计算机程序像人类一样与屏幕交互,进行点击、打字和滚动以完成任务。长期以来,科学家们通过测试机器人能否完成整个任务(例如“预订机票”)来测试它们。但如果机器人失败了,很难判断它是迷路了、无法读取文本,还是仅仅不理解点击按钮会改变屏幕。我们需要一种方法来测试机器人是否真正理解了其行为的“因果关系”,而不仅仅是靠运气在最后阶段获胜。

于是有了 EvoGUI,由清华大学研究人员开发的一种全新的诊断工具。你可以把它看作是针对 AI 的“状态转移”考试。EvoGUI 不再要求 AI 完成复杂的任务,而是将旅程分解成微小的、易于处理的谜题。它提取一段人类浏览网站的历史记录,并将其转化为三种类型的问题:“首先发生了什么?”(排序)、“什么动作导致了这种变化?”(预测动作)以及“接下来的两个屏幕中,哪一个是正确的?”(预测未来)。研究人员在这一新基准测试上测试了 28 种不同的 AI 模型。他们发现,即使是最聪明的模型,在理解屏幕如何演变方面仍然表现挣扎。表现最好的模型仅比随机猜测高出了约 60% 的“加分”点,这证明了虽然 AI 在视觉和语言能力上正在进步,但在理解点击屏幕后界面如何变化方面,仍有很长的路要走。

问题所在:成功的“黑盒”

想象一下,你正在看一位魔术师从帽子里变出一只兔子。如果戏法成功了,你会鼓掌。但如果戏法失败了,你不知道是因为兔子太重了,还是帽子太小了,或者魔术师忘了念咒语。这正是目前测试 AI 智能体的典型问题。大多数基准测试衡量的是“端到端成功率”——即 AI 是否完成了任务?如果它失败了,我们不知道为什么。是因为它没看到按钮?是因为它读不懂文本?还是因为它不理解点击该按钮实际上会改变屏幕?

这篇论文背后的研究人员认为,我们应该停止仅仅观察最后的表演,而应该开始测试魔术本身的机械原理。他们想要一种能够隔离出特定技能——即状态转移理解能力(state-transition understanding)的方法:即预测在执行一个动作后,界面会发生何种变化的能力。

解决方案:将历史转化为测验

由杨耀翰(Yaohan Yang)和施明磊(Minglei Shi)领导的团队创建了 EvoGUI。他们没有要求 AI 去执行一项新任务,而是利用现有的、记录了人类浏览网站的过程的数据集(如 Mind2Web 和 WebLINX),将其转化成了一场多项选择测验。他们不需要雇佣人类来编写新问题,只需利用计算机自身记录的行为日志即可。

他们将“理解”这项技能分解为三个有趣且截然不同的游戏:

  1. 时空穿越谜题(时间顺序):
    想象你拥有故事中的三张照片,但它们被打乱了。一张显示空白页面,一张显示正在填写表单,一张显示“成功”消息。AI 必须按正确顺序排列它们:1, 2, 3。这测试了 AI 是否理解时间流向和逻辑。

  2. 侦探游戏(逆向动作/数值预测):
    AI 会看到一张“之前”的照片和一张“之后”的照片。它必须猜出人类做了什么。他们是点击了一个按钮?还是输入了一个名字?如果他们输入了内容,具体输入了什么?这测试了 AI 能否通过观察变化来推断出具体的诱因。

  3. “下一步”猜谜(单步可达性):
    AI 看到一个初始屏幕和两个可能的“下一步”屏幕(候选 A 和 候选 B)。其中一个是人类实际采取的真实步骤;另一个是看起来很相似但并未发生的虚假选项。AI 必须选出正确的一个。这是最难的部分,因为虚假选项通常非常具有迷惑性——它们可能是稍后才会出现的屏幕,只是现在还没到。

结果:AI 仍在学习基本功

研究人员测试了 28 种不同的 AI 模型,涵盖了从开源巨头到闭源商业超级模型的各种类型。他们使用了一个名为 EvoGain 的特殊分数,来衡量 AI 比随机猜测好多少。

这里有一个巨大的惊喜:AI 的表现并没有我们想象中那么好。

  • 表现最佳者: 表现最好的模型 Gemini-1.5-Flash-Preview 达到了 60.4% 的 EvoGain。虽然这听起来很高,但这意味着模型在约 40% 的问题上仍然出错。这并不是一个“已解决”的问题;仍有巨大的提升空间。
  • 规模并不重要: 你可能会认为规模更大、更昂贵的 AI 会表现得更好。论文表明事实并非如此。一些拥有数千亿参数的庞大模型,其得分甚至低于一些较小的专业化模型。仅仅“大”并不意味着它理解屏幕是如何变化的。
  • 专家 vs 通才: 即使是专门为 GUI 任务设计的模型(如 UI-TARS)也没有统治排行榜。这表明,仅仅通过“如何使用电脑”来进行训练是不够的;AI 需要深度理解界面的动态机制

为什么这很重要

论文指出,我们一直高估了 AI 理解数字环境的能力。仅仅因为 AI 能完成一项任务,并不意味着它理解为什么能成功。它可能只是猜中了正确的路径。

通过使用 EvoGUI,研究人员现在可以精准定位 AI 在哪里失败。它是由于不擅长排列事件顺序?还是无法读取它所输入的文本?或者是被相似的屏幕搞混了?这个诊断工具就像医生的听诊器,通过倾听 AI 的“心跳”来寻找具体的弱点,而不是仅仅在一天结束时检查病人是否还活着。

简而言之,虽然 AI 智能体正在变得越来越聪明,但它们仍在学习数字世界中关于因果关系的常识。它们能看到屏幕,但还不确定在触摸屏幕时,屏幕会发生怎样的变化。通往真正理解型 AI 智能体的旅程才刚刚开始。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →