← 最新论文
🤖 AI

GEBench: Benchmarking Image Generation Models as GUI Environments

本文提出了 GEBench,这是一个用于评估图像生成模型在 GUI(图形用户界面)环境下动态交互能力与时序一致性的综合基准测试,并引入了五维评估指标 GE-Score,通过实验揭示了当前模型在长序列交互和空间定位方面的局限性。

原作者: Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxi
发布于 2026-02-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在玩一款极其逼真的“模拟人生”游戏,但这个游戏不是由程序员写死的代码组成的,而是由一个**“超级画家”**(AI 图像生成模型)实时画出来的。

你对画家说:“点一下那个设置按钮”,画家就会立刻拿起画笔,在下一秒画出一张显示“设置菜单”的新画。

这篇论文介绍了一个名为 GEBench 的“考场”,专门用来测试这些“画家”到底能不能胜任这个“模拟器”的工作。


1. 为什么要搞这个“考场”?(背景)

现在的 AI 画家(比如 Midjourney 或 DALL-E)非常厉害,你让它画“一只戴墨镜的猫”,它能画得栩栩如生。但如果让它当“游戏引擎”,情况就完全不同了:

  • 以前的考试(传统图像测试): 考的是“画得像不像”。只要画出来的猫好看、颜色对,就算及格。
  • 现在的考试(GEBench): 考的是**“逻辑和连贯性”**。如果你点了一下“播放”按钮,画家不仅要画出播放界面,还得保证界面上的进度条、按钮位置、文字内容跟上一张画一模一样,不能画着画着,按钮就“瞬移”了,或者文字变成了乱码。

简单来说:以前考的是“画功”,现在考的是“脑子(逻辑)”。


2. 这个“考场”怎么考?(任务设计)

GEBench 设计了五种不同难度的“试卷”:

  1. 单步变身(Single-step): “点一下这个,变一下那个”。考查画家对简单指令的反应。
  2. 长途旅行(Multi-step): “我要买杯咖啡”。画家不能只画一张,得连续画出:打开 App \rightarrow 选择咖啡 \rightarrow 确认订单 \rightarrow 支付成功。这考查画家的**“记性”**(能不能保证前后画面逻辑一致,不画乱)。
  3. 脑补新世界(Fiction-app): 不给参考图,直接说“画一个科幻风格的手机界面”。考查画家的**“想象力”**。
  4. 冷门挑战(Real-app): 考一些平时很少见的操作。考查画家的**“见识”**。
  5. 精准打击(Grounding): 给一个坐标点(比如屏幕中心),说“点这里”。考查画家的**“手准不准”**(能不能准确识别并操作那个位置)。

3. 怎么打分?(GE-Score 评分标准)

为了公平,研究者请来了几个“超级裁判”(更高级的 AI 模型)来打分。评分不是只看好不好看,而是从五个维度看:

  • 目标达成度(Goal): 你让它点“确定”,它有没有真的跳到“确定”页面?
  • 逻辑合理性(Logic): 动作是不是符合常理?(不能点个开关,整个屏幕突然变色了)。
  • 一致性(Consistency): 没变动的地方,能不能保持原样?(不能点个按钮,背景里的头像就变了)。
  • UI 合理性(UI): 画出来的按钮、图标像不像真的软件?(不能画出一些奇形怪状、没法用的东西)。
  • 视觉质量(Quality): 画得清不清晰?文字能不能看清?

4. 考试结果如何?(研究发现)

研究人员把市面上最强的 AI 画家都请来考了一遍,发现了一些很有趣的现象:

  • “偏科生”严重: 很多画家在“单步变身”时表现得像大师,但一旦进入“长途旅行”(多步操作),就会开始**“间歇性失忆”**。画着画着,逻辑就断了,或者画面开始“漂移”。
  • “手残党”与“错别字”: 很多画家在处理精确坐标时非常笨拙(手不准);而且在画文字图标时,经常会出现乱码或者把图标画得面目全非。

总结

这篇论文就像是为 AI 界的“游戏引擎”制定了一套严格的职业资格考试标准。它告诉我们:想要让 AI 真正成为我们可以使用的“虚拟世界”,光有“画功”是不够的,它们还需要更强的逻辑思维、空间感知能力和记忆力

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →