← 最新论文
💻 computer science

Large Language Models for Mobile GUI Text Input Generation: An Empirical Study

本文通过对 115 个真实世界 Android 应用中的 9 个最先进的大型语言模型(LLM)进行大规模实证研究,旨在证明提取的文本和基于 XML 的 UI 上下文在实现与基于视觉的输入相当的文本输入生成成功率的同时,成本更低,且反馈机制和人工干预能显著提升页面通过率和缺陷检测能力。

原作者: Chenhui Cui, Tao Li, Junjie Wang, Chunyang Chen, Dave Towey, Rubing Huang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenhui Cui, Tao Li, Junjie Wang, Chunyang Chen, Dave Towey, Rubing Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但有点“死脑筋”的机器人如何在复杂的移动应用迷宫中导航。这个机器人非常擅长点击按钮和滑动屏幕,但一旦遇到文本框,它就会撞墙。如果机器人只是在要求输入特定城市名称的框里输入“Hello World”,应用就无法让它进入下一个页面。机器人就会卡住。

这篇论文是一项大规模实验,旨在观察大语言模型(LLMs)——即那些能写论文、答问题的同类 AI——能否充当“智能打字员”,帮助这些机器人成功地在移动应用中进行导航。研究人员测试了九种不同的顶尖 AI 模型,以观察哪一个最擅长猜测应该在移动应用中输入的正确词汇。

以下是他们研究结果的拆解,使用了简单的类比:

1. 向 AI 展示屏幕的三种方式

研究人员想知道:我们应该如何向 AI 展示应用的屏幕,以便它理解该输入什么? 他们尝试了三种不同的方法:

  • “蓝图”法 (XML): 他们给了 AI 一个包含屏幕上每个按钮和文本框的原始技术列表(就像建筑蓝图一样)。
    • 结果: 它效果很好,但很贵。读取整个蓝图需要消耗大量的“Token”(AI 用于思考的货币)。
  • “照片”法 (截图): 他们拍了一张屏幕的照片并展示给 AI,就像人类看到的一样。
    • 结果: 效果还可以,但不如文本方法好。此外,读取图片在成本方面也非常昂贵。
  • “摘要”法 (提取上下文): 他们没有给 AI 完整的蓝图或照片。相反,他们给了它一段简短的、通俗易懂的摘要:“这是一个登录界面。第一个框要求输入昵称,旁边的标签显示‘请输入姓名’。”
    • 结果: 这是赢家。 它的表现几乎和昂贵的蓝图法一样好,但成本仅为后者的极小部分。

教训: 你不需要向 AI 展示整个混乱的蓝图或照片。一个清晰、简短的关于屏幕在询问什么的摘要,是获得良好结果最有效率的方式。

2. “尝试、失败、再尝试”策略 (反馈)

有时候 AI 会猜错。研究人员问道:如果我们告诉 AI,“嘿,那不对。换个试试”,会怎样?

  • 对于跳转到下一页: 如果 AI 输入了错误的内容导致屏幕没有变化,告诉它“那是错的”有助于它纠正错误。这略微提高了成功率,但并没有显著提升。
  • 对于寻找 Bug: 在这里,反馈成为了游戏规则的改变者。寻找 Bug 就像在大海里捞针。如果 AI 尝试了一个“坏”输入但没有任何反应,告诉它“这并没有让应用崩溃”可以帮助它缩小搜索范围。通过使用这种反馈循环,AI 找到了显著更多的 Bug(成功率从约 51% 跳升至 64%)。
    • 代价: 这种“尝试、失败、再尝试”的方法非常慢且昂贵。这就像是在每次遇到死胡同时,都要雇佣一名侦探去重新调查案件一样。如果你真的需要找 Bug,它效果极佳;但对于日常测试来说,成本太高了。

3. 人类 vs. 机器

研究人员还引入了人类测试员,以观察他们与 AI 的对比情况。

  • AI 的优势: AI 速度快,可以生成数千个想法。
  • 人类的优势: 当人类查看 AI 的建议时,他们可以轻松地进行修正。
    • 如果 AI 写了一个通用的“坏”密码,人类可以将它改为一个能真正让应用崩溃的“特定”坏密码。
    • 如果 AI 猜了一个看起来没错但实际错误的城市名,人类可以根据上下文将其替换为正确的名称。
    • 结果: 当人类对 AI 的工作进行微调时,成功率飙升。在寻找 Bug 方面,经过人类微调的输入在测试用例中 100% 找到了 Bug,而 AI 只有 36%。

教训: AI 是一个优秀的“初稿”撰写者,但仍需要人类编辑来润色最终产品,尤其是在处理棘手问题时。

4. 整合一切 (真实世界测试)

最后,研究人员将他们的“智能打字员”AI 接入了 DroidBot,这是一个流行的自动化测试工具。

  • 之前: DroidBot 会在需要文本输入的屏幕上卡住,导致应用的大部分区域无法被探索。
  • 之后: 有了 AI 帮助输入正确的词汇,DroidBot 能够多探索 36% 的屏幕35% 的应用功能(Activity)。

给测试人员的总结洞察

该论文为任何使用 AI 测试应用的人提供了六条实用的建议:

  1. 不要让 Prompt 过于复杂: 一个简短的文本摘要比完整的照片或原始代码更好。
  2. 明智地使用反馈: 如果你是在猎取 Bug,请告诉 AI 它失败了。如果你只是想在应用中推进,这并不那么关键。
  3. 不要过度痴迷于哪个 AI 模型“最好”: 大多数顶尖模型的表现都差不多。请根据成本和速度来选择,而不仅仅是看排名列表。
  4. 使用混合方法: 让 AI 生成想法,但由人类(或聪明的脚本)来完善最困难的部分。
  5. 留意“关键”字段: 有些文本框比其他文本框更重要。如果 AI 在这些地方出错,整个测试就会失败。
  6. 使工具与目标匹配: 不同的指标对应不同的目标。仅仅因为 AI 能推动页面前进,并不意味着它能发现安全漏洞。

简而言之: 大语言模型是移动应用的优秀“智能打字员”。当给予它们简单的文本摘要,并且允许它们从错误中学习,或者由人类给予最后的推动时,它们的效果最为出色。这种组合可以帮助测试人员比以前更深入地探索应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →