← 最新论文
💻 computer science

Autonomous AI and Agentic Testing Agents: A Multi-Agent Architecture for Self-Directed Software Quality Assurance

本文提出了一种利用大语言模型驱动的自主智能体来实现多智能体架构的方法,通过自动化测试生成、执行、自愈和缺陷分拣,并从历史结果中持续学习,以解决传统脚本测试的局限性,从而实现自我导向的软件质量保证。

原作者: Urvish Gajjar

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Urvish Gajjar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将软件测试想象成一场在不断变化的游乐场上进行的、高风险的、大规模的“西蒙说”游戏。传统上,人类测试员会编写一个严格的脚本:“点击蓝色按钮,然后输入‘Hello’”。如果开发人员将按钮从蓝色改为红色,或者将其向左移动了两英寸,脚本就会失效,整个游戏就会停滞,直到有人来修复它。这既缓慢、脆弱,又令人沮丧。

本论文提出了一种新的玩法:自主 AI 测试团队。

他们并没有采用单一的僵化脚本,而是构建了一个数字“智能体”(专门的 AI 员工)团队,这些智能体能够思考、规划并随时进行调整。以下是他们如何使用简单的概念和类比来解释这个系统的:

1. 问题所在:“脆弱的脚本”

把传统的软件测试想象成一段记录在录像带上的舞蹈编排。如果舞者(软件)换了鞋或者改变了音乐节奏,录像带并不知道如何调整。它只会继续播放旧的动作,结果被新鞋绊倒,导致整个表演崩溃。在现代软件领域,这种情况经常发生,因为应用程序每天都在变化。

2. 解决方案:一支专业化的智能体团队

作者建议用一个现场智能制作团队来取代单一的录像带。他们没有让一个人完成所有工作,而是创建了一个分层团队,每个成员都有特定的职责:

  • 眼睛(感知智能体): 这些智能体不断观察应用程序。一个观察视觉屏幕(就像人类看网页一样),另一个监听数据流(API),还有一个阅读需求文档(就像项目经理阅读待办事项列表)。它们将看到的内容转化为团队能理解的语言。
  • 大脑(推理核心): 这是项目经理。它接收来自“眼睛”的“待办事项清单”和“外观描述”,然后制定计划。它会思考:“我们要测试什么?我们以前做过类似的事情吗?”它将大目标分解为小的步骤。
  • 双手(执行智能体): 这些是实际执行点击按钮、输入文本和发送数据的工人。它们遵循“大脑”制定的计划。
  • 机械师(自愈智能体): 这是神奇的部分。如果“双手”尝试点击一个按钮却发现它不见了(因为开发人员移动了位置),传统的脚本会大喊“错误!”并停止运行。而自愈智能体会像修理工一样介入。它会说:“等等,我看到原来的蓝色按钮现在变成红色的了。让我试着点击那个试试。”如果成功了,它会记住新的位置,以备下次使用。
  • 侦探(根因智能体): 如果仍然出现故障,这个智能体会进行调查。它会查看日志和历史记录,以判断:“这是一个真实的应用程序 Bug?还是仅仅因为网络变慢了?或者是测试本身不稳定?”它负责区分噪音与真正的故障。

3. 它们如何协同工作:“反馈循环”

论文描述了一个持续的循环,就像一个智能工厂的流水线

  1. 摄取: 团队读取一个新的需求(例如,“用户需要登录”)。
  2. 规划: “大脑”将此分解为若干步骤。
  3. 行动: “双手”尝试执行。
  4. 修复: 如果某一步骤因为按钮移动而失败,“机械师”会立即进行修复。
  5. 学习: 如果发现了 Bug,“侦探”会查明原因。
  6. 记忆: 至关重要的一点是,整个团队会将发生的情况写入一个共享记忆库。下次面对类似问题时,他们不会从零开始;他们会回忆之前奏效的方法。

4. 试点测试:现实情况如何?

作者在一个真实的网站和一个内部数据服务上测试了这个系统。以下是他们的发现:

  • 编写测试: 在面对 35 个新需求时,AI 为所有需求编写了测试初稿。工程师只需进行微小的调整,从而节省了大量时间。
  • 修复损坏的测试: 当网站更改设计时,有 46 个旧测试失效了。AI 的“机械师”通过寻找新按钮,成功自动修复了其中的 39 个。
  • 判断何时停止: 对于那 7 个由于过于严重而无法自动修复的测试(例如整个菜单消失了),AI 能够明智地表示:“我无法安全地修复这个;需要人类介入。”它没有瞎猜,而是寻求帮助。
  • 过滤噪音: 系统正确识别了失败是属于真实 Bug 还是仅仅是暂时的故障,其判断结果在大多数情况下与人类专家的意见一致。

5. 缺陷:它尚不完美

论文坦诚地说明了局限性。

  • “预言机”问题: AI 可能会表现得很有信心但实际上是错误的。如果指令含糊不清,AI 可能会创造出一个看起来很好,但实际上并未测试业务所需内容的测试。
  • 不可预测性: 有时,AI 每次编写的测试可能会略有不同,这可能会导致追踪变更时产生困扰。
  • 信任问题: 在关键场景中(如医疗或银行业务),人类仍然需要在让 AI 全权处理之前,对其决策进行复核。

总结

简而言之,这篇论文展示了从僵化的脚本化测试(一个只能完全按照指令行事的机器人)向智能体化测试(一个能够观察、思考、自我修复并从历史中学习的 AI 团队)的转变。这就像是从一段舞蹈的录像,升级到了一支能够在舞台变化时进行即兴发挥,同时仍能遵循编舞者核心愿景的现场舞团。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →