← 最新论文
💻 computer science

Supporting System Testing with a Multi-Agent LLM-based Framework for Knowledge Graph Extraction: A Case Study with Ethernet Switch Systems

本文提出了一种基于多智能体大语言模型的框架,该框架从半结构化的以太网交换机配置手册中提取并迭代优化知识图谱,以支持自动生成准确的系统测试用例规范。

原作者: Rongqi Pan, Mahboubeh Dadkhah, Jean Baptiste Minani, Hussein Al Osman, Lionel Briand, Haiwei Dong

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Rongqi Pan, Mahboubeh Dadkhah, Jean Baptiste Minani, Hussein Al Osman, Lionel Briand, Haiwei Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对该论文的解读。

全局概览:将杂乱的说明书转化为智能地图

想象你拥有一本长达 500 页的复杂机器说明书(在本例中,这是一台以太网交换机,它就像互联网数据的交通控制器)。这本手册是写给人类阅读的,而非供计算机理解。其中充满了“半结构化”文本——这意味着它虽有标题和列表,但重要细节往往隐藏在段落中,混杂着注释,或是隐含而非明确陈述。

问题出在哪里?试图自动测试该机器是否正常工作的一台计算机会感到困惑。它难以轻易判断:“如果我执行步骤 A,是否意味着接下来需要执行步骤 B?完成后机器应呈现何种确切状态?”

本文作者构建了一个智能机器人团队(多智能体大语言模型框架),用于阅读这些杂乱的说明书,并将其转化为完美有序的地图(知识图谱)。这张地图使计算机能够自动生成测试脚本,以检查机器是否正常工作,从而将人类从枯燥、重复的手工劳动中解放出来。


角色阵容:一支由专业机器人组成的团队

作者没有让一个巨型机器人包揽所有工作,而是组建了一支由三个具有特定职责的专用“智能体”(AI 助手)以及两名监督者组成的团队。

  1. 路线图智能体:该机器人阅读手册中的“全局概览”部分。它确定高层目标(例如,“我们需要检测网络中的环路”)。
  2. 流程智能体:该机器人阅读“细节”部分。它提取确切的命令、需按下的按钮以及预期结果(例如,“输入此特定代码,您应看到此特定错误消息”)。
  3. 映射智能体:这是关键的连接环节。它将“全局概览”目标与“细节”步骤联系起来。它回答了这个问题:“哪些具体命令实际上实现了该高层目标?”

监督者

  • 裁判(评估智能体):团队完成工作后,裁判检查他们的作业。它将机器人的输出与原始手册进行对比,查看是否有遗漏或错误。
  • 教练(改进智能体):如果裁判发现错误,教练不仅会修正答案,还会重写给予机器人的指令(提示词),以确保它们下次不再犯同样的错误。

流程:“尝试、检查、修正”循环

该系统使用一个巧妙的循环,称为提取 - 评估 - 改进(EEI)循环。这就像学生参加模拟测试:

  1. 提取:机器人团队阅读手册并构建地图(知识图谱)。
  2. 评估:裁判查看地图,指出“你在这里漏掉了一个细节”或“你将此注释放错了框”。它给出一个评分。
  3. 改进:如果分数太低,教练就会介入。它查看裁判的反馈,并说:“好吧,下次在区分‘目标’和‘注释’时要更加小心。”它会更新机器人的指令。
  4. 重复:机器人带着新指令再次尝试。它们会不断重复此过程,直到地图完美无缺,或已达到尝试次数上限。

结果:效果如何?

团队在一家大型科技公司(华为)的50 份真实世界手册上测试了该系统。

  • “首次尝试”已令人惊叹:即使没有“教练”帮助改进,机器人首次尝试的准确率也达到了97% 至 99%
  • “教练”帮助了棘手案例:对于少数特别棘手或令人困惑的手册,EEI 循环开始发挥作用。它优化了指令,准确率进一步提升,达到了近乎完美的分数。
  • 人类与机器人意见一致:作者还让人类专家检查了工作。他们发现,“裁判”机器人与人类专家的意见一致率达到了72% 至 80%。大多数分歧都是细微之处(例如缺少一个空格,或对注释的分类方式略有不同),而非重大错误。
  • 实际实用性:团队将生成的地图交给了五位经验丰富的人类测试人员。测试人员表示,这些地图非常有用、清晰且准确。他们觉得这些地图可以成功指导他们创建测试用例,尽管他们指出,有时“前置条件”(启动前需要设置的内容)需要极少量的人工润色才能完全清晰。

核心结论

本文表明,我们可以利用一支 AI 机器人团队来阅读复杂、杂乱的专业技术手册,并将其转化为清晰、结构化的数据。这些数据质量极高,足以帮助自动化网络设备测试——这项任务通常耗时、昂贵且完全依赖人工完成。该系统足够智能,能够从自身错误中学习,并提高阅读特定类型手册的能力,使其成为软件测试未来的强大工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →