← 最新论文
💻 computer science

Understanding on the Edge: LLM-generated Boundary Test Explanations

这项探索性研究通过对软件专业人员的问卷调查和访谈,评估了由大语言模型生成的边界值分析解释的有效性,结果显示其普遍获得了积极反馈,同时也确定了旨在增强此类工具在调试和文档编写方面的清晰度、可信度和实用性的关键设计准则。

原作者: Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在烤蛋糕。你知道,如果加入一杯糖,它是甜的;如果加入两杯,它就会过甜。但那个从“恰到好处”变成“过量”的确切时刻,就是边界(boundary)。在软件领域,这些“边缘”正是程序最容易崩溃的地方。寻找这些边缘被称为边界值测试(Boundary Value Testing)

长期以来,寻找这些边缘就像是在没有地图的情况下,试图在一堆干草中寻找一根针。你必须去猜测界限到底划在哪里。

这篇论文提出了一个简单的问题:人工智能(特别是大语言模型,即 LLM)能否不仅找到这些“边缘”,还能用通俗易懂的英语解释为什么它们是边缘?

把人工智能想象成一个非常聪明、博学多才的助手。研究人员想看看这个助手能否观察一个软件函数(比如身体质量指数 BMI 的计算器或电子邮件验证器),然后说:“嘿,如果你输入 999,它可以正常工作;如果你输入 1000,它就会崩溃。这就是让 1000 成为临界点的规则。”

实验:一场“味觉测试”

研究人员组织了 27 位软件专业人士(包括行业专家和研究人员)进行了一场“味觉测试”。他们向这些人展示了由 AI(使用名为 GPT-4.1 的模型)生成的 20 个不同的“边界案例”。

对于每个案例,AI 都会提供一段简短的解释。随后,人类根据四个维度对这些解释进行了评分:

  1. 清晰度(Clarity): 是否易于阅读?
  2. 正确性(Correctness): 是否符合事实?
  3. 完整性(Completeness): 是否遗漏了重要信息?
  4. 实用性(Usefulness): 这是否真的能帮助我完成工作?

结果:表现良好,但存在一些“幻觉”

总体结论是积极的。大约 63.5% 的评分较高(4 分或 5 分)。专业人士认为,AI 在解释软件行为背后的“原因”方面做得总体不错。

然而,其中也出现了一些小故障,就像 GPS 给了你错误的转向指令一样:

  • “魔法”错误: 在一个涉及日期的案例中,AI 自信地声称年份从 199 变为 200 时,位数从 3 位变成了 4 位。而实际上,两者都是 4 位数。AI 产生了“幻觉”(编造了事实)。每当这种情况发生时,人们就会停止信任其解释。
  • 术语过多: 有时 AI 会在不解释术语的情况下使用技术词汇,就像一位厨师说“加入一撮 mirepoix(西芹碎)”却没告诉你是什东西一样。
  • 缺乏上下文: 解释有时显得过于简短,缺乏解释为何存在某个边界的“规则手册”(例如特定的互联网标准)。

什么构成了好的解释?(“秘方”)

通过后续访谈,研究人员总结出了让 AI 解释真正发挥作用的要素。他们为未来的工具制定了一个 7 点清单

  1. 调整音量: 不要用博士的口吻跟初学者说话,也不要用初学者的口吻跟博士说话。解释应该适应用户的专业水平。
  2. 引用来源: 如果你说存在某条规则,请链接到官方规则手册(如互联网标准文档)。这能建立信任。
  3. 遵循食谱: 使用清晰的结构。首先,说明什么情况可行;然后,说明什么情况会失效;最后,展示具体的数字。
  4. 展示邻居: 不要只展示崩溃点。要同时展示崩溃前的数字和崩溃后的数字,以便清晰地观察变化。
  5. 解释“为什么”: 如果 AI 做出某种假设(比如“我们假设年份不能为负数”),请把它说出来。
  6. 允许互动: 不要只是阅读一段静态的文字,要让用户能够询问 AI:“等等,为什么这个是非法的?”并获得回答。
  7. 融入工作流: 不要让用户离开他们的编码界面去阅读解释。解释应该直接出现在他们工作的界面上。

核心结论

论文得出结论:AI 已经准备好成为软件测试人员的得力助手,但目前还不是人类的替代品。

把它想象成一个副驾驶。AI 可以指出悬崖的边缘并说:“这就是地面结束的地方”,但人类飞行员仍需观察窗外,检查地图,并决定是否可以安全飞行。如果 AI 犯了事实性错误(比如那个日期错误),人类需要及时发现。

研究人员发现,通过对提问方式(更好的“提示词/prompts”)进行微调,并遵循他们的 7 点清单,这些 AI 解释可以成为让软件更安全、更易理解的强大工具。但就目前而言,我们需要保持“人在回路中(human in the loop)”,以验证 AI 是否在胡编乱造。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →