Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions
这项研究表明,程序员在评估错误的 AI 生成断言时表现出显著的过度自信且缺乏准确性,而这一问题并未因自然语言解释而得到缓解——甚至可能因此而恶化——这表明目前的 AI 工具可能无法可靠地增强代码理解或审查。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名在高科技城市里的初级侦探,一个超级智能的机器人助手(AI)正在协助你破案。这个机器人不仅会编写犯罪过程的故事,还会写出一本关于“应该发生什么”的规则书,这被称为断言(assertion)。你的任务就是查看机器人的规则书,然后说:“没错,这和故事对得上,”或者“哇,这不对!”
你可能会觉得,如果机器人用通俗易懂的英语来解释它的规则书,会让你的工作变得超级简单,对吧?就像有一个友好的向导在你阅读时,在你耳边轻声说:“嘿,看这里!”
好吧,研究人员测试了 86 名真实的程序员(我们的侦探)来观察他们在这方面表现如何。他们发现了一些关于我们在涉及 AI 时大脑运作方式的、令人惊讶甚至有些滑稽的真相。
“唯唯诺诺”的问题
这是重大的发现:我们的侦探们非常擅长发现机器人写对的情况,但非常不擅长发现它写错的情况。
当机器人写出正确的规则书时,程序员的正确率约为 74%。但当机器人写出错误的规则书时,他们只能抓到错误中的 49%。这几乎跟抛硬币猜正反面差不多!
更奇怪的是,这些侦探对自己的错误答案也持有同样高的自信度,就像对待正确答案一样。无论对错,他们给出的自信度评分都在 4 分(满分 5 分)左右。这就像一个学生即便在数学题做错了,也百分之百确定自己做对了。研究人员发现这种差异是具有统计学意义的(意味着这并非偶然),即发现正确规则书的概率比发现错误规则书的概率高出近三倍。
“令人困惑的向导”陷阱
现在,让我们谈谈机器人的解释。研究人员认为:“如果机器人解释它为什么要写这条规则,侦探们的表现会不会更好呢?”他们通过提供四种类型的解释来测试程序员:
- 完美型: 解释与规则书完全一致。
- 过于挑剔型: 解释增加了规则书中没有的额外规则。
- 过于模糊型: 解释遗漏了重要的规则。
- 完全错误型: 解释说的事情与规则书完全不同。
结果是:这些解释根本没有帮助。 事实上,它们有时会让情况变得更糟。
当解释过于模糊(欠定义)时,程序员的准确率实际上比没有解释时还要低。但关键在于,这些模糊的解释让程序员感到更加自信(其自信度评分从没有注释时的 3.99/5 上升到了 4.25/5)。这就像是一个导游给你一张模糊、半真半假的地图,让你觉得自己对这座城市了如指掌,尽管你其实是在原地打转。研究人员认为,这些糟糕的解释可能是在干扰你的思考,而不仅仅是没能提供帮助。
侦探们是如何解决问题(以及失败)的
为了理解为什么会发生这种情况,研究人员对 10 名程序员进行了“边想边说”(think-aloud)的研究,让他们在解题时大声说出思路。他们发现大多数侦探使用的是“自上而下”的方法:先读机器人的英文解释,然后再检查代码。
他们主要使用了五种技巧:
- 子句对比: 检查文字内容是否与代码匹配。
- 逻辑演练: 在脑海中追踪步骤。
- 正向示例: 尝试一个“好”的例子,看看它是否奏效。
- 负向示例: 尝试一个“坏”的例子,看看它是否破坏了规则。
- 直觉: 基于“直觉”进行猜测。
研究发现,当规则书容易进行逐字对比(子句对比)时,侦探们的表现要好得多。但当他们依赖直觉时,出错的次数比正确次数更多(12 人中有 7 人出错)。此外,捕捉错误的规则书需要显著更多的时间(约 123 秒),而接受一个错误的规则书则只需约 97 秒。看来我们的大脑很懒:点头认同比挖掘错误要容易得多。
这对未来意味着什么
研究人员建议,我们不能仅仅依赖 AI 来编写这些规则书并期望我们能轻松发现其中的错误。我们识别 AI 错误的水平出奇地低,而且糟糕的解释可能会让我们对错误感到过度自信。
他们还发现,虽然我们很难发现逻辑错误,但我们可以分辨出一个规则书是“强”还是“弱”。如果一个规则书能捕捉到更多的潜在漏洞,即使我们无法识别具体的逻辑错误,我们也会认为它更完整。
所以,下次当 AI 助手为你写下一条规则时,不要只是点点头说“做得好!”研究人员警告说,你可能会错过其中的错误,而一个混乱的解释可能只会让你对错误感到过于笃定。真正的挑战不仅在于生成规则,更在于如何帮助人类真正地验证它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。