← 最新论文
🤖 AI

Tricky2^2: Towards a Benchmark for Evaluating Human and LLM Error Interactions

本文介绍了 Tricky2^2,这是一个混合数据集,通过在多种编程语言中将人类编写的缺陷与大语言模型注入的错误相结合,旨在促进对人类与机器起源的缺陷如何相互作用的研究,从而为混合软件开发工作流中的错误分类、定位和修复提供新的评估手段。

原作者: Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在盖房子。有时,人类建筑师会犯错,比如忘了把门装在正确的位置。其他时候,一个超级聪明的机器人助手会帮忙盖房,但却不小心安装了一个打不开的窗户,或者把一块砖放错了地方。

直到现在,研究人员主要是在分别研究这两类错误。他们要么研究只有人类错误的房子,要么研究只有机器人错误的房子。但在现实世界中,人类和机器人是在同一栋房子上协同工作的,他们的错误往往会交织在一起。

这篇论文介绍了 Tricky2,这是一个专门设计的“训练场”(或基准测试),旨在研究当人类错误和机器人错误在同一段代码中混合时会发生什么。

以下是他们如何构建它以及发现了什么的详细说明,使用了简单的类比:

1. 配方:混合食材

研究人员从现有的一个包含“有缺陷”代码的集合 TrickyBugs 开始。你可以把这看作是一盒人类绘制但其中带有错误的房屋蓝图。

为了创建 Tricky2,他们并没有直接丢弃旧蓝图。相反,他们使用了一个非常聪明的机器人(AI 称为 GPT-5)和另一个略有不同的机器人(OpenAI-oss-20b),并要求它们做一件棘手的事:

  • 规则: “观察这张已经存在人类错误的蓝图。再添加一个新的属于你自己的错误,但不要修复原有的那个人类错误。保持房子的其余部分完全不变。”
  • 结果: 他们创建了三种类型的“房子”(数据集):
    1. 仅人类(Human-Only): 原始蓝图,仅包含人类错误。
    2. 仅机器人(Robot-Only): 机器人在一个完美的房子上制造了错误的蓝图。
    3. “混合型”(Hybrid,人类 + 机器人): 这是最重要的部分。这些蓝图中,人类犯了一个错误,然后机器人又在其之上添加了另一个错误。

他们针对三种不同的“语言”(C++、Python 和 Java)进行了操作,创建了一个包含超过 11,000 个混合代码示例的海量库。

2. 测试:维修队能修好它吗?

一旦建立了这个库,他们就邀请其他 AI 模型来充当“维修队”。他们给了这些 AI 三项任务,以观察它们处理这种混乱情况的能力:

  • 任务 1:侦探(分类): AI 能否观察代码并猜出:“这个错误是人类造成的,还是机器人造成的,还是两者都有?”
  • 任务 2:定位器(定位): AI 能否精确指出隐藏错误的那行代码?
  • 任务 3:修理工(修复): AI 是否真的能修复代码,让房子重新正常运作?

3. 惊喜:“双重麻烦”效应

研究人员进行了一项针对最难问题的测试。以下是他们的发现:

  • 单一错误较容易: 当 AI 尝试修复只有人类错误或只有机器人错误的房子时,表现得相当不错。
  • 混合错误很难: 当 AI 尝试修复混合型房子(即人类错误与机器人错误纠缠在一起)时,它表现得非常吃力。
    • 事实上,对于一种特定的代码类型(C++),即使 AI 可以修复许多单一来源的错误,它也无法修复任何一个混合型问题。

类比: 想象一下尝试解开两个结。如果只有一个结,很容易;如果有两个结以一种互相遮掩的方式系在一起,就会变成一场噩梦。论文表明,当人类错误和 AI 错误相互作用时,它们会产生一种“双重麻烦”效应,让即使是最聪明的修理工具也会感到困惑。

4. 为什么这很重要

作者表示这仅仅是个开始。他们并不是声称这解决了所有的软件问题。相反,他们是在说:

  • 我们不能只在“纯粹”的人类代码或“纯粹”的机器人代码上测试修复工具。
  • 现实世界的软件是两者的结合,而这种结合创造了独特的挑战,目前的工具尚未准备好应对这些挑战。
  • Tricky2 是一个让研究人员能够研究这些“混合来源”错误的新工具,以便为未来构建更好的工具。

简而言之,这篇论文说:“我们制作了一个特殊的测试套件,用以观察当人类错误和机器人错误碰撞时会发生什么。我们发现,当它们碰撞时,修复代码变得更加困难,我们需要专门研究这个特定问题,以让软件变得更安全。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →