← 最新论文
🤖 machine learning

Understanding Robustness of Model Editing in Code LLMs

本文引入了一个受控基准和执行沙箱,以评估代码大语言模型在 API 更新下的模型编辑效果,揭示出当前的编辑方法难以将正确的 API 迁移泛化至未见过的任务,往往依赖变通方案,且在连续应用时会出现严重的性能下降和干扰。

原作者: Vinaik Chhetri, Moghis Fereidouni, A. B Siddique, Umar Farooq

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Vinaik Chhetri, Moghis Fereidouni, A. B Siddique, Umar Farooq

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常天才、超级聪明的机器人助手,它为你编写计算机代码。这个机器人是在一个庞大的旧代码库上训练出来的,因此它懂得如何以“老办法”行事。但在现实世界中,软件工具(称为 API)不断升级,就像智能手机应用更新其按钮或改变文件保存方式一样。

问题在于,这个机器人不会自动学习这些新规则。如果你让它使用工具的新版本,它可能会顽固地继续使用旧版本,或者变得困惑并写出导致崩溃的代码。

模型编辑是研究人员用来尝试“教导”机器人这些新规则的一种技术,而无需从头重建整个机器人。这就像试图向一个已经充满记忆的头脑发出特定指令,希望它只更新那一项内容,而不忘掉其他一切。

这篇论文就像是一次严格的压力测试,旨在检验这些“教学技巧”是否真的有效。以下是他们发现的简化说明:

1. “虚假成功”的陷阱

研究人员构建了一个包含 2,040 个编程谜题的特殊测试厨房。他们更改了特定工具的规则(例如重命名函数或添加必需步骤),并要求机器人使用新规则来解决这些谜题。

他们发现,许多机器人看似通过了测试,但实际上是在作弊

  • 类比:想象你告诉一位厨师:“用新的电动刀切这根胡萝卜。”厨师完美地切好了胡萝卜,但他并没有使用电动刀,而是使用了藏在口袋里的一把钝黄油刀。
  • 结果:测试显示“成功!”,因为胡萝卜被切开了。但机器人并没有真正学会新规则;它只是找到了一种“变通方法”来完全绕过新工具。当研究人员强制机器人使用新工具(移除变通方法)时,成功率急剧下降。

2. “一次性修复”与“雪球效应”

研究人员测试了两种场景:

  • 单次编辑:教导机器人一条新规则。
  • 连续编辑:教导机器人一条新规则,然后另一条,再一条,就像雪球滚下山坡一样。

发现

  • 单次编辑:即使只教导一条规则,机器人也常常难以应对。它们要么写出无法运行的代码(语法错误),要么写出能运行但未正确使用新工具的代码。
  • 连续编辑:这简直是一场灾难。一旦试图连续教导机器人多条新规则,机器人的“大脑”似乎就崩溃了。其性能降至接近零。这就像试图在烤箱已经预热时往蛋糕面糊里添加新配料;整个混合物都塌陷了。

3. 它们在哪里失败了?

研究人员不仅统计了多少次失败,还深入分析了如何失败。他们将过程分解为几个阶段:

  1. 编译(能运行吗?): 代码甚至能启动吗?
  2. API 采用(它使用了新工具吗?): 它是否真正使用了更新后的指令?
  3. 执行(它起作用了吗?): 它是否解决了问题?

发现

  • 当教导一条新规则时,机器人失败的主要原因甚至是无法让代码开始运行(编译错误)。
  • 当教导多条规则时,机器人失败得更加严重,常常产生连计算机都无法阅读的胡言乱语或重复的无意义内容。

4. “记忆”与“搜索”问题

该论文测试了不同的“教学方法”。

  • 有些方法试图将新规则记忆在一个单独的笔记本中(基于记忆的方法)。这些方法在保持机器人其他技能 intact 方面表现尚可,但在正确应用新规则方面仍然挣扎。
  • 其他方法试图搜索机器人的大脑,并手术式地修改特定部分(定位后编辑)。这些方法非常脆弱;它们往往会破坏机器人编写其他任务代码的能力,而不仅仅是新任务。

结论

该论文得出结论,当前用于“编辑”代码编写 AI 的方法尚未准备好投入现实世界应用

  • 它们经常用看似成功实则不然的“变通方法”来欺骗我们。
  • 当你尝试更新它们超过一次时,它们很容易崩溃。
  • 它们难以区分“编写能运行的代码”与“编写正确使用新工具的代码”。

简而言之,我们目前还不能仅仅通过“修补”这些 AI 机器人来让它们跟上软件更新的步伐。我们需要更好的方法来教导它们,而不会导致它们忘记其他一切,或开始胡言乱语。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →