← 最新论文
💻 computer science

Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback

本文介绍了 PAIR-Bench,这是一个渐进式且具有自适应性的基准测试,它通过衡量大型语言模型通过结构化、多层级反馈来优化程序的能力,而非仅仅依赖于二元的通过或失败结果,来评估其代码改进能力。

原作者: Cuong Chi Le, Aashish Yadavally, Minh Le-Anh, Tien N. Nguyen

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Cuong Chi Le, Aashish Yadavally, Minh Le-Anh, Tien N. Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何修理一台坏掉的面包机。

旧方法(二元通过/失败制):
过去,研究人员会给机器人一个坏掉的面包机和一份测试清单(例如:“它能烤面包吗?”、“它能弹起来吗?”)。如果机器人完美地修好了面包机,它会得到一颗金星。如果它哪怕只在一个测试中失败了,就会得到零分。

  • 问题在于: 这就像是在给一个数学考试得了 99 分的学生打分,因为他漏掉了一个微小的细节,就直接给了他“不及格”。相反,一个靠运气猜对答案的学生也会得到“优秀”,即便他根本不理解为什么是对的。这种方法忽略了学习的过程,也忽略了机器人可能已经解决了 90% 的问题,只是在最后 10% 上卡住了这一事实。

新方法 (PAIR-BENCH):
该论文的作者 Cuong Chi Le 及其同事创造了一种测试机器人(具体指大型语言模型或 LLM)的新方法,称为 PAIR-BENCH。与其仅仅看最终结果,他们还会观察机器人学习修复代码的整个过程

把 PAIR-BENCH 想象成一个带有贴心教练的视频游戏,而不是一场最终考试。

它是如何工作的:两个“旋钮”

该系统使用一个“教练”(反馈模型)来引导“玩家”(尝试修复代码的机器人)。这个教练有两个特殊的旋钮来控制提示信息:

  1. “在哪里”旋钮(故障区域控制):
    想象一下,坏掉的面包机有三个问题:一根烧焦的电线、一个卡住的弹簧和一个松动的插头。

    • 旧方法: 教练可能会随机大喊:“坏了!”但并不说明哪里坏了。
    • 新方法: 教练会先挑选一个特定的问题进行重点关注,比如“让我们来看看这根烧焦的电线”。一旦机器人修复了那个问题,教练才会转向下一个问题。这确保了机器人是在解决具体的问题,而不是在瞎猜。
  2. “程度多少”旋钮(提示深度控制):
    这就像是调整对机器人的帮助程度,类似于老师辅导学生。

    • 等级 1(症状): “面包机在冒烟。”(非常模糊)。
    • 等级 2 (模式): “放入厚面包时会冒烟。”(稍好一些)。
    • 等级 3 (状态): “你没有追踪面包在里面停留了多久。”(接近答案了)。
    • 等级 6 (方向): “修改计时逻辑,使用秒数计数而不是循环。”(几乎就是答案了)。
    • 神奇之处在于: 如果机器人仅凭等级 1 的提示就能解决问题,那它是个天才。如果它需要等级 6 的提示才能解决问题,说明它很吃力。系统会衡量机器人成功解决问题时到底需要多少帮助

他们的发现

作者使用真实的编程问题,在几个顶尖的 AI 模型(如 DeepSeek、Gemini 和 GPT-4o-mini)上测试了这个新系统。以下是他们的发现,用简单的术语表达如下:

  • 有些模型是“自主启动型”: 一个模型(DeepSeek)通常可以通过非常模糊的提示(等级 1 或 2)来解决问题。它不需要教练手把手地教导。
  • 有些模型需要“手把手教导”: 其他模型最终虽然能解决问题,但它们需要非常具体、详细的指令(等级 5 或 6)。它们无法靠自己摸索出来。
  • 稳定性很重要: 有些模型修复了代码的一部分,却不小心破坏了另一部分原本已经修好的代码。新系统捕捉到了这种“回归”(即倒退)现象,而旧的“通过/失败”系统却漏掉了这一点。
  • 一致性: 当他们多次运行测试时,新系统给出了非常一致的结果。旧的方法就像掷骰子;有时模型因为得到了模糊的提示而走运,有时则因为运气不好而失败。新系统更加公平且稳定。

核心总结

该论文认为,我们不应该只问:“机器人修好代码了吗?”我们应该问:

  • “它需要多少帮助?”
  • “它是否在某一点上卡住了并忽略了其他部分?”
  • “它在修复问题的同时,有没有破坏原本正常工作的部分?”

通过衡量过程(轨迹)而非仅仅是终点(最终的通过/失败),PAIR-BENCH 为我们提供了一个更清晰、更公平的视角,去观察这些 AI 模型在改进代码方面的真实智能水平和能力。这就像是区分了“他通过了考试”与“他掌握了知识,在难点处需要一点点启发,并且没有忘记已学过的知识”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →