← 最新论文
💻 computer science

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

本文提出了两种基于大语言模型(LLM)的策展流水线,包括 CuREV 数据集和一种基于示例引导的方法,旨在系统地提高代码审查评论的质量、清晰度和真实性,从而增强下游自动化任务(如评论生成和代码优化)的性能。

原作者: Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将代码评审想象成一个巨大的、混乱的群聊,开发者们试图在其中修复一座巨大的、共享的乐高城堡。有时,反馈是精彩的:“嘿,那个蓝色积木放错位置了;让我们把它换成红色的,让塔楼更稳固。”但通常,聊天内容充满了噪音:“呃,真恶心”、“我也一样,哈哈”,或者是毫无帮助的刻薄谩言。

长期以来,科学家们一直试图教机器人(具体来说是大语言模型或 LLM)扮演好用的评审员角色,方法是把这些整个混乱的聊天记录喂给它们。问题在于,机器人也学会了那些坏习惯。它们开始吐出模糊、无礼或令人困惑的评论,因为这就是它们在训练数据中所看到的。这就像试图通过喂给厨师美食和烧焦的面包混合物来教他们烹饪;最终,这位厨师也会开始端出烧焦的面包。

核心发现:清理厨房
论文作者决定在教机器人之前先“清理厨房”。他们并没有简单地扔掉坏数据,而是创建了两种不同的“策展流水线”(可以理解为两种不同的整理杂乱图书馆的方法),将嘈闻杂乱的聊天日志转化为高质量的机器人教科书。

流水线 1:“严格的编辑”(CuREV)
第一种方法被称为 CuREV,它就像聘请了一位严格的编辑,重写聊天中的每一条评论。

  • 他们做了什么: 他们获取每一条评论,即使是好的评论,并强迫它们变得清晰、简短、有礼貌且切中要害。
  • 结果: 机器人学习得非常快,因为指令非常统一。当被要求编写评审意见时,机器人几乎总是以同一个短语开头:“考虑……”(Consider...)。
  • 代价: 虽然机器人非常擅长遵循“考虑……”这条规则,但它们听起来有点机械化且重复。这就像是一个合唱团,每个人都完美地唱着完全相同的音符,但缺乏变化。论文显示,这种方法提高了机器人生成评论的能力(在名为 BLEU 的测试中得分为 11.26,高于原始混乱数据的 7.71),但也让机器人的声音听起来太像单一的模板。

流水线 2:“聪明的导师”(CuREV+)
第二种方法 CuREV+ 更聪明。作者没有重写一切,而是扮演了一个智者的角色。

  • 他们做了什么: 他们首先将评论分为“好”和“坏”。
    • 好的评论(清晰、有礼、有帮助)被原样保留。它们被作为“范例”(完美的例子)保留下来。
    • 坏的评论(无礼、模糊或混乱)由机器人进行重写,但这一次,机器人会先看到“好”的范例以获得启发。
  • 结果: 最终的数据集是真实人类声音与经过润色的有益建议的结合。机器人学会了清晰且有礼貌,同时又不会失去人类对话的自然多样性。
  • 证据: 在编写代码评审的测试中,这种方法在 BLEU 测试中得分 11.05——几乎与严格的编辑不相上下,但有一个巨大的加分项:评论听起来更像人类。
    • 多样性检查: 严格的编辑(CuREV)使用了“考虑”(consider)这个词超过 142,000 次。而聪明的导师(CuREV+)仅使用了 10,000 次,并混入了诸如“我们可以……”、“我们是否应该……”以及“我认为……”之类的短语。
    • 现实世界测试: 当机器人需要根据评论实际修复代码时,CuREV+ 方法成为了赢家。它帮助机器人修复代码的得分(CodeBLEU)为 0.49,击败了严格编辑的 0.44 以及原始混乱数据的 0.36

论文排除了什么
论文明确反对仅仅将原始、混乱的数据喂给机器人的想法。他们表明,在未经处理的原始数据上进行训练会导致机器人生成无关、不清晰甚至不文明的评论。他们还指出,仅仅重写所有内容(如第一种流水线)可能过于极端,因为这剥夺了人类说话时自然的差异性。论文认为你需要一种平衡:保留好的声音,只修正坏的。

他们有多确定?
作者对他们的数字非常有信心,但他们在措辞上非常谨慎。

  • 他们测量了评论质量,使用了一个复杂的系统,其中一个强大的 AI(Llama-3.1-70B)充当评委,检查清晰度、文明度和相关性。他们通过人类评审员进行了双重检查,发现 AI 与人类的意见高度一致(一致性得分为 0.88)。
  • 他们模拟了机器人的学习过程,通过在这些新数据集上进行训练,并在特定任务(编写评论和修复代码)上进行测试。改进在这些测试中是真实且可衡量的。
  • 他们建议这种方法在“有用性”(完成工作)和“自然度”(听起来像人)之间创造了更好的平衡。他们并不声称这是永恒的、完美的解决方案,但数据有力地支持了 CuREV+ 相比于旧有的、混乱的方式是一个显著的进步。

简而言之,论文建议,如果你想让机器人成为一名优秀的编码评审员,不要只喂给它一本由完美句子组成的字典。相反,向它展示最好的真人范例,修复那些坏的部分,并让它从这种混合物中学习。这样,它就能学会提供帮助,而不会变成一个只会重复的复读机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →