← 最新论文
🤖 AI

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

本文介绍了 CriterAlign,这是一个以准则为核心的框架,它通过将独立评分替换为直接的准则级比较,并融入人类偏好对齐引导(HPAG),从而在成对代码偏好预测任务中显著超越现有的单体评判模型。

原作者: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位经理,需要决定两位员工(我们称她们为 Alice 和 Bob)在哪个编码项目上表现更好。你拥有她们的代码、她们产出的结果,以及一份需要遵循的规则清单。

长期以来,试图完成这项工作的 AI 模型表现得像一位单一且过度劳累的监工。它们会查看 Alice 的工作,给出一个 10 分制的评分;然后查看 Bob 的工作,给那一份工作也打出一个 10 分制的分数;最后,它们比较这两个数字并选出获胜者。

论文《CriterAlign》认为,这种“先评分”的方法在编码领域存在缺陷。这就像通过分别给每位厨师的“口味”、“摆盘”和“速度”打分,然后将分数相加,来评判一场烹饪比赛一样。问题在于,AI 经常被表面现象(例如谁写的字数更多,或使用了更花哨的格式)分散注意力,而忽略了人类真正关心的那些微妙差异。

CriterAlign 是一种新的评判方式,它将游戏从“评分”转变为“直接比较”。以下是其工作原理,使用了简单的类比:

1. “一对一”对决(成对评判)

CriterAlign 不再分别给 Alice 和 Bob 打分,而是让她们在每一条规则下进行直接对决。

  • 旧方法:"Alice 的速度得分为 8/10,Bob 的速度得分为 7/10。”
  • CriterAlign 方法:“在 Alice 和 Bob 之间,谁实际上更快?”
    AI 被迫将两者并列查看,并说出"Alice 赢得了这一项”、“平局”或"Bob 赢了”。这模仿了人类在比较两个选项时的实际思维方式。

2. “裁判的显微镜”(由平局驱动的细化)

有时,AI 查看某条规则(例如“代码是否高效?”)时会说:“她们打平了;我看不出区别。”
在旧系统中,AI 会直接接受平局并继续。而 CriterAlign 将“平局”视为规则过于模糊的信号。

  • 类比:想象两名赛跑选手在完全相同的时间冲过终点线。一位糟糕的裁判会说:“这是平局。”而一位优秀的裁判会说:“等等,让我们看看她们的步法。是否有一名选手稍微踉跄了一下?”
    CriterAlign 利用这种“平局”,将规则分解为更小、更尖锐的问题(例如“谁更好地处理了边缘情况?”),直到它能找到真正的差异。

3. “公平性检查”(交换一致性)

AI 裁判极易受到顺序偏差的影响。如果你先展示 Alice 的代码,AI 可能仅仅因为她先出现而更喜欢她。

  • 类比:想象一场品水测试,评委总是更喜欢他们喝到的第一杯水。
    CriterAlign 运行一次“公平性检查”。它要求 AI 再次评判这一对,但这次交换顺序(先 Bob,后 Alice)。如果 AI 仅仅因为顺序改变而改变主意,CriterAlign 就会将这一特定证据扔进垃圾桶。它只保留那些无论谁先谁后都保持稳定且公平的评判。

4. “人类低语”(HPAG)

即使有了更好的规则,AI 仍可能拥有与人类不同的“个性”。它可能更看重“整洁的代码”而非“酷炫的视觉效果”,而人类可能偏好相反的情况。

  • 类比:想象一位从未见过人类的机器人裁判。它需要一份由人类编写的“作弊条”,上面写着:“嘿,当你看到网页设计时,请记住,人类更关心它看起来怎么样,而不是代码是如何组织的。”
    CriterAlign 通过研究数千个过去 AI 答案与人类答案不一致的案例,创建了这份作弊条(称为HPAG)。它提取出推理中的“差距”,并在 AI 开始评判之前将这些教训注入 AI 的大脑。这教会了 AI 像人类一样思考,而无需重新训练整个模型。

结果

当研究人员在大型编码任务基准测试中测试这一新系统时:

  • 旧的“单一监工”AI 大约答对了 60% 的答案(与人类偏好一致)。
  • 旧的“评分”量表系统实际上表现更差,不如单一监工。
  • CriterAlign 的准确率跃升至 66%

简而言之:CriterAlign 阻止 AI 尝试单独给试卷打分。相反,它迫使 AI 像人类裁判一样行动:面对面地比较两个答案,放大平局以找出真正的获胜者,忽略顺序偏差,并遵循一份“人类作弊条”以确保它重视正确的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →