← 最新论文
💻 computer science

LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding

本文提出了一种面向代码领域人机协同创作评估的可靠性感知、评分标准驱动的“大语言模型即裁判”框架,该框架将严格的多指标裁判评估与轨迹级分析相结合,揭示了协同创作的成功通常集中在早期阶段,而修订行为则呈现异质性。

原作者: Md Faizul Ibne Amin, Yutaka Watanobe, Daniel M. Muepu, Haruto Suzuki, Kenta Nanaumi, Md Mostafizer Rahman

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Faizul Ibne Amin, Yutaka Watanobe, Daniel M. Muepu, Haruto Suzuki, Kenta Nanaumi, Md Mostafizer Rahman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场高风险的编程竞赛,参赛者被允许使用 AI 助手来帮助他们解决问题。本文就像是对该场景中两件事的“成绩单”:一是人类与 AI 协作的效果如何,二是作为“裁判”的 AI 评分员在评定工作表现方面有多出色

以下是研究人员所做工作的分解,辅以简单的类比:

1. 设置:“允许使用 AI"的编程竞赛

通常,在编程竞赛中使用 AI 被视为作弊。但在这里,研究人员开设了一个特别赛道,让 15 名参赛者使用他们自选的 AI 工具尝试解决 13 道难题。

  • 目标:他们不仅想看看代码是否运行成功,还想了解人类与 AI 是如何共同构思解决方案的。他们是否卡住了?他们是修正了小错误,还是彻底推倒重来?
  • 问题:传统的评分只看最终答案(通过/失败)。这就像老师只查看最终论文,而忽略了杂乱的草稿、划掉的句子以及页边的笔记。研究人员希望评估的是过程,而不仅仅是成果

2. 解决方案:“基于评分标准”的 AI 裁判

为了评估这些混乱的多步骤过程,研究人员无法仅靠人工阅读成千上万条日志。因此,他们构建了一个系统,利用AI 裁判(如 OpenAI、DeepSeek、Gemini 和 Claude)来担任裁判角色。

这就像是一个体育裁判小组

  • 规则:研究人员没有让 AI 裁判撰写自由形式的意见(这可能导致混乱和不一致),而是强制它们填写严格的评分表(一种“模式”)。它们必须针对“逻辑是否严密?”和“是否处理了边缘情况?”等具体项目给出分数。
  • 安全网:由于 AI 有时会犯错或给出奇怪的回复,该系统设有一个“修复机制”。如果 AI 裁判忘记填写评分表中的某个框,系统会捕捉到这一点,并要求 AI 重试,直到评分表完美无缺。
  • 背景:在评估特定代码片段之前,裁判被允许查看参与者的完整提示历史(他们向 AI 询问的内容)。这就像裁判在判罚犯规前观看整场比赛的回放,而不仅仅是盯着某一瞬间的画面。

3. 发现:人类与 AI 如何协作

研究人员分析了参与者的“轨迹”(即逐步推进的过程)。

  • “早鸟”效应:他们发现成功往往发生得很早。想象一场比赛,85% 的跑者在最初的几步内就冲过了终点线。一旦参与者及其 AI 找到了正确的路径,他们通常能迅速解决问题。如果在最初的几次尝试后仍在挣扎,他们很少能在后期取得成功。
  • 修复汽车的两种方式:当代码出错时,参与者通过两种截然不同的方式修复它:
    1. 机械师:微调小部件(渐进式优化)。
    2. 建筑师:推翻整个设计并重建(大规模重构)。
    • 惊喜:两种方法同样有效。没有一种“最佳”的代码修复方式;有时微调就奏效,有时则需要彻底重建。

4. 发现:AI 裁判的表现有多好?

研究人员测试了四种不同的 AI 模型,以查看哪一个是最好的裁判。

  • 不同的优势:就像人类裁判一样,AI 裁判也有不同的“性格”。
    • DeepSeek 最擅长将好的尝试排在差的尝试之上(就像识别最佳表现)。
    • OpenAI 在概率分数的精确性方面表现出色。
    • GeminiClaude 则各有其特点。
  • “一致性”问题:裁判们并不总是彼此一致。如果你让两个不同的 AI 裁判对同一段代码进行评分,他们可能会给出不同的分数。研究人员发现,虽然他们有时能达成一致,但经常意见相左。
  • 教训:你不能只依赖一名 AI 裁判。你需要一个“裁判小组”,并且必须查看多种不同的指标(如排名能力、置信度校准能力以及达成一致频率),才能获得对质量的真实图景。

5. 核心结论

本文提出了一套评估人类与 AI 协作效果的新** playbook(行动指南)**。

  • 关于过程:它表明,在 AI 辅助编程中,成功通常发生得很早,且修复错误并没有唯一的“正确”方式。
  • 关于评分:它证明,如果你强制 AI 遵循严格规则、检查其工作并使用多名裁判交叉核对分数,AI 可以成为可靠的裁判。

简而言之:本文构建了一种更好的方法来评估人类与 AI 之间混乱而协作的“舞蹈”,表明成功往往发生得很快,并且我们需要一个 AI 裁判团队才能准确打分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →