Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
本文表明,尽管大语言模型擅长判断候选对象是否属于正确集合,但由于存在一种倾向于“静默遗漏”而非“过度包含”的系统性偏差,它们在构建完整的合格集合方面表现出显著失败,且这种缺陷在不同领域和参数规模下均持续存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的角色反转:当 AI 成为老师
想象一个教室,学生们不再仅仅是回答问题,他们正在编写教科书、评改考试,并决定什么才算作“正确”的答案。这正发生在人工智能的世界里。大语言模型(LLMs)正在从“考生”(答题者)晋升为“监考官”(出题者)。它们正在编写规则、标准答案和检查清单,用以告诉其他 AI 系统它们做得是否出色。
要理解为什么这很棘手,请思考两种不同的技能。第一种是判断(Judging):观察一个单一的答案并说,“是的,这是对的,”或者“不,那是错的。”第二种是创作(Authoring):从零开始创建包含所有可能正确答案的完整列表。这就像是裁判在球员越界时吹哨,与教练试图编写一本规则书来列出球员所有可能的越界方式之间的区别——后者必须确保不遗漏任何一种情况。我们之所以关注这一点,是因为如果编写测试题的 AI 犯了错,它不仅仅是答错了一个问题,它还改变了对所有人的“正确”定义,可能会惩罚优秀的答案并奖励错误的答案。
论文的大发现:机器中的无声幽灵
本研究调查了 AI 在处理这些新角色时出现的一种奇怪且危险的故障。研究人员发现,虽然 AI 模型实际上非常擅长判断(识别特定答案的正误),但它们在创作(写出所有正确答案的完整列表)方面却表现得极其糟糕。
把这想象成一场“老师说”的游戏。如果你问 AI:“‘苹果’是一种水果吗?”它几乎总是能正确回答“是”。但如果你问它:“列出所有存在的各种水果,”它会开始列举苹果和香蕉,然后……就停住了。它会忘记橙子、奇异果和芒果。它忘记并不是因为它不知道这些东西,而是因为它不擅长执行“写出完整列表”这一特定任务。
作者称之为**“判断-枚举剪刀差”(Judging-Enumerating Scissors)**。想象一把剪刀,其中一个刀片是“判断”(锋利且强壮),另一个刀片是“创作”(钝且无力)。随着 AI 模型变得越来越大、越来越聪明(从小型向大规模扩展),“判断”的刀片变得越来越锋利,但“创作”的刀片几乎没有变得更锋利。它们永远无法追赶上来。它们在判断能力与列举能力之间的差距始终存在,无论你投入多少计算能力。
无声的幽灵:为什么我们察觉不到错误
这一发现最可怕的部分在于 AI 是如何失败的。当它编写正确答案列表时,它通常不会添加错误的答案(比如把“石头”列为水果)。相反,它会犯下**沉默遗漏(Silent Omissions)**的错误。它只是简单地漏掉了真实的答案。
以下是为什么这如此危险:
- 过度包含(添加错误项): 如果 AI 不小心把“石头”加入了水果列表,人类审核员可以很容易地发现。“嘿,石头不是水果!”他们会这么说。这是一个可见的错误。
- 遗漏(漏掉正确项): 如果 AI 忘了列出“奇异果”,就没有明显的错误可以观察。列表看起来只是稍微短了一点。要找到缺失的奇异果,审核员必须自己知道答案,然后去搜寻它。
论文显示,AI 模型发现自己多加了错误项的能力,比意识到自己漏掉了某些项的能力要高出 6 到 7 倍。 这就像一个学生非常擅长寻找作文中的错别字,却完全意识不到自己忘了写结论。因为缺失的部分是隐形的,AI 生成的“标准答案”最终会是不完整的,而基于这些答案进行评分的 AI 系统也会因为这些答案不在列表中而惩罚正确的答案。
“魔法规则”的漏洞
研究人员测试了一个聪明的变通方法。他们要求 AI 不要列出水果,而是编写一条关于“什么是水果”的规则(例如:“如果它生长在树上并且有种子”)。当他们这样做时,AI 变得近乎完美(得分 99% 的准确率)。
这证明了 AI 并不笨。它知道规则。问题纯粹在于列举这个动作本身。这就像一位厨师可以完美地描述蛋糕的食谱,但在被要求写出完整的购物清单时,却总会忘记写下最后三种配料。论文表明,如果你让 AI 写规则而不是写列表,问题就会消失。但在许多现实场景中(例如为计算机代码编写测试套件),不存在简单的规则可以编写;你必须列出具体的测试用例,而这正是 AI 栽跟头的地方。
为什么“检查自己的工作”不起作用
你可能会想:“既然 AI 不擅长列举,也许它可以直接检查自己的列表来修复错误?”研究人员也测试了这一点。他们让 AI 生成一个列表,然后生成第二个列表,最后用第二个列表来过滤第一个列表。
结果如何?行不通。 AI 无法修复它自己的遗漏。这就像要求一个不擅长数数的人去数自己的手指,看是否漏掉了。AI 的“判断”技能在面对一个清晰、预先制作好的列表时很强大,但当它试图判断自己生成的混乱列表时,这种能力就会崩溃。论文得出结论,要求 AI 检查自己的答案表是一个陷斗;它需要一个外部的、经过人类验证的“金标准”来捕捉那些缺失的部分。
现实世界的代价:“AI 税”
最后,论文测量了当这种有缺陷的答案表被用于训练其他 AI 时会发生什么。他们设定了一个场景,即 AI 通过获得正确答案来学习。
- 当使用完美的、由人类制作的答案表时,AI 学习得很好。
- 当使用模型制作的答案表时,AI 的学习效果显著变差。
在一个特定的语言任务中,使用模型制作答案表的 AI 比使用完美答案表的 AI 低了 18.5 分。即使是在规则非常简单的数学任务中,它仍然损失了 1.9 分。这种“税”之所以存在,是因为模型制作的答案表过于严格:它拒绝了 AI 生成的正确答案,仅仅因为这些答案没被包含在它自己的列表中。AI 会感到困惑,认为自己的正确答案是错误的,从而停止尝试进行创造性表达。
总结
论文并不是说 AI 是没用的。它是在提醒我们,当我们要求 AI 担任“监考官”并编写正确性的规则时,必须非常小心。
- 不要要求列出清单,要要求编写规则。 如果 AI 可以编写一条规则(如 Python 脚本)来检查答案,请使用该方法。它是近乎完美的。
- 不要盲目信任列表。 如果 AI 必须编写正确答案列表,它几乎肯定会遗漏一些内容。
- 使用“守门人”。 在信任 AI 的答案表之前,检查它是否接受一个已知的正确答案。如果它拒绝了一个已知的正确答案,请弃用该表。
- 修复,而非丢弃。 如果答案表拒绝了一个正确的答案,你通常可以直接修复那个特定的错误(例如预期的输出结果),而不是把整个东西都扔掉。
底线是:AI 擅长发现错误,但并不擅长确保自己没有遗漏任何东西。在解决这个“沉默遗漏”问题之前,我们不能完全信任 AI 去给自己的作业打分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。