Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment
本研究表明,使用大语言模型进行自动答案匹配对于冗余性(verbosity)和答案嵌入(answer embedding)等策略性文本操纵手段仍保持稳健,其中二元评分被证明特别有效,从而验证了在存在参考答案的情况下,其作为人类评估的可扩展替代方案的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常严厉的老师(答案匹配者),他通过将学生的作文与唯一的、完美的“标准答案”(参考答案)进行对比来评分。这项研究的目标是观察学生是否能够“操纵系统”——即仅仅通过改变他们书写答案的方式,而不实际掌握正确答案,从而诱骗老师给出更高的分数。
研究人员测试了三种特定的“作弊”手段,以观察它们是否奏效:
测试的三种“作 cheating”手段
“冗长”手段(冗余性):
- 其核心思想: 如果学生不知道答案,他们可能会写一段非常长、非常宏大的段落,寄希望于让老师觉得:“哇,他写了这么多,一定很懂行。”
- 比喻: 这就像一个学生试图用废话填满一整页纸,以此让自己看起来很聪明。
- 结果: 适得其反。 老师实际上给那些冗长、啰嗦的答案打了更低的分数。老师更青睐与标准答案相匹配的简短、直接的回答。
“困惑”手段(多重答案):
- 其核心思想: 如果学生不确定,他们可能会写道:“答案可能是 X,但也可能是 Y,或者也许是 Z,”寄希望于老师能从中发现其中一个选项并给予分数。
- 比喻: 这就像一个学生对着有三个不同目标的靶盘投掷飞镖,希望能撞中其中一个。
- 结果: 失败了。 老师不会因为回答含糊不清而给予部分分数。事实上,这些困惑的回答往往比简单、诚实的尝试得分更低。
“前置”手段(前置法):
- 其核心思想: 学生将正确答案放在文章的最开头,但在后半部分又用一个错误的答案来反驳它,寄希望于老师在读完第一句话后就停止阅读。
- 比喻: 这就像是在说:“天空是蓝色的。但实际上,天空是由绿奶酪组成的。”
- 结果: 不起作用。 老师读完了全文,看到了其中的矛盾,因此没有给出高分。
重大发现:“是/否” vs. “可能”
研究人员还测试了两种不同的老师评分方式:
- 二元评分(是/否): 老师必须判定为“正确”或“错误”。
- 连续评分(量表制): 老师可以判定为“70% 正确”或“85% 正确”。
研究结果: “是/否”型的老师更难被欺骗。他们非常严格,不会因为混乱的回答而给予部分分数。“量表”型的老师稍显宽容,也更容易被轻微操纵,但即便如此,这些手段依然效果不佳。
“超级严格”的老师 vs. “慷慨”的老师
论文还将 答案匹配者(对照已知标准答案进行检查)与传统的 LLM-as-a-Judge(仅通过阅读作文并凭直觉判断其好坏,而没有标准答案)进行了对比:
- 答案匹配者 就像一位拿着标准答案的严厉监考官。他们极难被愚弄。
- 传统的评判者 就像一位必须根据自己的观点来猜测一篇作文是否优秀的老师。他们更容易被愚弄,并且往往会给出更高的总分。
一个奇怪的故障
有一个例外:一个特定的微型教师模型(称为 Gemma-2-2B-IT)产生了混乱,给出了过多的满分,几乎像是出现了幻觉。这表明,虽然这种方法通常是稳健的,但具体的“教师”模型至关重要。
核心结论
论文得出结论:答案匹配是一个很难攻克的难题。 你无法通过增加字数、含糊其辞或在混乱的文本中隐藏答案来轻易地欺骗这些自动化评分系统。如果你拥有一个参考答案库,使用自动化匹配器是一种可靠、廉价且快速的评分方式,并且它能很好地抵御这些简单的“操纵”策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。