Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors
该研究探讨了基于大语言模型的双架构评分系统在面对无关构念因素(如填充文本、拼写错误、写作复杂度、文本重复及离题内容)时的鲁棒性,发现该系统在多数情况下表现稳健,仅对文本重复和离题内容进行了有效惩罚,从而为未来构建以构念相关性为导向的 LLM 评分系统提供了积极支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章就像是在给一位**“超级智能阅卷老师”**做体检,看看它到底靠不靠谱,会不会被学生的小聪明给忽悠了。
想象一下,以前学校里的作文阅卷,或者现在的自动评分系统,就像是一个**“老派考官”**。这个老考官有个毛病:他特别容易被表面现象迷惑。比如,如果你把文章写得特别长,哪怕全是废话,或者你堆砌了很多华丽的辞藻,他可能就会觉得“哇,这学生写得真好”,然后给你打高分。甚至如果你把同一句话抄三遍,他可能还会觉得你“强调”得很好,分数反而更高。
现在,大家开始用大语言模型(LLM)(比如现在的各种 AI)来当这个“阅卷老师”了。大家很担心:这个新老师会不会也有同样的毛病?或者,它会不会因为太“聪明”而变得太敏感,稍微有个拼写错误就扣你分?
这篇论文就是作者(来自 Acuity Insights 公司)专门测试了他们的 AI 阅卷系统,看看它在面对以下几种“作弊”或“干扰”时,能不能保持清醒:
1. 测试一:能不能被“注水”骗到?(无意义文本)
- 场景:学生为了凑字数,在文章里疯狂复制粘贴,或者加一些像“这道题考的是团队合作”这种废话,甚至把整段话重复写一遍。
- 老考官的反应:以前非 AI 的系统可能会觉得“字数多=内容丰富”,给你加分。
- AI 新老师的反应:
- 复制粘贴:如果你把文章重复一遍,AI 反而觉得你“注水”了,分数会稍微降一点。它很聪明,知道重复没意义。
- 加废话:如果你加一些解释题目或复述场景的废话,AI 完全无动于衷,分数基本不变。
- 结论:AI 不会被“字数游戏”骗到,它更看重你说了什么,而不是说了多少。
2. 测试二:能不能被“拼写错误”或“文笔”影响?(写作技巧)
- 场景:
- 拼写错误:学生打字手抖,把单词拼错,甚至错得离谱(比如把 "These results indicate" 写成 "These esflts indicape")。
- 文笔深浅:学生用词很高级、句子很长(像大学教授写的),或者用词很简单、句子很短(像小学生写的)。
- 老考官的反应:以前的系统或人类老师,看到一堆错别字可能会扣分;看到文笔好可能会加分。
- AI 新老师的反应:
- 拼写错误:只要错误率不超过 30%(也就是大概每 10 个字母错 3 个,文章已经很难读了),AI 依然能读懂你的意思,分数几乎不变。它不像人类老师那样因为“卷面不整洁”就生气。
- 文笔深浅:无论你是用“高深莫测”的词汇,还是“大白话”表达,只要核心意思没变,AI 给的分数几乎一模一样。
- 结论:这个 AI 阅卷老师是个“实用主义者”。它不在乎你文笔多优美,也不在乎你有没有拼错几个字,它只在乎你有没有回答对问题。这对于那些考查“团队合作”、“解决问题能力”的考试(而不是考查“英语写作能力”的考试)来说,简直是完美的。
3. 测试三:能不能识别“跑题”?(无关内容)
- 场景:题目问的是“怎么解决团队冲突”,结果学生写了一大段“怎么种花”或者“怎么修电脑”。
- AI 新老师的反应:
- 如果你完全跑题,或者把回答 A 题的内容硬套在 B 题上,AI 会狠狠地扣分,甚至直接给最低分。
- 它非常清楚:这道题考的是“团队合作”,那道题考的是“领导力”。如果你用“团队合作”的答案去答“领导力”的题,它一眼就能看出来,不会给你高分。
- 结论:AI 非常“专一”,不会因为你写得再漂亮就给分,如果答非所问,直接“拒收”。
总结:这篇论文想告诉我们什么?
这就好比我们请了一位**“只关注核心内容的超级阅卷员”**。
- 以前:我们担心 AI 会像以前的系统一样,被“字数多”、“辞藻华丽”或者“重复啰嗦”给骗了。
- 现在:研究发现,这个基于大模型的 AI 系统非常稳健。
- 它不看重你写了多少废话(注水无效)。
- 它不挑剔你的拼写和文笔(只要意思对,错几个字没关系,用词简单也没关系)。
- 它非常敏锐,一旦你跑题,它立刻就能发现并惩罚你。
这对我们意味着什么?
对于那些考查**“软技能”**(比如情商、沟通能力、解决问题的能力)的考试,这种 AI 系统非常棒。因为它不会像人类老师那样,因为学生文笔不好或者紧张写错字就误判他的能力;它也不会被那些只会“套模板”、“凑字数”的学生糊弄。
当然,作者也留了个心眼:
虽然 AI 很聪明,但未来还是要多测试一下,看看如果学生用那种“背下来的万能金句”(比如不管什么题都回答“我会尊重地、非对抗性地处理”)会不会骗过它。目前看来效果不大,但还需要继续观察。
总的来说,这是一篇让人放心的论文,它告诉我们:只要设计得当,AI 阅卷系统比我们要想象的更公平、更聪明,更能测出学生真正的本事,而不是测出谁更会“玩文字游戏”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。