← 最新论文
💬 NLP

Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

本文研究了修改评估量规(具体而言,通过添加示例、上下文并减少位置偏差,而非增加复杂性或使用保守聚合)如何影响人类与基于大语言模型的自动评分者之间的统计一致性,发现某些修改在论文评分和指令遵循等领域增强了这种一致性,而其他修改则削弱了它。

原作者: Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正在批改一叠学生作文。你手中有一份评分标准,它就像一份详细的食谱或检查清单,明确告诉你什么样的作文能得"5 分”(优秀),什么样的作文只能得"1 分”(需要改进)。

现在,想象你雇佣了一位机器人助手(“自动评分器”或 AI)来帮你批改这些作文。你希望机器人的评分尽可能与你的评分一致。但问题在于:有时机器人面对同一篇作文,给出的分数却与你截然不同。

这篇论文就像一场科学实验,旨在探究如何调整这份“食谱”(评分标准),以便让机器人与人类老师达成共识。

编写“食谱”的两种方式

研究人员测试了两种编写此类评分标准的主要方法:

  1. “整体性”食谱(宏观视角): 这就像告诉机器人:“只需通读整篇作文,根据你的整体直觉给出一个单一分数。”这种方法很快,但很模糊。“好”究竟意味着什么?
  2. “分析性”食谱(分步执行): 这就像将作文拆解为各个组成部分:“检查语法。检查组织结构。检查词汇量。”然后,将各部分的分数相加。这种方法更详细,但也更复杂。

实验:调整指令

研究人员不仅比较了这两种“食谱”,还尝试修改给机器人的指令,看看能否让它变得更智能。他们测试了三种主要改动:

  • 添加示例: 他们不再仅仅说“写一篇好作文”,而是向机器人展示了三个具体示例:一篇糟糕的作文、一篇一般的作文和一篇优秀的作文。这就像向新员工展示“糟糕”、“一般”和“完美”的报告,让他们确切知道你想要什么。
  • 减少偏差(“单独”与“批量”测试): 有时,如果你让机器人一次性在长列表中批改五篇不同的文章,它可能会感到疲劳,或者对第一项或最后一项产生偏差。研究人员尝试让机器人在各自的独立对话中批改每一项(就像进行五次短会,而不是一场漫长的马拉松),看看这是否能让评分更公平。
  • 添加背景信息: 他们向机器人提供了更多背景信息,例如“请记住,这是学生在 45 分钟内完成的初稿,因此不要对拼写错误过于苛刻”。

他们的发现(结果)

以下是他们研究发现的“核心结论”,用通俗易懂的语言翻译如下:

1. 展示,而非仅仅告知
当研究人员向机器人提供示例(“好、坏、一般”的作文)和额外背景信息时,机器人与人类老师达成一致的概率大大增加。这就像给新员工提供一份包含完美工作示例的“作弊小抄”。这种方法在作文评分中效果最佳。

2. 拆解任务并不总是有帮助
你可能会认为,将复杂任务分解为简单的小步骤(“分析性”食谱)会让机器人变得更智能。但研究人员发现,有时这反而会让情况变得更糟。

  • 如果任务本身已经很简单,拆解反而会让机器人感到困惑。
  • 如果任务非常复杂,拆解有时会有所帮助,但前提是机器人不会因需要同时进行过多计算而感到不堪重负。
  • 关键要点: 取决于具体任务,一个更简单的单一“直觉”分数,有时比一个复杂的多步骤分数更能与人类评分保持一致。

3. “单独”对话技巧
当研究人员要求机器人在独立的对话中(而不是在一个大批次中)对每个评分标准进行打分时,这有助于减少一种特定的偏差,即机器人倾向于对所有项目都说“是”或对所有项目都说“否”。这使得机器人的评分看起来更像人类的评分。

4. 人类必须先达成一致
这是一个至关重要的发现:如果人类老师之间无法达成一致,机器人也无法与他们达成一致。

  • 如果三位人类老师都给某篇作文打了"5 分”,那么机器人也很可能给它打"5 分”。
  • 如果人类老师之间存在分歧(一位说"5 分”,另一位说"2 分”),机器人就会感到困惑,一致性随之下降。
  • 类比: 如果人类裁判连规则都无法达成一致,你就不能指望机器人来担任裁判。

宏观视角

该论文的结论是:不存在一种“放之四海而皆准”的魔法按钮。要让机器人像人类一样评分:

  • 不要只是复制粘贴人类的指令。 你通常需要根据机器人的特点修改这些指令(添加示例、消除偏差)。
  • 了解你的任务。 对于某些任务,简单的“总体评分”效果最好;而对于其他任务,你需要一份详细的检查清单。
  • 先解决人类的问题。 如果你的评分团队本身就不一致,那么无论怎样调整机器人,都无法解决这个问题。

简而言之,让机器人像人类一样评分,关键不在于让机器人变得更聪明,而在于给它提供正确类型的“作弊小抄”,并确保它试图模仿的人类实际上已经达成了共识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →