Justice in Judgment: Unveiling (Hidden) Bias in LLM-assisted Peer Reviews
本文通过揭示模型表现出显著偏向知名作者的归属、资历和发表历史偏见,并指出尽管可能存在对齐掩盖,但在词元层面分析时这些潜在偏好会变得更加明显,从而研究了大语言模型辅助同行评审中的偏见问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场规模宏大、 stakes 极高的才艺表演,数千名科学家提交他们的最佳作品接受评审。传统上,人类专家匿名审阅这些投稿,以决定谁获奖(即发表)。但最近,主办方开始聘请一种新型评委:一种超级聪明的计算机机器人(大型语言模型,或称 LLM)来协助撰写评审意见。
本文就像一次“神秘顾客”调查。研究人员想看看这些机器人评委是否真正公平,还是说它们会基于作者身份而非作品质量而暗中偏袒某些人。
以下是他们发现的简要说明:
1. “姓名牌”测试(机构偏见)
研究人员将完全相同的科学论文多次提交给机器人评委,唯一改变的是作者所属大学的名称。
- 情境 A:论文声称来自世界知名、顶尖的大学(如麻省理工学院或剑桥大学)。
- 情境 B:论文声称来自规模较小、知名度较低的大学。
结果:机器人 consistently 对来自知名大学的论文给出更高评分。仿佛机器人评委看到姓名牌上写着“哈佛”,便立刻心想:“这肯定很好!”而并未真正仔细审阅作品。如果姓名牌上写的是“州立小学院”,机器人则严厉得多。
隐藏的转折:研究人员注意到一个更隐蔽的现象。当机器人给出最终的“接受/拒绝”结论时,它们有时会试图表现得中立。但当研究人员查看机器人的“内部思维过程”(即其“软性评分”)时,偏见反而更加强烈。这就像一个人嘴上说“我很公平”,而其内心独白却在呐喊:“我绝对更偏爱那个富家孩子!”
2. “简历”效应(资历与过往经历)
研究人员还测试了机器人是否在意作者的经验。
- 情境 A:作者是著名、年长的教授,拥有数百篇过往发表成果。
- 情境 B:作者是年轻学生,没有任何过往发表记录。
结果:机器人偏爱这位著名教授。它们对“资深首席研究员”以及拥有漫长发表清单的作者所提交的论文给予更高评分。即使论文内容完全相同,它们对这位学生却更加怀疑。机器人似乎认为:“如果他们以前做过,那么这次也一定做得对。”
3. “性别”猜测(性别偏见)
研究人员还交换了论文上的男性与女性姓名。
结果:这一部分情况更为复杂。有些机器人偏爱男性,有些偏爱女性,有些则保持中立。这与机构偏见相比不够一致,但偏见依然存在。这就像抛一枚硬币,但硬币的权重会根据你询问的是哪台机器人而略有不同。
4. “临界点”风险
最令人担忧的发现涉及那些“处于边缘”的论文——即既非明显出色也非明显糟糕的论文。
- 当一篇临界论文附上“知名大学”的名称时,机器人常常将其决定从“拒绝”改为“接受”。
- 当同一篇临界论文附上“知名度较低大学”的名称时,机器人则常常将其决定从“接受”改为“拒绝”。
这意味着机器人的偏见并非仅仅是微小的偏好,而是强大到足以决定一位科学家的职业生涯及其作品能否发表。
全局视角
该论文得出结论:这些 AI 评委并非我们曾期望的那种中立、客观的仲裁者。它们吸收了训练它们所依赖的互联网中存在的现实偏见。它们似乎相信“声望=质量”和“经验=优秀”,即使实际作品并不支持这一结论。
作者警告,如果我们让这些机器人主导评审过程而不加以核查,最终可能只会发表来自名校名人的论文,而忽视来自小机构中才华横溢者的杰出想法。这些机器人正在“幻觉”般地表现出公平,实则却充满偏见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。