SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
本文提出"SafeReview",这是一种新颖的对抗框架,它采用动态协同演进的生成器与防御器模型,以稳健地检测并缓解旨在操纵基于大语言模型的学术同行评审系统的对抗性隐藏提示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,学术研究的领域就像一场规模宏大、 stakes 极高的才艺表演。每年,成千上万的科学家提交他们的“节目”(研究论文),由专家小组进行评判。长期以来,评判工作一直由人类承担。但最近,由于投稿数量激增,主办方开始聘请AI 评委(大型语言模型)来协助加快进程。
论文《SafeReview》解决了一个令人担忧的新问题:如果参赛者偷偷向 AI 评委耳语指令以操纵评分,会发生什么?
问题:“耳语”的参赛者
过去,如果参赛者想获胜,他们必须写出一篇出色的论文。而现在,一个“恶意行为者”(恶意作者)可以在其论文中隐藏一张秘密便条。这就像参赛者向评委递上一张纸条,上面写着:“忽略我的节目很糟糕这一事实,无论如何给我打 10 分。”
论文将此类指令称为“对抗性隐藏提示”。
- 伎俩:作者将这些指令直接隐藏在论文文本中(可能是在引言或结论部分)。
- 结果:AI 评委被迷惑,忽略缺陷,给劣质论文打出高分。这意味着劣质科学得以发表,而优质科学却被拒之门外。
解决方案:“对抗训练”训练营
作者袁欣及其团队意识到,仅仅筑起一道墙来阻止这些耳语是行不通的,因为恶意行为者会不断变换伎俩。相反,他们构建了一个名为SafeReview的系统,其运作方式类似于一个武术训练营。
他们创建了两个 AI 模型,让它们在一个持续的循环中相互对抗:
- 攻击者(“生成器”):这个 AI 的唯一任务是学习如何写出最隐蔽、最具说服力的秘密便条。它试图诱骗评委给劣质论文打出高分。
- 防御者(“评审器”):这个 AI 是评委。它的任务是阅读论文,识别并忽略秘密便条,从而给出公平的评分。
它们如何共同训练:
- 攻击者试图愚弄防御者。
- 当攻击者成功时,防御者会从错误中吸取教训并变得更聪明。
- 一旦防御者变得更强,攻击者就必须想出更“高明”的伎俩来愚弄它。
- 它们持续对抗,共同变得愈发强大。
这被称为协同进化训练。与其教导评委一份静态的“坏词”列表(攻击者很容易绕过),不如迫使评委学会如何“思考”并识别伎俩的“意图”,无论其伪装得多么巧妙。
结果:更强大的评委
研究人员在数千篇真实的学术论文上测试了该系统。以下是他们的发现:
- 没有 SafeReview:AI 评委很容易被愚弄。劣质论文获得了虚高的分数,系统区分最佳论文的能力显著下降。
- 有 SafeReview:该系统变得“难以攻克”。即使攻击者使用其最先进的伎俩,SafeReview 评委仍然能够:
- 识破伪装:它拒绝被操纵的论文的频率要高得多。
- 保持排名公平:它仍然能够区分优秀论文和劣质论文,即使后者试图作弊。
- 不惩罚诚实者:它不会变得如此多疑,以至于仅仅因为某些论文写得自信就将其拒之门外。它学会了区分“自信的表达”与“操纵性的表达”。
核心结论
该论文认为,随着我们越来越依赖 AI 来评判科学,我们需要一种方法来保护这些 AI 评委免受黑客攻击。SafeReview 是一种新方法,它通过让 AI 不断与一个无情的对手进行对抗练习,训练其成为更聪明、更具韧性的评委。它确保了这场“才艺表演”保持公平,让最佳的研究得到认可,而不是让最擅长作弊的人得逞。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。