Byzantine-Robust Decentralized GRPO: Defending Against Domain Poisoning and Reasoning-Inflation Attacks
本文介绍了 Dec-GRPO,一种拜占庭容错的去中心化群体相对策略优化框架,该框架通过集成参考逻辑值过滤、声誉加权选择、Multi-Krum 聚合以及自适应长度惩罚优势,来防御领域投毒和推理膨胀攻击。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一种新的方法已经出现,旨在教导计算机模型如何更好地进行推理。这种被称为“组相对策略优化”(group relative policy optimization)的技术,其原理是让模型同时针对同一个问题生成多个不同的答案。该系统并不依赖于一个独立的评判者来为每个答案评分,而是将这些答案在特定的组内进行相互比较。如果某个答案在同一批次中明显优于其他答案,它就会获得更高的分数,模型也会借此学习并偏好那种思维方式。这种方法非常高效,因为它消除了对复杂外部评判者的需求,节省了大量的计算能力。由于其高效性,研究人员渴望在许多协同工作的不同计算机上运行这些训练任务,这种设置被称为“去中心化训练”。在这种安排下,许多独立的计算机通过分享它们生成的答案来构建一个更聪明的模型,而无需来回传输海量数据。
然而,这种开放、协作的方法也创造了一种新的脆弱性。当许多计算机协同工作时,少数坏人可能会加入网络并伪装成诚实的参与者。这些入侵者在安全领域被称为“拜占庭对手”(Byzantine adversaries),他们可以通过向系统输入损坏的数据来破坏学习过程。Uday Yeruva 和 Gade Victoria 的一项最新研究探讨了这种行为对于这种新型基于组的训练方法究竟有多危险。他们发现,攻击者并不需要高超的技术就能造成伤害;他们只需向系统大量注入两种特定类型的错误数据即可。其中一类涉及注入事实错误或具有毒性的答案,这会让模型对什么是正确答案感到困惑。另一类则更为隐蔽:攻击者提供的答案本身是完全正确的,但其表达方式极其冗长、啰嗦。由于训练系统会奖励在组内脱颖而出的答案,这些过度冗长的正确答案可能会劫持学习过程,迫使模型变得不必要地啰嗦且低效。
为了解决这个问题,研究人员开发了一种名为 Dec-GRPO 的新防御系统。该系统就像一个位于共享数据的计算机与中央学习过程之间的多层过滤器。第一层检查答案的内部置信度,拒绝那些看起来可疑地不确定或毫无意义的答案。第二层为网络中的每台计算机维护一个声誉分;如果某台计算机有发送错误数据的历史,它就会被忽略。第三层使用一种统计方法来寻找最一致的一组答案,从而有效地投票剔除那些不符合诚实计算机模式的离群值。最后,系统包含一个智能长度惩罚机制。如果一组内的答案在长度上开始出现剧烈波动,系统会自动增加对长答案的惩罚,从而遏制攻击者利用冗长性来操纵评分。
研究人员在涉及十个节点(即计算机)协同工作的受控计算机模拟中测试了这种防御。他们引入了一个场景,其中 30% 的计算机是坏人,分为发送错误答案和发送过度冗长答案两类。在没有任何防御的情况下,系统的性能显著下降,且答案的平均长度增加了一倍多,从 22 个单词增加到了 53 个单词以上。当完整的防御系统启动时,模型恢复了大部分损失的性能,并将答案长度保持在接近正常的水平。研究发现,统计投票法是阻止攻击的最强单一工具,但四层机制的结合提供了最佳的整体保护,特别是针对那些试图隐藏其手段的攻击者。
团队还在一个使用数学问题数据集的真实开源语言模型上测试了这些攻击。他们证实,这些攻击在真实模型上的表现与在模拟实验中一样有效。当攻击者使用冗长技巧时,模型的答案长度增加了两倍半。当他们使用投毒技巧时,模型的正确率下降了约 32%。然而,研究人员指出一个关键的局限性:他们为模拟实验调优的特定过滤器在直接应用于真实模型时并未能完美运作。在真实世界的测试中,对坏人的检测率降至零,这表明虽然威胁确实存在,但防御系统的精确设置需要针对不同类型的模型进行重新校准。
最终,这项工作强调了随着人工智能向协作式、去中心化训练迈进,它必须建立起更强大的防御机制。研究表明,虽然坏人可以通过用错误答案迷惑模型或用冗长答案淹没模型来轻易破坏学习过程,但通过声誉追踪、统计投票和自适应惩罚的结合,可以显著减轻损害。研究人员得出结论,他们的系统实现了“优雅降级”,这意味着即使网络受到攻击,它也不会完全崩溃,而是能维持一个远好于无保护系统的性能水平。这为构建稳健的、协作式的人工智能系统提供了一条路径,使其能够共同学习而不易被劫持。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。