← 最新论文
🤖 machine learning

Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks

本文提出了对抗训练决策预训练 Transformer(AT-DPT),这是一个通过同时训练决策预训练 Transformer 和一组攻击者,以实现针对奖励投毒攻击的鲁棒上下文强化学习的新型框架,证明了其在 bandit 和复杂 MDP 环境中均优于标准基准模型的性能。

原作者: Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教机器人通过“小抄”来学习

想象一下,你正在教一个机器人玩电子游戏。通常情况下,你可能会为它编写特定的规则,或者让它练习好几个小时直到它掌握游戏。

但这篇论文研究的是一种不同类型的机器人:它使用的是上下文强化学习(In-Context Reinforcement Learning, ICRL)。你可以把这个机器人想象成一个超级聪明的学生,它不需要被重新编程。相反,你只需要递给它一份“小抄”(过去动作和奖励的历史记录),然后说:“这就是游戏的规则;现在去玩吧。”机器人阅读这份小抄,识破其中的规律,然后立即开始游戏。

这篇论文关注的是一种名为 DPT(决策预训练 Transformer)的特定机器人。它非常擅长阅读这些“小抄”。但问题在于:如果有人篡改了这份小抄怎么办?

问题所在:“中毒”的小抄

在现实世界中,坏人(攻击者)可能会试图欺骗机器人。他们无法改变机器人的大脑,但他们可以改变机器人在其历史记录中看到的奖励(rewards)

  • 场景: 想象机器人正在学习如何在市场里挑选最好的水果。
  • 攻击: 一个破坏者偷偷修改了机器人历史记录中水果的价格标签。他们让烂苹果看起来很贵(高奖励),让新鲜苹果看起来很便宜(低奖励)。
  • 结果: 机器人阅读了被“投毒”的历史记录,认为烂苹果才是最好的选择,并开始购买它们。这被称为奖励投毒攻击(Reward Poisoning Attack)

以往的大多数研究都集中在保护那些在“训练期间”学习的机器人。而这篇论文探讨的是:我们如何保护一个仅仅通过阅读事件历史就能进行“即时”学习的机器人?

解决方案:“陪练”方法 (AT-DPT)

作者创建了一种名为 AT-DPT(对抗训练 DPT)的新方法。他们不仅仅是尝试修补机器人,而是通过一种叫做**对抗训练(Adversarial Training)**的技术,教会了机器人如何反击。

这就像是一个武术道馆:

  1. 学生(机器人): 我们希望机器人在数据混乱的情况下也能学会选择最佳动作。
  2. 陪练(攻击者): 研究人员创造了一个“反派”AI,它的唯一任务就是试图欺骗机器人。这个反派会不断尝试重写历史记录(奖励),以诱导机器人做出错误的决策。
  3. 训练循环:
    • 反派试图投毒机器人的历史记录。
    • 机器人试图忽略这些毒素并寻找真相。
    • 他们反复进行这个过程。
    • 最终,机器人变得非常擅长识破谎言,即使反派竭尽全力想要欺骗它,它依然能够获胜。

其结果是,这个机器人拥有了“见多识广”的能力。它已经学会了,有时奖励数值是谎言,因此它知道如何透过现象看本质,找到真正的真相。

他们是如何测试的

研究人员在三个不同的场景(就像游戏中的不同关卡)中测试了这个“超级机器人”:

  1. 老虎机(Bandits): 想象一排 5 台老虎机。机器人必须找出哪一台的赔付率最高。攻击者试图对每台机器的赔付情况撒谎。
    • 结果: AT-DPT 机器人找出了真正的赢家,而标准的机器人(如 Thompson Sampling 或 UCB)则会被搞糊涂,并一直选择输钱的机器。
  2. 迷宫(MDPs): 想象一个机器人在黑暗的房间里寻找宝藏。攻击者试图对某个动作的好坏撒谎。
    • 结果: 即使面对聪明且具有适应性(根据机器人的行为改变谎言)的攻击者,AT-DPT 机器人也比其他方法更可靠地找到了宝藏。
  3. 视觉迷宫: 他们甚至在一个 3D 环境中进行了测试,机器人需要利用图像进行导航。AT-DPT 机器人依然表现得比其他方法更好。

为什么这很重要

论文声称,通过训练机器人去“预料谎言”(投毒数据),它会变得更加鲁棒(稳健)。

  • 标准机器人 就像那些相信报纸上所有内容的人。如果报纸印了谎言,它们就会相信。
  • AT-DPT 机器人 则像是一名接受过伪造大师训练的侦探。它知道报纸可能会撒谎,所以它会核实事实,并依然能找到真相。

作者总结道,这种方法(使用一群攻击者来训练学习者)是构建安全、可靠 AI 的强大方式,即使数据正受到恶意行为者的篡改。他们还指出,即使机器人在识别谎言方面并不完美,只要它经过了针对多种复杂攻击者的训练,这种方法依然非常有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →