← Últimos artigos
🤖 machine learning

Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks

Este artigo propõe o Adversarially Trained DPT (AT-DPT), um novo framework que treina simultaneamente um Decision-Pretrained Transformer e uma população de atacantes para alcançar um aprendizado por reforço in-context robusto contra ataques de envenenamento de recompensa, demonstrando desempenho superior em relação aos baselines padrão tanto em ambientes bandit quanto em MDPs complexos.

Autores originais: Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Ensinando um Robô a Aprender com uma Folha de Cola

Imagine que você está ensinando um robô a jogar um videogame. Normalmente, você poderia programá-lo com regras específicas ou deixá-lo praticar por horas até que ele entenda o jogo.

Mas este artigo trata de um tipo diferente de robô: um que utiliza Aprendizado por Reforço em Contexto (ICRL - In-Context Reinforcement Learning). Pense neste robô como um estudante superinteligente que não precisa ser reprogramado. Em vez disso, você apenas lhe entrega uma "folha de cola" (um histórico de movimentos e recompensas passados) e diz: "Aqui está como o jogo funciona; agora vá jogar". O robô lê a folha de cola, entende o padrão e começa a jogar imediatamente.

O artigo foca em um tipo específico de robô chamado DPT (Decision-Pretrained Transformer). Ele é ótimo em ler essas folhas de cola. Mas há um problema: E se alguém adulterar a folha de cola?

O Problema: A Folha de Cola "Envenenada"

No mundo real, um agente mal-intencionado (o atacante) pode tentar enganar o robô. Eles não podem mudar o céreð do robô, mas podem mudar as recompensas que o robô vê em seu histórico.

  • O Cenário: Imagine que o robô está aprendendo a escolher a melhor fruta em um mercado.
  • O Ataque: Um sabotador altera secretamente as etiquetas de preço das frutas no histórico do robô. Eles fazem com que as maçãs podres pareçam caras (recompensa alta) e as maçãs frescas pareçam baratas (recompensa baixa).
  • O Resultado: O robô lê o histórico envenenado, pensa que as maçãs podres são a melhor escolha e começa a comprá-las. Isso é chamado de Ataque de Envenenamento de Recompensa (Reward Poisoning Attack).

A maioria das pesquisas anteriores focou em proteger robôs que aprendem durante o treinamento. Este artigo pergunta: Como protegemos um robô que está aprendendo "em tempo real", apenas lendo um histórico de eventos?

A Solução: O Método do "Parceiro de Treino" (AT-DPT)

Os autores criaram um novo método chamado AT-DPT (Adversarially Trained DPT). Eles não tentaram apenas remendar o robô; eles o ensinaram a lutar de volta usando uma técnica chamada Treinamento Adversário (Adversarial Training).

Pense nisso como um dojo de artes marciais:

  1. O Estudante (O Robô): Queremos que o robô aprenda a escolher as melhores ações mesmo quando os dados estão bagunçados.
  2. O Parceiro de Treino (O Atacante): Os pesquisadores criaram um "vilão" de IA cujo único trabalho é tentar enganar o robô. Este vilão tenta constantemente reescrever o histórico (as recompensas) para fazer o robô tomar decisões ruins.
  3. O Ciclo de Treinamento:
    • O Vilão tenta envenenar o histórico do robô.
    • O Robô tenta ignorar o veneno e descobrir a verdade.
    • Eles fazem isso repetidamente.
    • Eventualmente, o Robô torna-se tão bom em detectar mentiras que consegue vencer, mesmo quando o Vilão está fazendo o seu melhor para enganá-lo.

O resultado é um robô que "já viu de tudo". Ele aprendeu que, às vezes, os números das recompensas são mentiras e sabe como olhar além deles para encontrar a verdadeira realidade.

Como Eles Testaram

Os pesquisadores testaram este "super-robô" em três cenários diferentes, como níveis de um videogame:

  1. A Máquina Caça-Níqueis (Bandits): Imagine uma fileira de 5 máquinas caça-níqueis. O robô tem que descobrir qual delas paga mais. O atacante tenta mentir sobre quanto cada máquina paga.
    • Resultado: O robô AT-DPT descobriu os vencedores reais, enquanto os robôs padrão (como Thompson Sampling ou UCB) ficaram confusos e continuaram escolhendo os perdedores.
  2. O Labirinto (MDPs): Imagine um robô navegando em uma sala escura para encontrar um tesouro. O atacante tenta mentir sobre o quão boa foi uma jogada.
    • Resultado: O robô AT-DPT encontrou o tesouro de forma muito mais confiável do que outros métodos, mesmo quando o atacante era inteligente e adaptável (mudando suas mentiras com base no que o robô fazia).
  3. O Labirinto Visual: Eles testaram até mesmo em um ambiente 3D onde o robô tinha que navegar usando imagens. O robô AT-DPT ainda teve um desempenho superior aos demais.

Por Que Isso Importa

O artigo afirma que, ao treinar o robô para esperar mentiras (dados envenenados), ele se torna muito mais robusto.

  • Robôs padrão são como pessoas que acreditam em tudo o que leem em um jornal. Se o jornal publica uma mentira, elas acreditam.
  • O robô AT-DPT é como um detetive que foi treinado por um mestre falsificador. Ele sabe que o jornal pode estar mentindo, então ele verifica os fatos e ainda assim encontra a verdade.

Os autores concluem que esta abordagem (usar uma população de atacantes para treinar o aprendiz) é uma maneira poderosa de construir uma IA segura e confiável, mesmo quando os dados nos quais ela se baseia estão sendo adulterados por agentes maliciosos. Eles também observaram que este método funciona bem mesmo se o robô não for perfeito em detectar as mentiras, desde que tenha sido treinado contra uma variedade de atacantes astutos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →