← Últimos artigos
🤖 machine learning

Corruption Robust Offline Reinforcement Learning with Human Feedback

Este artigo introduz os primeiros algoritmos de aprendizado por reforço offline com feedback humano (RLHF) comprovadamente robustos que podem identificar políticas quase ótimas de conjuntos de dados contendo uma fração ε\varepsilon de pares trajetória-feedback corrompidos, ao aprender modelos de recompensa com conjuntos de confiança e ao alavancar otimização pessimista por meio de oráculos de RL robustos à corrupção.

Autores originais: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

Publicado 2026-07-01
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ensinar um robô a jogar um videogame complexo. Normalmente, você deixaria o robô jogar, observaria o que ele faz e diria a ele: "Bom trabalho!" ou "Mau trabalho!" baseado em quão bem ele se sai. Isso é o Aprendizado por Reforço com Feedback Humano (RLHF).

No entanto, no mundo real, os dados que você coleta não são perfeitos. Às vezes, a pessoa fornecendo o feedback está cansada e comete erros (ruído). Às vezes, um hacker malicioso pode deliberadamente trocar os rótulos de "Bom" e "Mau" para enganar o robô (corrupção).

Este artigo aborda um problema específico e difícil: Como ensinar um robô a jogar bem usando um conjunto de dados que está parcialmente envenenado ou corrompido, sem nunca deixar o robô jogar o jogo novamente (Offline)?

Aqui está uma divisão simples da solução deles, usando algumas analogias criativas.

O Problema Central: O "Livro de Receitas Envenenado"

Imagine que você quer aprender a assar o bolo perfeito. Você tem um livro de receitas (o conjunto de dados) com 1.000 receitas. Mas, um adversário entrou sorrateiramente e alterou 10% das receitas. Algumas dizem "adicione sal" quando deveriam dizer "adicione açúcar", e alguns ingredientes estão listados incorretamente.

Se você apenas seguir o livro cegamente, assará um bolo terrível. Se você tentar aprender assando e provando (RL Online), você pode ficar doente ou desperdiçar muitos ingredientes. Os autores querem um método para olhar para este livro envenenado, descobrir quais receitas são provavelmente reais e ensinar o robô a melhor maneira de assar sem nunca entrar em uma cozinha.

A Estratégia de Três Etapas

Os autores propõem um processo de "detetive" de três etapas para resolver isso:

1. O "Detector de Verdade" (Aprendizado de Recompensa Robusto)

Primeiro, o robô precisa entender o que é "bom". No artigo, isso é chamado de aprender um Modelo de Recompensa.

  • A Analogia: Imagine que você está tentando adivinhar o preço real de uma casa com base em uma lista de vendas. Algumas entradas são falsas (ex: uma mansão listada por $50).
  • O Método: Em vez de tirar a média de todos os preços (o que seria distorcido pelos falsos), os autores usam uma técnica chamada Máxima Verossimilhança Aparada (Trimmed Maximum Likelihood). Pense nisso como um filtro inteligente que diz: "Vou ignorar os 10% superiores dos números mais selvagens e suspeitos e confiar apenas nos 90% centrais". Isso lhes dá uma estimativa "limpa" do que os humanos realmente preferem, mesmo que alguns dados estejam mentindo.

2. A "Rede de Segurança" (Conjuntos de Confiança)

Uma vez que eles tenham um "melhor palpite" sobre a verdadeira recompensa, eles não confiam nele cegamente. Eles constroem um Conjunto de Confiança.

  • A Analogia: Imagine que o detetive diz: "Estou 95% seguro de que o assassino está neste bairro específico". Eles desenham um círculo ao redor desse bairro. Eles sabem que o assassino está em algum lugar dentro desse círculo, mas não têm certeza de onde exatamente.
  • O Método: Eles criam uma "bolha" matemática ao redor da estimativa de recompensa. Eles sabem que a verdadeira recompência está dentro desta bolha, mesmo que não saibam o centro exato.

3. O "Planejador Cauteloso" (Política Pessimista)

Agora, o robô precisa decidir quais movimentos fazer. Como os dados estão corrompidos, o robô deve ser pessimista (cauteloso).

  • A Analogia: Imagine que você está caminhando por uma floresta com neblina onde alguns caminhos estão marcados como "Seguros", mas podem ser armadilhas. Um trilheiro cauteloso não escolheria apenas o caminho que parece melhor; ele escolheria o caminho que é mais seguro mesmo no pior cenário possível dentro da área de neblina.
  • O Método: O robô olha para cada caminho possível dentro da "Rede de Segurança" (o conjunto de confiança) e pergunta: "Qual é a pior recompensa que eu poderia obter se seguir este caminho?". Ele então escolhe o caminho que maximiza esta pior recompensa. Isso garante que, mesmo que os dados tenham sido ligeiramente corrompidos, o robô não cometa um erro catastrófico.

Três Estratégias de "Terreno" Diferentes

O artigo percebe que nem todos os conjuntos de dados são iguais. Alguns são muito ricos (você tem dados para cada movimento possível), enquanto outros são esparsos (você só tem dados para alguns movimentos). Eles projetaram três algoritmos diferentes dependendo do "terreno" dos dados:

  1. Cobertura Uniforme (O "Mapa Rico"):

    • Cenário: Você tem dados cobrindo cada canto do mundo do jogo.
    • Resultado: O robô pode aprender quase perfeitamente, com muito pouco erro, mesmo com corrupção. É como ter um mapa completo e de alta resolução onde você consegue identificar facilmente as estradas falsas.
  2. Número de Condição Relativo Baixo (O "Mapa Áspero"):

    • Cenário: Você não tem dados para todos os cantos, mas os dados que você tem são um tanto representativos de todo o mundo.
    • Resultado: O robô usa um "oráculo de ordem zero". Pense nisso como um trilheiro cego que pode apenas sentir o chão sob seus pés para adivinhar a inclinação. É mais lento e menos preciso, mas ainda funciona. A taxa de erro é um pouco maior (depende da raiz quadrada da corrupção), mas é comprovadamente seguro.
  3. Cobertura Generalizada Limitada (O "Mapa Inteligente"):

    • Cenário: Os dados são esparsos, mas seguem um padrão específico e previsível.
    • Resultado: O robô usa um "oráculo de primeira ordem". Isso é como um trilheiro que não apenas sente o chão, mas também vê o gradiente (inclinação) à frente. Isso permite que o robô seja muito mais eficiente, alcançando uma taxa de erro muito melhor (proporcional à raiz quadrada da corrupção) com menos pontos de dados.

A Grande Conclusão

A principal conquista do artigo é provar que você pode matematicamente garantir que um robô aprenda uma boa estratégia a partir de dados corrompidos, desde que você use essas técnicas específicas de "cautela" e "filtragem".

Eles não disseram apenas: "Provavelmente funciona". Eles construíram um escudo matemático que prova: "Mesmo que 10% dos seus dados estejam mentindo para você, nosso método encontrará uma estratégia que é quase tão boa quanto se você tivesse dados perfeitos".

Esta é a primeira vez que tal garantia rigorosa é feita especificamente para o aprendizado offline com feedback humano na presença de ataques adversários. É como dar a um robô um par de "óculos da verdade" que o permitem enxergar através das mentiras em seu manual de treinamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →