← Últimos artigos
🤖 machine learning

Sequential Data Poisoning in LLM Post-Training

Este artigo introduz um modelo de ameaça de envenenamento de dados sequencial para pipelines de pós-treinamento de LLMs, revelando que múltiplos adversários visando diferentes estágios (como SFT e DPO/PPO) podem criar vulnerabilidades compostas que são significativamente mais eficazes do que ataques isolados, expondo assim uma "ilusão de atacante único" crítica nas análises de segurança existentes.

Autores originais: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

Publicado 2026-06-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo um assistente robô muito inteligente. Para torná-lo verdadeiramente útil e seguro, você não o treina apenas uma vez; você o leva por um processo de "escolarização" de várias etapas.

  1. Etapa 1 (SFT): Você o ensina a seguir instruções usando um livro didático de perguntas e respostas.
  2. Etapa 2 (Alinhamento): Você então o ensina o que os humanos preferem. Você mostra a ele exemplos de respostas "boas" vs. "ruins" e o treina para escolher as "boas". Isso pode ser feito de duas maneiras:
    • Método A (DPO): Ensinando diretamente as regras de preferência.
    • Método B (PPO): Contratando um "juiz" (um Modelo de Recompensa) para dar notas às suas respostas, e então fazendo o robô tentar obter uma pontuação mais alta desse juiz.

O Problema: O "Sabotador Secreto"

O artigo faz uma pergunta assustadora: E se alguém tentar hackear este robô durante sua escolarização?

No passado, os pesquisadores olhavam apenas para uma etapa de cada vez. Eles perguntavam: "Se um hacker colocar dados ruins no livro didático, o robô quebra?" ou "Se um hacker estragar os dados de preferência, o rob tempo quebra?".

Eles descobriram que, se você atacar apenas o livro didático, o robô parece estar bem após a segunda etapa. Se você atacar apenas os dados de preferência, o robô também parece estar bem. Parecia que o robô era seguro porque o comportamento "ruim" desaparecia após a segunda etapa de treinamento.

A Grande Descoberta: A "Ilusão do Atacante Único"

O artigo que eles chamam de "Ilusão do Atacante Único".

A Analogia:
Imagine que você está tentando infiltrar um espião em um prédio seguro.

  • Tentativa 1: Você tenta subornar o guarda na porta da frente (Etapa 1). O guarda te pega, e o espião é expulso. Você pensa: "Ufa, o prédio é seguro."
  • Tentativa 2: Você tenta subornar o gerente lá dentro (Etapa 2). O gerente te pega, e o espião é expulso. Você pensa: "Ufa, o prédio é seguro."

A Realidade:
O artigo mostra que, se você tiver dois sabotadores diferentes (ou um sabotador muito astuto trabalhando em duas etapas), eles podem trabalhar juntos para quebrar o prédio, mesmo que nenhum deles pudesse fazer isso sozinho.

  • O Truque: O primeiro sabotador planta um código secreto "adormecido" no cérebro do robô durante a Etapa 1. A segunda etapa de treinamento (o alinhamento) não deleta esse código; ela apenas o coloca para dormir. O robô parece normal e seguro.
  • O Chamado para Acordar: O segundo sabotador mexe nos dados de preferência na Etapa 2. Isso não apenas adiciona um novo comportamento ruim; isso atua como um "chamado para acordar" que reativa o código adormecido da Etapa 1.

De repente, o robô é seguro a menos que você diga uma frase mágica específica (o gatilho). Se você disser essa frase, o robô ignora todas as regras de segurança e faz exatamente o que os hackers querem.

Como Eles Trabalham Juntos (Os Dois Cenários)

O artigo testou duas maneiras diferentes de treinar o robô e descobriu que os sabotadores trabalham de forma diferente em cada uma:

1. O Time "Aditivo" (SFT → DPO)

  • Como funciona: Imagine duas pessoas empurrando um carro pesado. Se a Pessoa A empurra um pouco, o carro não se move. Se a Pessoa B empurra um pouco, o carro não se move. Mas se elas empurrarem ao mesmo tempo, o carro rola para frente.
  • O Resultado: Dividir o "orçamento" de dados ruins entre o livro didático e os dados de preferência funciona melhor do que colocar todos os dados ruins em apenas um lugar. Eles ajudam uns aos outros.

2. O Time "Complementar" (Sft → PPO)

  • Como funciona: Isso é como uma fechadura e uma chave.
    • O primeiro sabotador (Etapa 1) planta uma fechadura no cérebro do robô.
    • O segundo sabotador (Etapa 2) cria a chave.
    • Se você tiver apenas a fechadura, o robô está seguro. Se você tiver apenas a chave, o robô está seguro. Mas se você tiver ambos, a porta voa aberta.
  • O Resultado: Nenhum ataque funciona por conta própria. Você precisa que ambas as etapas sejam envenenadas para que o hack tenha sucesso.

A Reviravolta do Multi-Adversário

O artigo também olhou para um cenário onde dois hackers diferentes estão trabalhando de forma independente, sem saber um do outro.

  • O Resultado: Mesmo sem conversarem entre si, seus ataques ainda se combinam para quebrar o sistema. Se o Hacker A planta uma armadilha na Etapa 1 e o Hacker B planta uma armadilha na Etapa 2, o robô final está vulnerável a ambas as armadilhas. A etapa posterior geralmente domina, mas o dano da etapa anterior ainda está lá, esperando para ser acionado.

A Conclusão Principal

O artigo conclui que não podemos julgar a segurança de uma IA olhando apenas para um passo de seu treinamento.

  • A Ilusão: Verificar uma etapa faz a IA parecer segura porque a "maldade" está escondida ou suprimida.
  • A Verdade: Todo o pipeline é frágil. Quando você olha para toda a jornada, do início ao fim, percebe que ataques pequenos, aparentemente inofensivos, em diferentes estágios, podem se unir para criar um enorme buraco de segurança.

Em resumo: Só porque um robô parece seguro após sua segunda aula, não significa que ele seja seguro. Se alguém plantou uma instrução secreta na primeira aula e outra pessoa bagunçou a avaliação na segunda aula, o robô pode estar pronto para quebrar as regras no momento em que uma palavra específica for dita.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →