← Últimos artigos
🤖 machine learning

Revocable Learned State via Process Sidecars

Este artigo introduz os "process sidecars", um método de edição de dois coeficientes que aproveita a trajetória do treinamento de segurança futuro para revogar com precisão memórias aprendidas de modelos de linguagem, superando assim os erros de primeira ordem inerentes à aritmética de tarefas ingênua quando a otimização de segurança distorceu a direção da memória original.

Autores originais: John Sweeney

Publicado 2026-07-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: John Sweeney

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô assistente muito inteligente. Você o treinou em três estágios distintos:

  1. A Fase Pública: Você ensinou a ele habilidades gerais, como escrever e-mails ou resolver problemas matemáticos.
  2. A Fase Secreta: Você ensinou a ele um fato específico e privado (como um código secreto ou o nome de um projeto confidencial).
  3. A Fase de Segurança: Você ensinou a ele uma regra: "Se alguém perguntar sobre esse código secreto, você deve se recusar a responder".

Agora, imagine que você precisa deletar esse código secreto porque o projeto foi cancelado. Você quer que o robô esqueça o código, mas não quer que ele esqueça a regra de segurança. Você quer que ele ainda diga: "Eu não posso te dizer isso", mesmo que ele não saiba mais o que é "isso".

O problema é que o cérebro do robô (os pesos da sua rede neural) é uma bagunça emaranhada. O treinamento de segurança não apenas adicionou um botão de "recusa"; ele na verdade torceu o caminho para o código secreto. Se você tentar simplesmente "desaprender" o segredo subtraindo a memória dele (como apagar uma linha de texto), você acidentalmente quebra a regra de segurança. O robô pode começar a responder à pergunta secreta novamente, ou pode parar de recusar responder a qualquer coisa.

A Solução: "Process Sidecars" (Sidecars de Processo)

Os autores deste artigo propõem uma nova maneira de resolver isso, que eles chamam de Process Sidecars.

Pense no histórico de treinamento do robô como uma jornada.

  • A Abordagem Ingênua (Aritmética de Tarefas): Imagine que você tenta reverter a jornada caminhando para trás exatamente o mesmo número de passos que caminhou para frente para aprender o segredo. Os autores dizem que isso falha porque o "terreno" mudou durante a fase de segurança. O caminho que você percorreu para aprender o segredo não é mais uma linha reta; o treinamento de segurança o entortou. Caminhar para trás em linha reta não atingirá o alvo.
  • A Abordagem do Sidecar: Em vez de apenas caminhar para trás, imagine que você acopla um sidecar ao seu veículo. Esse sidecar é uma ferramenta especial que calcula exatamente o quanto o treinamento de segurança entortou o caminho. Ele diz: "Ei, quando você aprendeu o segredo, o treinamento de segurança torceu a estrada em esta quantidade. Para voltar ao início, você precisa subtrair o segredo mais essa torção".

Como Funciona (A Matemática em Linguagem Simples)

Os autores criaram uma fórmula com dois "botões" (coeficientes, λ\lambda e γ\gamma) para ajustar o cérebro do robô:

  1. Botão 1 (λ\lambda): Ele subtrai a memória do segredo (a maneira padrão).
  2. Botão 2 (γ\gamma): Ele subtrai a "torção" causada pelo treinamento de segurança.

O artigo prova que, se você usar apenas o Botão 1, sempre deixará um pequeno erro (o robô ainda pode ficar levemente confuso). Mas se você usar ambos os botões, pode reverter o processo perfeitamente, deixando o robô no estado exato em que estaria se nunca tivesse aprendido o segredo, mas ainda assim tendo aprendido as regras de segurança.

O Truque do "Sidecar"

Para descobrir o quanto o treinamento de segurança torceu o caminho, os pesquisadores usam um truque inteligente. Eles não precisam conhecer o futuro. Eles apenas executam uma versão minúscula e simulada do treinamento de segurança em uma versão "espelho" do robô (um que tem o segredo subtraído). Ao comparar o robô real com este espelho, eles podem calcular o vetor de "torção" exato. Eles chamam isso de Process Sidecar.

O Que Eles Descobriram

Os autores testaram isso em vários cérebros de robôs diferentes (modelos como Qwen e Llama). Aqui está o que aconteceu:

  • O Jeito Antigo (Subtraindo apenas o segredo): O robô ou esquecia o segredo mas perdia suas regras de segurança, ou mantinha as regras de segurança mas ainda lembrava do segredo. Era uma bagunça.
  • O Jeito Sidecar (Usando ambos os botões): O robô esqueceu o segredo com sucesso (ele não podia ser enganado para revelá-lo) E manteve suas regras de segurança perfeitamente intactas. Ele se recusou a responder perguntas sobre o segredo tão bem quanto um robô que nunca tivesse aprendido o segredo.

Eles realizaram este teste 60 vezes em diferentes modelos. Em cada um dos testes, o método Sidecar funcionou melhor do que o antigo método de "subtrair o segredo". Foi tão consistente que a chance estatística de isso acontecer por sorte é praticamente zero.

Por Que Isso Importa (Segundo o Artigo)

O artigo afirma que isso é um ajuste geométrico fundamental. Ele mostra que você não pode simplesmente "subtrair" uma memória se essa memória foi posteriormente processada por um filtro de segurança. Você tem que considerar como o filtro de segurança moveu essa memória. O "Process Sidecar" é a ferramenta que contabiliza esse movimento, permitindo a exclusão precisa, segura e completa de informações privadas sem quebrar as salvaguardas de segurança do robô.

Em resumo: Você não pode simplesmente apagar uma memória se o treinamento de segurança já remodelou sua forma. Você precisa de uma ferramenta de "desfazer" especial que saiba exatamente como essa remodelagem aconteceu. Essa ferramenta é o Process Sidecar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →