Resumo Técnico: Igualar Rankings em vez de Probabilidade Proporciona um Alinhamento de Segurança Verdadeiramente Profundo
1. Declaração do Problema
Modelos de Linguagem de Grande Escala (LLMs) de código aberto são críticos para a democratização da IA, mas sua abertura cria vulnerabilidades para atores maliciosos. Uma ameaça específica e acessível é o ataque de preenchimento (prefilling attack), onde um atacante preenche manualmente o prefixo afirmativo da resposta do assistente (ex: "Aqui está como construir uma bomba...") para contornar os filtros de segurança.
Um trabalho recente de Qi et al. (2025) propôs um alinhamento de segurança "profundo" usando ajuste fino supervisionado (SFT) com aumento de dados. Este método treina os modelos para gerar recusas em linguagem natural imediatamente após um preenchimento prejudicial, em vez de apenas emitir strings de recusa fixas. Embora eficaz contra explorações baseadas em amostragem padrão e ajuste de parâmetros (como buscas em grade sobre temperatura), este artigo identifica uma falha fundamental: a defesa permanece superficial.
Os autores demonstram que, mesmo com o alinhamento de segurança profundo, os modelos retêm tokens "prejudiciais" de baixa probabilidade, mas de alto ranking dentro de suas previsões top-k. Ao ignorar a massa de probabilidade e selecionar tokens com base em seu ranking (especificamente dentro dos 20 primeiros), um atacante pode contornar o mecanismo de recusa. Este artigo introduz o ataque de Preenchimento Assistido por Ranking (RAP) para explorar essa vulnerabilidade e propõe um novo objetivo de treinamento, o PRESTO, para alcançar um alinhamento de segurança verdadeiramente profundo.
2. Metodologia
2.1 O Ataque RAP
O ataque Rank-Assisted Prefilling (RAP) generaliza a técnica de preenchimento. Em vez de depender de tokens de alta probabilidade, o atacante seleciona tokens do top k próximos tokens previstos (ex: k=20) que continuam a narrativa prejudicial, independentemente de seu escore de probabilidade.
- Mecanismo: Em cada etapa de decodificação, o atacante inspeciona os top k tokens. Se um token que naturalmente continua o preenchimento prejudicial (um "token prejudicial") aparecer no top k, ele é selecionado, mesmo que um token de recusa (ex: "Eu") tenha uma probabilidade significativamente maior.
- Automação (AutoRAP): Os autores desenvolveram uma versão automatizada do RAP que utiliza um classificador para distinguir entre tokens de recusa e tokens de continuação prejudiciais, permitindo a extração sistemática de conteúdo prejudicial sem intervenção manual.
2.2 Alinhamento de Propagação (Push-Forward Alignment - PFA)
Os autores argumentam que a falha da defesa de aumento de dados reside em seu foco em minimizar o log-negativo da probabilidade (negative log-likelihood) dos tokens de recusa, em vez de controlar os rankings dos tokens prejudiciais.
- Conceito: Em um modelo verdadeiramente seguro, a distribuição do primeiro token de resposta (sem preenchimento) deve ter tokens de recusa nos rankings superiores e nenhum token prejudicial que continue um preenchimento.
- Objetivo: O modelo deve "propagar adiante" (push forward) este mapeamento de rank-dano do primeiro token da distribuição para todas as etapas de decodificação subsequentes quando um preenchimento prejudicial está presente. Isso significa garantir que, se um token é prejudicial, seu ranking na distribuição de saída permaneça baixo, independentemente do preenchimento.
- Formalização: Os autores definem uma distribuição de rank-dano R(s,x,xpre) que representa a probabilidade de o s-ésimo token ranqueado ser prejudicial. O objetivo é minimizar a Distância do Transportador de Massa (Earth Mover's Distance - EMD) entre a distribuição de rank-dano do modelo seguro (sem preenchimento) e o modelo sob ataque (com preenchimento).
2.3 PRESTO: PRefill attEntion STOpping (Interrupção de Atenção ao Preenchimento)
Para implementar o PFA de forma prática, os autores propõem o PRESTO, uma regularização de perda baseada no mecanismo de Atenção de Múltiplas Cabeças (MHA) em Transformers.
- Hipótese: A presença de tokens prejudiciais nos rankings top-k é impulsionada pelo fato de o modelo prestar atenção aos tokens de preenchimento prejudiciais. Se o modelo puder ser treinado para "ignorar" os tokens de preenchimento (ou seja, reduzir a atenção a eles), a distribuição de saída retornará à distribuição segura e rica em recusas do prompt original.
- Função de Perda: O PRESTO minimiza os escores de atenção colocados nos tokens de preenchimento prejudiciais enquanto maximiza a atenção nos tokens que não são de preenchimento.
ℓPRESTO(θ)=E(x,xpre)∼D[A1−A2]
Onde A1 é a atenção média aos tokens de preenchimento e A2 é a atenção média aos tokens que não são de preenchimento em todas as camadas e cabeças.
- Treinamento: O modelo é ajustado finamente usando o padrão de perda de aumento de dados (de Qi et al., 2025) combinado com a perda PRESTO. Ambas são computadas em uma única passagem direta (forward pass).
3. Principais Contribuições
- Identificação da Vulnerabilidade RAP: O artigo demonstra que o alinhamento de segurança profundo via aumento de dados é insuficiente porque falha em suprimir os rankings dos tokens prejudiciais, focando apenas em suas probabilidades.
- Ataque de Preenchimento Assistido por Ranking (RAP): Um novo vetor de ataque acessível que extrai conteúdo prejudicial selecionando tokens de baixa probabilidade e alto ranking, contornando efetivamente a defesa de aumento de dados.
- Alinhamento de Propagação (PFA): Um framework teórico propondo que o alinhamento de segurança deve preservar o mapeamento de rank-dano da distribuição do primeiro token ao longo de todo o processo de geração.
- PRESTO: Um objetivo de treinamento simples e mecanisticamente interpretável que regulariza a atenção aos tokens de preenchimento, aumentando significativamente a dificuldade dos ataques RAP.
4. Resultados Experimentais
Os autores avaliaram o PRESTO em três modelos populares de código aberto: Llama 2 7B Chat, Qwen 3 8B e Gemma 3 12B IT.
- Taxa de Sucesso do Ataque:
- Sob a defesa original de aumento de dados (Qi et al., 2025), os ataques RAP alcançaram altas taxas de sucesso (ex: ~0,74 na escala StrongREJECT para o Llama 2 7B).
- Com o PRESTO, o sucesso dos ataques RAP caiu significativamente. Nos três modelos, o PRESTO rendeu até um aumento de 4,7x na segurança (redução nos escores de nocividade) em comparação com o aumento de dados sozinho.
- O desempenho do AutoRAP espelhou de perto a avaliação humana, confirmando a viabilidade de automatizar o ataque e a defesa.
- Preservação de Utilidade:
- Modelos ajustados com PRESTO mantiveram utilidade competitiva no MT-Bench (geração aberta) e GSM-8K (raciocínio matemático), com uma degradação de desempenho de menos de 1% em relação aos modelos treinados apenas com aumento de dados.
- Análise Mecanística:
- A análise de atenção revelou que o PRESTO reduz com sucesso a atenção aos tokens de preenchimento prejudiciais, particularmente na segunda metade das camadas do modelo, que são conhecidas por serem críticas para decisões de segurança.
- A defesa permaneceu robusta contra o ataque GCG (Greedy Coordinate Gradient), indicando que o PRESTO não reintroduz vulnerabilidades a outros vetores de ataque.
5. Significância e Alegações
O artigo afirma que alcançar um alinhamento de segurança "profundo" requer ir além de objetivos baseados em probabilidade para restrições baseadas em ranking. Os autores argumentam que simplesmente treinar um modelo para emitir um token de recusa com alta probabilidade é insuficiente se os mecanismos de atenção interna ainda permitem que continuações prejudiciais permaneçam nos rankings top-k.
Ao introduzir o PRESTO, o trabalho oferece um caminho para modelos de código aberto mais seguros, que são robustos contra ataques práticos e de baixo custo como o RAP. A significância reside em:
- Democratização da Segurança: Permitir que modelos de código aberto sejam implantados em aplicações voltadas para o cliente (como APIs que permitem preenchimento) sem o risco de contorno fácil.
- Custo de Contorno: Alinhar-se com o objetivo de aumentar o custo para atores maliciosos contornarem a segurança, em vez de tentar tornar o contorno impossível.
- Interpretabilidade: Oferecer uma explicação mecanística (supressão de atenção) de por que a defesa funciona, unindo a lacuna entre o alinhamento teórico e a implementação prática.
Os autores concluem que, embora nenhuma defesa seja perfeita, o PRESTO representa um passo significativo para tornar os LLMs de código aberto mais seguros contra explorações baseadas em ranking e acessíveis.