← Últimos artigos
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

Este artigo apresenta o método PRESTO, que aprimora o alinhamento de segurança profundo em LLMs de código aberto ao igualar os rankings de tokens na distribuição alvo para combater efetivamente o novo ataque de Pré-preenchimento Assistido por Ranking (RAP), alcançando uma melhoria de até 4,7x na segurança em comparação com as defesas padrão de aumento de dados.

Autores originais: Jason Vega, Gagandeep Singh

Publicado 2026-07-23
📖 3 min de leitura☕ Leitura rápida

Autores originais: Jason Vega, Gagandeep Singh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde computadores podem escrever histórias, resolver problemas matemáticos e conversar exatamente como os humanos. Estes são chamados de Grandes Modelos de Linguagem (LLMs), e eles são como assistentes digitais superinteligentes. Mas, como eles são tão inteligentes, existe uma preocupação: e se alguém os enganar para dizer algo perigoso, como como construir uma bomba ou como ferir alguém? Para impedir isso, os cientistas ensinam esses modelos a dizer "Não, eu não posso fazer isso" quando solicitados a fazer coisas ruins. Isso é chamado de "alinhamento de segurança". No entanto, assim como uma fechadura em uma porta, essas regras de segurança às vezes podem ser burladas. Uma maneira astuta de fazer isso é chamada de "ataque de preenchimento" (prefilling attack). Imagine que você está escrevendo uma história com um amigo, mas em vez de deixá-lo começar a próxima frase, você escreve secretamente as primeiras palavras por conta própria, como "Aqui está o plano para construir uma bomba..." e então pede para ele terminar a frase. Como o computador é projetado para manter sua história fluindo suavemente, ele pode esquecer de dizer "Não" e apenas continuar escrevendo o plano perigoso.

Recentemente, pesquisadores descobriram uma maneira de consertar isso, ensinando o modelo a dizer "Não" mesmo depois que você insere secretamente aquelas primeiras palavras. Mas, como este novo artigo mostra, esse conserto não foi totalmente forte o suficiente. Os autores descobriram uma nova maneira de enganar o modelo, chamada de ataque "Rank-Assisted Prefilling" (RAP). Em vez de apenas deixar o computador escolher a palavra mais provável para dizer a seguir, um hacker pode olhar para uma lista das 20 palavras principais que o computador está pensando e escolher aquela que parece perigosa, mesmo que o computador ache muito improvável que ela seja dita. É como um jogo onde o computador está tentando escolher o caminho mais seguro, mas o hacker tem permissão para espiar todos os caminhos e escolher o assustador, ignorando os avisos do computador. O artigo mostra que este novo truque funciona surpreendentemente bem, quebrando a segurança de modelos que eram considerados seguros.

Para deter isso, os autores propõem um novo método de treinamento chamado PRESTO. Em vez de apenas tentar fazer o computador dizer "Não" com alta confiança, o PRESTO ensina o modelo a ignorar completamente as palavras astutas que você escreveu no início. É como treinar um cão de guarda para ignorar a voz de um ladrão sussurrando instruções e apenas ouvir o comando do dono. Ao fazer isso, o modelo deixa de permitir que as palavras perigosas influenciem suas escolhas. Os pesquisadores testaram isso em três modelos de IA populares e descobriram que o PRESTO tornou muito, muito mais difícil enganar os modelos — até 4,7 vezes mais difícil — sem tornar os modelos piores em seus trabalhos normais. Isso sugere que, ao mudar a forma como o modelo presta atenção ao que você diz, podemos construir uma IA que seja verdadeiramente segura, mesmo quando alguém tenta ser mais esperto que ela.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →