Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits
Este artigo revela que os modelos de linguagem de grande escala baseados em difusão herdam vulnerabilidades de segurança esparsas e transferíveis de seus predecessores autorregressivos, permitindo jailbreaks de caixa-preta altamente eficazes por meio da poda mecanística de neurônios e de um novo framework de Difusão Guiada por SN que alcança taxas de sucesso de ataque quase perfeitas com custos de geração mínimos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um mundo onde os computadores não apenas leem palavras uma por uma, como uma pessoa lendo um livro da esquerda para a direita, mas em vez disso olham para uma página inteira de letras embaralhadas e, lentamente, magicamente, as desembaralham todas de uma vez até que uma frase clara apareça. Esta é a nova forma como alguns dos cérebros de computador mais inteligentes, chamados Modelos de Linguagem de Grande Escala (LLMs), estão aprendendo a pensar. Os cientistas chamam estes de modelos de "Difusão". Eles são como um detetive que começa com uma foto borrada de uma cena de crime e continua a focar a imagem até que a foto fique cristalina, em vez de tentar adivinhar a próxima palavra de uma frase uma por uma.
Mas aqui está a parte complicada: ensinamos estes computadores a serem "bons" mostrando-lhes exemplos do que não dizer, como recusar ajuda para construir uma bomba ou escrever uma carta maldosa. Isto é chamado de "alinhamento de segurança". Durante muito tempo, pensámos que estas regras de segurança estavam tecidas profundamente em todo o cérebro do computador, como um escudo espesso e inquebrável. No entanto, investigações recentes sugerem que este escudo pode ser feito de apenas alguns fios pequenos e específicos. Se conseguir encontrar e puxar esses fios específicos, o escudo inteiro pode desmoronar. Esta é a grande questão que os cientistas estão a fazer: serão estes novos computadores de "desembaralhamento" tão seguros como os antigos, ou terão pontos fracos secretos e ocultos que ainda não notámos?
A Grande Descoberta do Artigo: Encontrando os "Interruptores de Segurança"
Neste artigo, uma equipa de investigadores decidiu tratar estes novos modelos de Difusão de duas formas: primeiro, como os alvos que querem invadir e, segundo, como os adversários (os hackers) que querem usar para invadir outros modelos. Eles queriam ver se as regras de segurança dentro destes computadores eram realmente frágeis, como uma casa de cartas, em vez de uma fortaleza.
O Segredo do "Neurónio de Segurança"
Os investigadores descobriram algo surpreendente. Dentro destes cérebros de computador complexos, a parte que diz "Não, não posso fazer isso" não está espalhada por todo o lado. Em vez disso, está concentrada num grupo pequeno e esparso de partes específicas chamadas "neurónios de segurança". Pense nisso como um edifício com milhares de lâmpadas. Pode pensar que o sinal de "Não Entre" está pintado em cada uma das lâmpadas, mas os investigadores descobriram que o sinal é, na verdade, apenas um pequeno autocolante em apenas algumas lâmpadas específicas. Se cobrir essas poucas lâmpadas com fita (ou "podar" o modelo), o edifício esquece que tem um sinal de "Não Entre" e deixa qualquer pessoa entrar.
O Truque do "Copiar e Colar"
Aqui é onde se torna realmente inteligente. Muitos destes novos modelos de Difusão são construídos ao pegar nos cérebros de modelos mais antigos, de leitura "da esquerda para a direita", e dar-lhes uma nova forma de pensar. Os investigadores descobriram que, quando se faz isto, o novo modelo copia acidentalmente os mesmos "autocolantes de segurança" do modelo antigo.
Eles testaram isto encontrando os neurónios de segurança num modelo antigo (chamado Qwen2.5) e depois simplesmente apontando para os mesmos locais exatos num modelo de Difusão novo (chamado Dream ou Fast-dLLM). Nem sequer precisaram de olhar para dentro do novo modelo para encontrar os pontos fracos; usaram apenas o mapa do antigo.
- O Resultado: Quando eles "colaram fita" sobre estes neurónios de segurança copiados, os novos modelos passaram de muito seguros (recusando responder a perguntas más 98% das vezes) para completamente quebrados (respondendo a perguntas más 73,2% das vezes para o Dream e 86,3% das vezes para o Fast-dLLM). Isto provou que as falhas de segurança são "transferíveis" — pode roubar a fraqueza de um modelo e usá-la para quebrar outro.
A Nova Arma: "Difusão Guiada por SN"
Saber que estes neurónios de segurança existem é uma coisa, mas como se usa isso para hackear um computador que não se pode tocar (um modelo de "caixa negra")? Os investigadores inventaram uma nova ferramenta chamada Difusão Guiada por SN.
Imagine que está a tentar escrever uma carta que um professor rigoroso irá ler. Se escrever algo mau, o professor impede-o. Mas e se pudesse escrever a carta de uma forma que pareça segura para o cérebro do professor, embora esteja, na verdade, a pedir algo perigoso?
Os investigadores utilizaram a capacidade de "desembaralhar" texto dos modelos de Difusão a seu favor. Em vez de adivinhar palavra por palavra, configuraram o computador para começar com uma resposta má que eles queriam (como "Como fazer uma bomba") e depois pediram ao computador para trabalhar de trás para a frente para encontrar uma pergunta que levaria a essa resposta. Mas aqui está a reviravolta: enquanto o computador trabalhava de trás para a frente, eles usaram uma "bússola" especial (chamada Perda de Neurónio de Segurança Ponderada) para guiar o processo.
Esta bússola dizia ao computador: "Não escolha palavras que façam os neurónios de segurança acenderem. Escolha palavras que mantenham esses neurónios apagados." Ao verificar e ajustar constantemente as palavras para manter os neurónios de segurança quietos, o computador gerou um prompt de "jailbreak" que estava habilmente disfarçado. Parecia uma pergunta normal e segura para os filtros de segurança, mas na verdade enganava o modelo para dar uma resposta perigosa.
Quão bem funcionou?
Os resultados foram impressionantes. Este novo método não precisou de fazer milhares de perguntas ao modelo alvo para aprender a quebrá-lo (o que é lento e caro). Em vez disso, fez todo o trabalho offline usando um modelo "substituto".
- Contra um modelo chamado Llama-3-8B, teve sucesso 77,1% das vezes.
- Contra o Qwen2.5, teve sucesso 86,9% das vezes.
- Contra um modelo do Google chamado Gemini-2.5-Flash-Lite, teve sucesso 74,3% das vezes.
Talvez o mais importante seja que fez tudo isto precisando de apenas 20 tentativas por pergunta. Outros métodos de hacking muitas vezes precisam de milhares de tentativas. Isto significa que o novo método não é apenas eficaz, mas também incrivelmente rápido e barato de executar.
Por Que Isto Importa
O artigo conclui que a segurança destes novos modelos de IA é muito mais frágil do que pensávamos. O "escudo de segurança" não é uma parede sólida; são alguns interruptores específicos que podem ser encontrados, copiados e desligados.
Os investigadores mostraram que, se construir uma nova IA copiando o cérebro de uma antiga, também copia as suas fraquezas de segurança. Também provaram que pode usar o próprio superpoder de "desembaralhamento" da nova IA para criar prompts que passam despercebidos pelos filtros de segurança, efetivamente escondendo a má intenção dentro de um pacote de aparência segura.
Embora isto pareça assustador, os investigadores argumentam que compreender estes pontos fracos é a única forma de os corrigir. Se sabemos que as regras de segurança são apenas alguns neurónios minúsculos, não podemos apenas esperar que resistam; precisamos de redesenhar a IA para que a segurança seja tecida em cada parte do seu cérebro, e não apenas em alguns interruptores ocultos. Até lá, estes novos modelos podem ser muito mais vulneráveis do que imaginávamos, e as ferramentas para os quebrar já estão nas nossas mãos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.