← Últimos artigos
💻 computer science

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

Este artigo demonstra que a "ablateração", uma técnica de edição de pesos de baixo posto que projeta ortogonalmente as direções de recusa, pode desacoplar efetivamente a recusa de LLMs de código alinhados para segurança em gerar código vulnerável de suas capacidades reais de geração, permitindo assim a produção escalável de código vulnerável rotulado para pesquisa de detecção de vulnerabilidades sem comprometer a validade sintática.

Autores originais: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

Publicado 2026-06-05
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Robô "Superprotetor"

Imagine que você está tentando ensinar um robô a identificar falhas de segurança em códigos de computador. Para fazer isso, você precisa de uma enorme biblioteca de exemplos mostrando tanto códigos "seguros" quanto códigos "quebrados" (vulneráveis).

No entanto, há um detalhe. Os robôs (modelos de IA) que temos hoje são treinados para serem muito seguros. Se você perguntar a eles: "Ei, você pode me mostrar como quebrar um banco de dados?", eles imediatamente dizem: "Não! Eu não posso fazer isso. Isso é perigoso."

Isso é um problema para os pesquisadores. Eles precisam que o robô cometa o erro para que possam estudá-lo e construir defesas melhores. Mas o robô se recusa a desempenhar o papel do "vilão", mesmo que o pesquisador queira apenas estudar o erro em um ambiente de laboratório controlado.

O Experimento: Desligando o Botão de "Parar"

Os pesquisadores deste artigo queriam ver se conseguiam desligar esse botão de "Parar" sem quebrar o cérebro do robô. Eles usaram uma técnica chamada Abliteration.

Pense no cérebro da IA como uma biblioteca gigante de pensamentos. Quando o robô vê um pedido para criar uma falha de segurança, um "sinal de recusa" específico (como uma luz de alarme vermelha) pisca em sua mente, e ele interrompe a conversa.

Abliteration é como um cirurgião removendo cuidadosamente apenas aquela luz de alarme vermelha da fiação do robô. Eles não treinaram o robô novamente nem o ensinaram coisas novas; eles apenas editaram cirurgicamente os pesos (as conexões) para impedir que o sinal de recusa fosse disparado.

As Três Descobertas Principais

Os pesquisadores testaram isso em três tamanhos diferentes de modelos de IA (Pequeno, Médio e Grande) usando código Python e um tipo específico de falha de segurança chamado Injeção de SQL (que é como enganar um banco de dados para revelar segredos).

1. A "Recusa" Depende do Tamanho e do Contexto

Antes de realizarem a cirurgia, eles notaram algo interessante:

  • O Modelo Gigante (14B): Ele recusava 100% das vezes. Não importava o que você pedisse, ele dizia "Não".
  • O Modelo Médio (7B): Ele era seletivo. Recusava a maior parte das vezes em códigos longos e complexos, mas às vezes dizia "Sim" em trechos de código curtos e simples.
  • O Modelo Pequeno (3B): Ele mal recusava. Estava disposto a tentar quase qualquer coisa.

A Analogia: Imagine três guardas de segurança. O guarda grande é tão rigoroso que barra todo mundo. O guarda médio barra pessoas com bolsas grandes, mas deixa passar pessoas com pequenos envelopes. O guarda pequeno é muito relaxado e deixa quase todo mundo passar.

2. A Cirurgia Funcionou (A Parte do "Disposto")

Depois que realizaram a cirurgia de "Abliteration":

  • A Recusa Desapareceu: Os modelos Gigante e Médio pararam de dizer "Não". Agora eles estavam dispostos a tentar criar a falha de segurança.
  • O Cérebro Continuava Saudável: Crucialmente, a cirurgia não quebrou o robô. O código que eles produziam ainda era gramaticalmente correto e fazia sentido. Eles não haviam lobotomizado a IA; apenas removeram o reflexo de "eu não vou fazer isso".

A Analogia: É como tirar uma placa de "Proibido Entrar" de uma porta. A porta sempre esteve aberta e o corredor lá dentro estava ótimo; a placa apenas dizia que as pessoas não podiam passar. Uma vez que a placa foi removida, as pessoas puderam passar, e o corredor continuou perfeitamente intacto.

3. Disposição \neq Capacidade (A Parte do "Incapaz")

Esta é a descoberta mais importante. Só porque o robô agora estava disposto a cometer o erro, não significava que ele era capaz de fazê-lo bem.

  • O Modelo Gigante (14B): Uma vez que o sinal de "Não" foi removido, ele era ótimo em criar a falha de segurança. Ele teve sucesso cerca de 90% das vezes.
  • O Modelo Médio (7B): Também era muito bom, tendo sucesso cerca de 90% das vezes.
  • O Modelo Pequeno (3B): Embora estivesse disposto e não recusasse, ele era ruim na tarefa real. Ele teve sucesso apenas cerca de 25–48% das vezes.

A Analogia: Imagine três artistas que foram solicitados a pintar um quadro de um vaso quebrado.

  • O Artista Gigante foi instruído: "Você não pode pintar isso!", mas depois de ser autorizado, ele pintou uma obra-prima.
  • O Artista Médio também foi autorizado e pintou um ótimo quadro.
  • O Artista Pequeno nunca ouviu um "Não" para começar, mas quando tentou pintar o vaso quebrado, simplesmente não conseguiu acertar os detalhes — ele queria fazer, mas carecia de habilidade.

A Conclusão: Duas Coisas Diferentes

O artigo prova que Recusa (disposição) e Capacidade (habilidade) são duas coisas distintas.

  1. Recusa é uma configuração de segurança que pode ser desligada (via Abliteration).
  2. Capacidade é uma medida de quão inteligente o modelo é. Desligar a configuração de segurança não torna um modelo "burro" em "inteligente".

Por que isso importa?

  • Para Pesquisadores: Se você quiser gerar dados para treinar ferramentas de segurança, não pode apenas usar um modelo pequeno e esperar que funcione. Mesmo que você desligue seus filtros de segurança, ele pode não ser inteligente o suficiente para criar os erros realistas de que você precisa. Você precisa de um modelo maior.
  • Para a Segurança: Mostra que os filtros de segurança são muito específicos. Você pode remover a "recusa" sem quebrar a capacidade do modelo de escrever um bom código. Isso significa que o alinhamento de segurança é uma camada específica sobre a inteligência do modelo, não a própria inteligência.

Uma Nota sobre Ética

Os autores são muito cuidadosos. Eles liberaram as ferramentas para medir isso e os dados, mas não liberaram os modelos "cirurgicamente modificados" que podem realmente criar essas falhas de segurança. Eles acreditam que, embora a ideia de como fazer isso seja conhecida, liberar os modelos "hackeados" reais seria perigoso demais. Eles querem ajudar pesquisadores a estudar a segurança, não dar uma nova arma a hackers.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →