← Últimos artigos
🤖 machine learning

NeST: Neuron Selective Tuning for LLM Safety

O NeST é um framework de alinhamento de segurança pós-hoc eficiente em parâmetros que identifica e ajusta seletivamente clusters de neurônios de feed-forward relevantes para a segurança usando apenas prompts maliciosos comuns, alcançando uma defesa robusta contra diversos jailbreaks em modelos de texto e multimodais com overhead computacional mínimo.

Autores originais: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

Publicado 2026-06-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Linguagem Grande (LLM) como uma biblioteca imensa e incrivelmente inteligente com bilhões de livros. Quando você faz uma pergunta, a biblioteca não apenas "pensa"; ela ativa prateleiras, fileiras e livros individuais específicos para encontrar a resposta.

O problema é que alguns desses livros contêm instruções perigosas (como "como construir uma bomba"). Às vezes, trapaceiros astutos (hackers) podem fazer perguntas de uma forma que confunde o bibliotecário, fazendo com que ele puxe esses livros perigosos em vez de recusar a resposta.

As formas atuais de corrigir isso são como tentar reorganizar a biblioteca inteira toda vez que um novo truque é descoberto. É lento, caro e, se você fizer errado, pode acabar escondendo os livros bons também.

NeST (Neuron Selective Tuning - Ajuste Seletivo de Neurônios) é uma maneira nova e mais inteligente de proteger a biblioteca. Veja como funciona, usando analogias simples:

1. O "Holofote" em vez do "Trator"

A maioria dos métodos de segurança é como um trator: tenta consertar todo o edifício de uma vez. O NeST é como um holofote.

  • Como funciona: Os pesquisadores apontam um holofote para a biblioteca enquanto fazem perguntas inofensivas ("O que é um gato?") e perguntas prejudiciais ("Como fazer uma bomba?").
  • A Descoberta: Eles percebem que apenas um grupo minúsculo e específico de "livros" (neurônios) se acende quando a biblioteca recebe uma pergunta perigosa. Estes são os "Neurônios de Segurança". O resto da biblioteca permanece escuro e não envolvido.
  • A Correção: Em vez de reescrever toda a biblioteca, o NeST toca apenas nesses livros específicos e brilhantes. Ele ensina esses livros a dizer "Não" firmemente quando algo ruim é solicitado, enquanto deixa os milhões de outros livros exatamente como estão.

2. O Sistema do "Capitão do Time"

Você pode pensar: "Ok, então nós consertamos esses livros específicos. Mas ainda existem milhares deles!"

  • O Problema: Se você tentar treinar cada um desses livros de segurança individualmente, ainda será muito trabalho. Além disso, alguns livros podem estar dizendo coisas semelhantes, enquanto outros dizem coisas diferentes.
  • A Solução do NeST: O NeST agrupa esses livros de segurança em times baseados em como eles reagem.
    • Analogia: Imagine um time de esportes. Em vez de treinar cada jogador individualmente, você agrupa jogadores que desempenham a mesma posição (por exemplo, todos os goleiros). Você dá ao "Time dos Goleiros" um conjunto compartilhado de instruções.
    • O NeST faz isso com os neurônios. Ele encontra grupos de neurônios que agem de forma semelhante e lhes dá uma "atualização" compartilhada. Isso torna o treinamento incrivelmente rápido e eficiente.

3. A "Tatuagem Permanente" vs. O "Fantasia Temporária"

Alguns métodos de segurança são como colocar uma fantasia temporária na biblioteca. Toda vez que você entra, um guarda tem que verificar a fantasia. Isso atrasa tudo.

  • A Abordagem do NeST: O NeST é como dar uma tatuagem permanente à biblioteca.
  • Uma vez que o treinamento é concluído, as novas instruções são "dobradas" diretamente na estrutura existente da biblioteca.
  • O Resultado: Quando você faz uma pergunta mais tarde, a biblioteca responde com a mesma velocidade de antes. Não há um guarda extra, não há fantasia e não há lentidão. A segurança está integrada nos tijolos.

4. A "Relíquia de Família" (Reutilização)

Esta é talvez a parte mais legal. Imagine que o dono da biblioteca cria um "Manual de Segurança" baseado na biblioteca original.

  • Mais tarde, alguém pega essa biblioteca e a renomeia para um trabalho específico (como uma "Biblioteca Médica" ou uma "Biblioteca de Matemática"). Normalmente, esse novo trabalho poderia acidentalamente quebrar as regras de segurança.
  • Com o NeST, você não precisa começar do zero. Você pode pegar o Manual de Segurança original (os neurônios e times específicos identificados anteriormente) e aplicá-lo à nova "Biblioteca Médica".
  • Isso torna a nova biblioteca instantaneamente resistente a ataques sem precisar retreinar todo o sistema. É como passar uma relíquia de família que protege a próxima geração.

O Que Eles Provaram?

O artigo testou isso em 14 "bibliotecas" diferentes (modelos de IA), incluindo modelos apenas de texto e outros que podem ver imagens.

  • Antes do NeST: Hackers podiam enganar os modelos de 44% a 55% das vezes.
  • Depois do NeST: Hackers só conseguiam enganá-los cerca de 1% das vezes.
  • O Custo: Eles alcançaram essa melhoria massiva alterando menos de 0,4 milhão de números no modelo. Para fazer o mesmo com os métodos antigos, você teria que alterar bilhões de números.

Em resumo: O NeST encontra as partes pequenas e específicas da IA que lidam com a segurança, agrupa-as em times e dá a elas uma atualização rápida e permanente. Isso torna a IA mais segura sem diminuir sua velocidade ou prejudicar sua capacidade de ser útil.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →