← Últimos artigos
💻 computer science

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

O artigo apresenta o SafeNexus, um framework de alinhamento de segurança cross-modal que identifica e direciona neurônios de segurança universais entre modalidades por meio de supressão direcionada e amplificação de ativação para defender robustamente modelos de linguagem de grande escala multimodais contra diversas ameaças cross-modais, preservando a utilidade.

Autores originais: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

Publicado 2026-08-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine a internet como uma biblioteca gigante e movimentada onde os livros podem conversar com você. Por muito tempo, esses livros falantes eram apenas texto, como um chatbot muito inteligente. Mas recentemente, eles evoluíram para "Modelos de Linguagem de Grande Escala Multimodais" (MLLMs). Pense neles como superbibliotecários que agora podem ler textos, olhar imagens e ouvir áudios ao mesmo tempo. Eles são incrivelmente úteis, mas esse novo superpoder vem com um porém: abre novas formas para que encrenqueiros os enganem. Assim como um segurança em um museu pode saber identificar uma pintura falsa, mas falhar ao notar uma gravação de som falsa, os modelos de IA muitas vezes possuem guardas de segurança que só funcionam para um tipo de entrada. Se você tentar enganá-los com uma imagem em vez de palavras, ou um clipe de som em vez de uma frase, os guardas podem deixar o perigo passar completamente. A grande questão que os pesquisadores estão fazendo é: Como construímos um sistema de segurança que funcione não importa como o encrenqueiro tente entrar?

É aqui que um novo estudo chamado SafeNexus entra em cena. Os pesquisadores, uma equipe de universidades da China e de Singapura, decidiram parar de olhar para a segurança da IA pelo lado de fora e, em vez disso, realizaram uma caça ao tesouro dentro do "cérebro" da IA. Eles descobriram que a capacidade da IA de dizer "não" a pedidos maldosos não está espalhada aleatoriamente; ela é, na verdade, controlada por um pequeno e especial grupo de interruptores internos chamados neurônios.

Aqui está a parte divertida: A equipe descobriu que, embora diferentes tipos de entradas (como texto, imagens ou áudio) usem partes diferentes do cérebro para processar informações, existe um clube secreto e compartilhado de neurônios que atua como o detector de perigo definitivo para todos eles. Eles os chamam de US-Neurons (Neurônios de Segurança Universais de Modalidade). É como descobrir que, quer você esteja tentando passar uma faca, uma bomba ou um documento falso pela segurança, há uma câmera de segurança específica e minúscula no corredor que detecta todos eles. Se você desligar essa câmera, todo o edifício se torna inseguro, não importa o que o intruso esteja carregando.

O artigo sugere que os métodos anteriores tentavam tapar os buracos de segurança treinando novamente toda a IA ou adicionando filtros externos, o que é como contratar um novo segurança para cada porta. O SafeNexus adota uma abordagem diferente: ele encontra esses poucos neurônios críticos de "detecção de perigo" e lhes dá um reforço de superpoder. A equipe testou duas maneiras de fazer isso:

  1. O Amplificador: Durante o processo de pensamento da IA, eles simplesmente aumentaram o volume desses neurônios específicos, fazendo com que eles gritassem "PERIGO!" mais alto e mais rápido.
  2. O Calibrador: Eles deram a esses neurônios específicos um ajuste fino direcionado (usando um método chamado LoRA) para que se tornassem naturalmente melhores em detectar problemas, sem a necessidade de treinar novamente toda a IA.

Os resultados foram impressionantes. Quando testaram isso em modelos como Qwen e VITA, descobriram que impulsionar esses poucos neurônios tornou a IA muito melhor em recusar solicitações prejudiciais, fosse o pedido um texto, uma imagem ou um som. Crucialmente, descobriram que isso não tornou a IA "burra" ou excessivamente cautelosa. Ela não começou a recusar perguntas inofensivas (como "como eu faço um bolo?") e não esqueceu suas outras funções. Na verdade, em alguns testes, o novo método foi muito melhor em deter ataques do que os melhores métodos atuais, tudo isso alterando menos de 0,05% do poder cerebral total da IA.

Os pesquisadores também mostraram que esse truque funciona mesmo em coisas nas quais eles não treinaram explicitamente, como vídeo. Mesmo que nunca tenham mostrado clipes de vídeo à IA durante a fase de "ajuste", os neurônios impulsionados ainda foram bons em detectar perigo em ataques de vídeo. Isso sugere que eles realmente encontraram um mecanismo de segurança central e universal, em vez de apenas memorizar exemplos específicos.

Em resumo, o SafeNexus sugere que não precisamos reconstruir todo o sistema de segurança da IA para torná-la segura em todos os formatos. Em vez disso, só precisamos encontrar os poucos e minúsculos "freios" universais dentro da máquina e garantir que estejam funcionando com força total. É um pouco como perceber que, para impedir que um carro corra demais, você não precisa substituir o motor inteiro; você só precisa garantir que o pedal do freio esteja conectado firmemente às rodas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →