← Últimos artigos
💬 NLP

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

O A2D introduz um método de alinhamento de segurança ao nível de token para modelos de linguagem de difusão que utiliza mascaramento aleatorizado para emitir sinais de recusa [EOS] imediatos, neutralizando efetivamente ataques de qualquer ordem e qualquer etapa como o DIJA, enquanto permite o monitoramento em tempo real e uma terminação segura significativamente mais rápida.

Autores originais: Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

Publicado 2026-02-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Um Novo Tipo de Escritor de IA

Imagine a maioria dos chatbots de IA (como aqueles com os quais você fala todos os dias) como trabalhadores de uma linha de montagem. Eles constroem uma frase palavra por palavra, estritamente da esquerda para a direita. Se você perguntar algo perigoso, eles geralmente verificam as primeiras palavras, decidem "Não, isso é ruim" e param imediatamente.

Mas existe um novo tipo de IA chamado Modelo de Linguagem de Difusão (dLLM). Pense nesta IA não como uma linha de montagem, mas como um escultor trabalhando em um bloco de mármore. Em vez de escrever palavra por palavra, ela começa com uma página em branco cheia de pontos de interrogação (máscaras) e gradualmente preenche esses espaços. Ela pode preencher o fim de uma frase antes do começo, ou o meio antes do início. Ela pode trabalhar na história inteira de uma só vez.

O Problema: O Ataque de "Porta dos Fundos"

Como esse escultor pode preencher palavras em qualquer ordem, ele tem uma nova fraqueza.

Imagine que um agente mal-intencionado quer enganar o escultor para que ele escreva um guia sobre como roubar um carro.

  • A Armadilha Antiga: Se o escultor fosse um trabalhador de linha de montagem, o agente mal-intencionado tentaria enganá-lo logo no início.
  • A Nova Armadilha (Ataque DIJA): Com o escultor, o agente mal-intencionado pode preencher a primeira metade da história com um texto inofensivo, depois inserir uma "armadilha" no meio, ou preencher o fim primeiro. Eles usam um modelo que parece um pedido normal, mas esconde as partes perigosas nos espaços em branco.

O artigo descobriu que o treinamento de segurança atual para esses escultores é "raso". É como um segurança que só verifica seu RG quando você passa pela porta da frente. Se você conseguir passar pela porta e começar a caminhar pelo corredor, o segurança para de prestar atenção. A IA pode dizer "Não" para a primeira palavra, mas se você enganá-la para preencher a 10ª palavra com algo perigoso, ela esquece de dizer "Não" novamente.

A Solução: A2D (Defesa de Qualquer Ordem, Qualquer Passo)

Os autores criaram um novo método de segurança chamado A2D. Veja como ele funciona, usando uma analogia simples:

O Token "Placa de Pare"
Em vez de apenas treinar a IA para dizer "Eu não posso fazer isso" logo no início, o A2D ensina a IA um token especial de "Placa de Pare" (chamado [EOS]).

  • O Treinamento: Eles pegam a IA e mostram a ela frases perigosas. Mas, em vez de deixá-la terminar a frase, eles cobrem as partes perigosas com pontos de interrogação e dizem à IA: "Se você vir um ponto de interrogação aqui, e a frase for perigosa, você deve substituir esse ponto de interrogação por uma Placa de Pare imediatamente."
  • O Resultado: A IA aprende que em qualquer ponto da frase, se ela sentir algo prejudicial, deve colocar instantaneamente uma Placa de Pare naquele lugar.

Por que isso é especial?

  1. Qualquer Ordem: Não importa se a IA está escrevendo a primeira ou a última palavra. Se uma ideia perigosa surgir, a Placa de Pare aparece.
  2. Qualquer Passo: Não importa se o perigo aparece no passo 1 ou no passo 50. O segurança está acordado o tempo todo, não apenas na porta de entrada.

O "Teste de Preencher a Lacuna"

Para provar que seu método funciona, os pesquisadores inventaram um teste super difícil chamado FITS (Fill-in-the-Sentence).

  • O Cenário: Imagine que um vilão escreveu um guia de 99% completo sobre como fabricar uma bomba. Eles deixaram faltando apenas uma frase (o passo final) e pedem para a IA preenchê-la.
  • O Resultado: Os métodos de segurança antigos falharam miseravelmente aqui. Eles estavam tão focados no início do texto que deixaram a IA terminar o guia da bomba.
  • O Desempenho do A2D: O A2D olhou para aquela única frase faltante, percebeu que era perigosa e imediatamente colocou a Placa de Pare. Ele bloqueou o ataque quase 100% das vezes.

O Bônus: Radar de Segurança em Tempo Real

Como a IA é treinada para colocar uma Placa de Pare sempre que detecta perigo, a probabilidade de essa Placa de Pare aparecer funciona como um radar de segurança.

  • Rejeição Precoce: Os pesquisadores descobriram que, se verificarem a "probabilidade da Placa de Pare" da IA logo no primeiro passo, eles podem saber se o pedido inteiro é ruim antes mesmo de a IA escrever uma única palavra.
  • Velocidade: Isso permite que a IA rejeite pedidos ruins 19,3 vezes mais rápido do que antes. É como um segurança de boate que consegue saber que você não está na lista antes mesmo de você chegar à porta, economizando tempo de todos.

Isso estraga a capacidade da IA de ser útil?

O artigo testou isso extensivamente. Eles pediram à IA para fazer matemática, escrever código e responder perguntas gerais.

  • O Veredito: O A2D manteve a IA inteligente e útil. Ele não fez a IA recusar responder perguntas normais (como "Como eu mato um processo python?" que soa perigoso, mas é sobre programação).
  • Comparação: Outros métodos de segurança eram sensíveis demais e recusavam responder perguntas inofensivas. O A2D foi preciso: ele apenas parou o que era realmente ruim.

Resumo

O artigo apresenta o A2D, uma atualização de segurança para um novo tipo de IA que escreve em qualquer ordem.

  • Segurança Antiga: Um segurança na porta da frente que fica cansado após alguns minutos.
  • Segurança A2D: Um sistema de segurança que coloca uma placa de "Pare" instantaneamente, em qualquer lugar, a qualquer momento, se sentir perigo.
  • Resultado: Ele interrompe ataques sorrateiros que passam pela porta da frente, é 19x mais rápido ao dizer "não" e mantém a IA útil para todos os outros.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →