← Últimos artigos
💬 NLP

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

Este artigo revela que os métodos existentes de detecção de distribuição fora do padrão (OOD) em caixa branca para modelos de linguagem estão estruturalmente confundidos pelo comprimento da sequência e propõe um framework de dois caminhos que distingue entre sinais baseados em embeddings para mudanças de vocabulário e características de trajetória de estados ocultos para detectar entradas de intenção oculta, como quebras de segurança (jailbreaks).

Autores originais: Hamidreza Saghir

Publicado 2026-05-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hamidreza Saghir

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um guarda de segurança em um museu. Seu trabalho é identificar pinturas falsas (entradas Fora de Distribuição ou "OOD") entre as reais. Recentemente, outros guardas têm usado uma nova ferramenta: eles medem o quanto a pintura "treme" ou o quão caóticas são as pinceladas (isso é como medir a entropia de atenção em IA). Eles afirmam que essa ferramenta é incrível para detectar falsificações.

No entanto, este artigo argumenta que esses guardas estão sendo enganados. Eles não estão identificando as falsificações; estão apenas contando quantas pinceladas há na tela.

Aqui está a análise detalhada das descobertas do artigo usando analogias simples:

1. A Armadilha da "Tela Longa" (A Confusão de Comprimento)

O artigo descobriu que muitas ferramentas populares de segurança de IA estão secretamente apenas medindo o quão longo é o texto.

  • A Analogia: Imagine que a ferramenta do guarda de segurança é uma régua. Ela afirma medir "caos", mas na verdade apenas mede "comprimento".
  • O Problema: Nos testes, as pinturas "falsas" (jailbreaks ou spam) eram frequentemente muito mais longas que as "reais". A ferramenta via as pinturas longas, entrava em pânico e dizia: "Isso é uma falsificação!" simplesmente porque era longa.
  • A Prova: Quando os pesquisadores forçaram as pinturas reais e falsas a terem exatamente o mesmo comprimento, a ferramenta parou de funcionar. Ela colapsou para um palpite quase aleatório (como jogar uma moeda). O artigo mostra que ferramentas como CED, RAUQ e até algumas pontuações de confiança de sistemas implantados estão estruturalmente quebradas porque dependem de mecanismos de atenção que crescem naturalmente com o comprimento do texto.

2. O Framework de Dois Caminhos: "O Que" vs. "Como"

Uma vez que os pesquisadores removeram o "truque do comprimento", eles perguntaram: Como podemos realmente dizer se a entrada é estranha? Eles propõem um sistema de duas partes, como um detetive olhando para uma cena de crime de duas maneiras diferentes:

Caminho A: O "O Que" (Embeddings)

  • A Analogia: Isso é como olhar para os ingredientes de uma sopa.
  • Como funciona: Verifica o vocabulário. Se a sopa tiver palavras "tóxicas" ou palavras-chave de "spam", este caminho sinaliza o problema.
  • Quando funciona: É ótimo para detectar falsificações óbvias, como uma sopa que de repente tem "veneno" escrito no rótulo.
  • Quando falha: Falha se a sopa falsa usar exatamente os mesmos ingredientes que a sopa real, mas misturados de um jeito estranho. Por exemplo, um prompt de "jailbreak" frequentemente usa palavras normais, mas as organiza para enganar a IA. O "verificador de ingredientes" vê palavras normais e diz: "Tudo limpo", perdendo a armadilha.

Caminho B: O "Como" (Trajetória de Processamento)

  • A Analogia: Isso é como assistir ao chef cozinhando a sopa.
  • Como funciona: Em vez de apenas olhar para a tigela final, este caminho observa as mãos do chef se movendo em cada etapa do processo de cozimento (camada por camada). Ele pergunta: "O chef está picando suavemente? Eles estão jogando ingredientes de repente em pânico? A panela está tremendo em um ritmo estranho?"
  • Por que funciona: Mesmo que os ingredientes (palavras) pareçam normais, um prompt de "jailbreak" força o chef IA a cozinhar em um ritmo estranho e antinatural. O caminho "Como" captura esse estilo de cozimento estranho.
  • O Resultado: Este caminho detectou com sucesso as falsificações "jailbreak" complicadas que o caminho de "ingredientes" perdeu, alcançando uma pontuação de precisão muito maior (0,850 contra quase chance para os métodos antigos).

3. A Descoberta do "Cruzamento"

O artigo descobriu que nenhum método é perfeito para tudo. É como ter dois tipos diferentes de detectores de metal:

  • Detector 1 (Ingredientes/Embeddings): Ótimo para encontrar uma moeda de ouro escondida em uma pilha de areia (mudanças óbvias de vocabulário).
  • Detector 2 (Estilo de Cozimento/Trajetória): Ótimo para encontrar uma moeda de plástico pintada para parecer ouro (truques estruturais sutis).
  • A Lição: Você precisa de ambos. Quando o "falso" é apenas um tópico diferente, o Detector 1 vence. Quando o "falso" é um truque inteligente usando palavras normais, o Detector 2 vence.

4. O "Porquê" (Evidência Mecanística)

Os pesquisadores não apenas chutaram; eles olharam dentro do cérebro da IA (os circuitos) para ver o que estava acontecendo.

  • A Descoberta: Quando a IA encontra um "jailbreak" (um truque estrutural), ela fica confusa de uma maneira específica: seus circuitos de "atenção" (foco) ficam descontrolados, embaralhando seu foco.
  • O Contraste: Quando a IA encontra "discurso de ódio" (uma mudança de vocabulário), são as partes de "memória" (MLP) do cérebro que se acendem porque ela reconhece as palavras ruins.
  • A Conclusão: Diferentes tipos de "falsificações" quebram a IA de maneiras diferentes. As ferramentas antigas olhavam apenas para a parte de "foco" e ficavam confusas com o comprimento. A nova ferramenta de "Trajetória" observa todo o processo de cozimento, então ela vê a quebra não importa onde ela aconteça.

Resumo

O artigo afirma que muitas ferramentas atuais de segurança de IA estão quebradas porque são enganadas pelo comprimento do texto. Para corrigir isso, precisamos parar de olhar apenas para o que o texto diz e começar a observar como a IA o processa. Ao observar o "processo de pensamento" da IA passo a passo (a trajetória), podemos pegar truques inteligentes que parecem normais na superfície, mas parecem estranhos para a maquinaria interna da IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →