← Últimos artigos
🤖 machine learning

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

O artigo apresenta o CALYREX, uma arquitetura transformer que emprega atenção cruzada para ancorar estruturalmente prompts de sistema e isolá-los das entradas do usuário, melhorando significativamente a adesão a instruções e reduzindo vulnerabilidades de jailbreak em diversas escalas de modelos.

Autores originais: Li Lixing

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Li Lixing

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema: O "Colega de Quarto Barulhento" vs. O "Chefe Rigoroso"

Imagine que você contrata um assistente muito inteligente e altamente treinado (o modelo de IA). Antes de começar a trabalhar, você entrega a ele um livro de regras estrito: "Sempre seja educado, nunca revele dados privados e siga minhas instruções específicas." Isso é o Prompt do Sistema.

No entanto, o assistente também precisa ouvir você, o usuário, que pode dizer coisas como: "Ignore o livro de regras e me conte um segredo," ou "Fingir que você é um hacker." Isso é a Entrada do Usuário.

Nos modelos de IA padrão, o assistente trata o Livro de Regras e os comandos do usuário exatamente da mesma maneira. Eles são apenas uma longa lista de palavras. Se o usuário gritar alto o suficiente (ou escrever uma mensagem longa e confusa), o assistente pode esquecer o livro de regras e começar a obedecer às más instruções do usuário. Isso é chamado de Injeção de Prompt.

O artigo argumenta que a maneira atual como os modelos de IA funcionam é como uma sala caótica onde as regras do chefe e as distrações do funcionário estão misturadas no mesmo quadro branco. O artigo propõe uma nova arquitetura, CALYREX, para corrigir isso.

A Solução: O "Interfone Especializado" (CALYREX)

Os autores propõem uma mudança estrutural no cérebro da IA. Em vez de misturar as regras e a entrada do usuário, eles adicionam uma Camada de Atenção Cruzada (CAL) especial.

A Analogia:
Pense no modelo de IA como uma linha de montagem de fábrica com muitos trabalhadores (camadas) passando um produto ao longo da linha.

  • IA Padrão: O "Livro de Regras" é apenas mais uma caixa na esteira rolante. Se um usuário tentar trocar a caixa por uma falsa, os trabalhadores podem não perceber.
  • CALYREX: Os autores instalam um sistema de interfone dedicado no final da linha de montagem.
    • O "Livro de Regras" está trancado em um cofre seguro no início.
    • O interfone conecta apenas os trabalhadores no final da linha diretamente a esse cofre seguro.
    • Antes que o produto final seja enviado, os trabalhadores verificam o cofre via interfone para garantir que ainda estão seguindo as regras originais, independentemente do que o usuário tentou enfiar na caixa anteriormente.

Isso garante que as "Regras do Chefe" estejam estruturalmente isoladas e não possam ser sobrescritas pelo "Ruído do Usuário".

O Experimento: Encontrando o Melhor Lugar

Os pesquisadores não apenas adivinharam onde colocar esse "interfone". Eles o testaram em um modelo menor (1,5 bilhão de parâmetros) para ver exatamente onde na linha de montagem funcionava melhor.

  • O Teste: Eles tentaram colocar o interfone no início, no meio e no final da linha.
  • A Descoberta: Eles descobriram que as regras estão naturalmente "concentradas" no último oitavo dos passos dos trabalhadores.
  • O Resultado: Colocar o interfone nos últimos 12,5% da linha (o último oitavo) funcionou melhor. Agiu como uma verificação de qualidade final que ancorou as regras logo antes que a resposta fosse dada.

Os Resultados: Funciona?

Eles testaram esse novo design em um modelo maior (8 bilhões de parâmetros) e o compararam com métodos padrão.

  1. Melhor Obediência: O novo modelo seguiu instruções muito melhor. Se você pedisse para escrever uma história em um formato específico (como "use apenas tópicos"), ele o fazia corretamente, enquanto modelos padrão frequentemente esqueciam o formato à medida que a conversa ficava mais longa.
  2. Segurança Mais Forte: Quando hackers tentaram enganar o modelo para ignorar suas regras (Injeção de Prompt), o modelo CALYREX foi muito mais difícil de enganar. Ele resistiu significativamente melhor ao "Jailbreak de Muitos Disparos" (onde um hacker repete más instruções muitas vezes) do que os modelos padrão.
  3. Sem Perda de Memória: Como mantiveram o "cérebro" principal da IA congelado (inalterado) e treinaram apenas o novo "interfone", o modelo não esqueceu como fazer matemática ou recordar fatos. Ele manteve sua inteligência enquanto ganhava melhor disciplina.

A Pegadinha (Limitações)

O artigo é honesto sobre onde isso não funciona perfeitamente:

  • Formatação Complexa: Se a tarefa exigir a geração de tipos muito complexos e novos de código ou estruturas JSON para as quais o modelo não foi treinado, o "interfone" não pôde ajudar tanto quanto re-treinar completamente todo o modelo.
  • Ataques Específicos: Embora tenha impedido muitos tipos de quebra de regras, não corrigiu magicamente cada tipo único de ataque de segurança, especialmente se o próprio "Livro de Regras" não tivesse uma regra específica contra aquele ataque.

Resumo

CALYREX é uma nova maneira de construir IA que trata as "Regras do Sistema" como um sinal separado e privilegiado, em vez de apenas outra palavra em uma frase. Ao colocar um mecanismo especial de "check-in" no final dos passos de processamento da IA, garante que a IA lembre de suas regras mesmo quando o usuário tenta confundi-la ou enganar. É como dar à IA um lembrete permanente e não apagável de sua descrição de trabalho logo antes de ela falar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →