Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly
Este artigo identifica e quantifica "falhas de transporte de políticas" em agentes de modelos de linguagem causadas pela montagem de contexto no momento da decisão (como truncamento e sumarização) que inadvertidamente descartam estados portadores de diretrizes, e avalia uma camada de controle chamada SafeContext que mitiga parcialmente esses riscos ao fixar estados críticos e injetar lembretes, embora sua eficácia permaneça limitada e condicional à política.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Grande Ideia: O "Fantasma" na Máquina
Imagine que você é um juiz em um tribunal. Você tem uma pilha massiva de evidências (o histórico da conversa) e um conjunto de regras estritas que deve seguir (as políticas). Mas, você só pode ler as 10 páginas superiores dessa pilha antes de ter que tomar sua decisão final.
O artigo argumenta que agentes de IA têm um problema semelhante. Antes que a IA responda a uma pergunta, um sistema "intermediário" (chamado de Montagem de Contexto no Tempo de Decisão) corta o histórico da conversa, resume-o e o encaixa em uma pequena caixa para enviar ao modelo de IA.
A parte assustadora? Se o intermediário acidentalmente descartar as regras, ou as reescrever de modo que não façam mais sentido, a IA pode violar as regras — mesmo que a própria IA seja inteligente e as regras tenham sido claramente declaradas anteriormente. O artigo chama isso de "Falha no Transporte de Políticas". A regra estava lá, mas não foi "transportada" até o momento da decisão.
As Três Maneiras pelas Quais as Regras se Perdem
Os autores descobriram três maneiras específicas pelas quais essas regras desaparecem ou são distorcidas durante a fase do "intermediário":
Expulsão (O Problema "Perdido na Confusão"):
- Analogia: Imagine que você diz a um amigo, "Não se esqueça de trancar a porta", no início de uma longa ligação telefônica. Até chegar ao final da chamada, seu amigo esqueceu essa instrução porque vocês falaram sobre tantas outras coisas.
- O que acontece: A regra é empurrada para fora da pequena "caixa" de memória porque não havia espaço suficiente. A IA simplesmente nunca vê a regra na hora de agir.
Aliasing (O Problema da "Má Tradução"):
- Analogia: Você diz a um tradutor: "Não coma as bagas vermelhas". O tradutor resume isso como: "Tenha cuidado com as bagas". A palavra "vermelhas" e "não coma" desaparecem. A IA vê um aviso, mas é muito fraco para impedi-la de comer as bagas.
- O que acontece: A regra sobrevive, mas é resumida ou reescrita de forma tão frouxa que não proíbe mais estritamente a ação ruim. O "espírito" da regra é quebrado.
Instabilidade de Ligação (O Problema do "Alvo Errado"):
- Analogia: Você diz a um guarda de segurança: "Impedida a entrada da Pessoa A". Mais tarde, o guarda vê um resumo que diz: "Impedida a entrada da Pessoa B". A regra ainda está lá, mas aponta para a pessoa errada.
- O que acontece: O texto da regra sobrevive, mas é anexado ao objeto, pessoa ou condição errados.
O Experimento: Testando o "Intermediário"
Os pesquisadores testaram isso em vários modelos de IA (como Llama, Qwen e Mistral). Eles criaram cenários onde a IA tinha que seguir regras estritas (como "não apague dados" ou "não use ferramentas externas") enquanto era bombardeada com muitas outras informações (saídas de ferramentas, registros de chat, resumos).
Os Resultados:
- O Problema é Real: Sem qualquer ajuda, a IA frequentemente violava as regras porque o sistema "intermediário" descartava ou enfraquecia as instruções.
- A Solução (SafeContext): Os pesquisadores criaram uma camada de segurança chamada SafeContext. Pense nela como um Passe VIP para as regras.
- Ela força as regras a serem "fixadas" no topo da lista para que não possam ser descartadas.
- Ela reutiliza as regras de forma eficiente para que não ocupem muito espaço.
- Se a conversa ficar muito lotada, ela injeta um lembrete rápido das regras logo antes da IA responder.
A Solução Funcionou?
- Sim, mas com limites. A solução ajudou a IA a seguir as regras com mais frequência, especialmente quando a conversa estava muito lotada.
- Não é mágica. Mesmo com a solução, a IA não obteve pontuações perfeitas. Se o "intermediário" usasse um resumidor muito agressivo, a solução não conseguia salvar as regras completamente.
- Modelos maiores não são a resposta. Usar uma IA muito mais inteligente e maior não corrigiu automaticamente o problema. A questão estava em como o contexto era montado, não em quão inteligente era a IA.
O Custo da Segurança
O artigo também analisou o "preço" dessa segurança.
- Custo de Tokens: Manter as regras seguras às vezes exigia enviar mais texto para a IA (como adicionar uma nota de lembrete).
- A Boa Notícia: O método deles de "Reutilização Inteligente" (cache) na verdade economizou dinheiro em alguns casos. Em vez de reescrever as regras toda vez, eles apenas apontavam para a versão antiga, economizando espaço.
A Conclusão
O artigo conclui que a segurança não se trata apenas do próprio modelo de IA. Trata-se também da "linha de montagem" que prepara a memória da IA. Se essa linha de montagem descartar as regras, a IA falhará, não importa quão inteligente seja.
Para tornar a IA mais segura, precisamos tratar as regras como itens especiais e protegidos que devem sobreviver à jornada até o cérebro da IA, em vez de tratá-las apenas como texto comum que pode ser resumido ou excluído para economizar espaço.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.