← Últimos artigos
🤖 AI

A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns

Este artigo identifica e analisa o modo de falha "GHOST", no qual agentes de longo horizonte negligenciam restrições de segurança especificadas em turnos anteriores sob condições benignas, e propõe o framework de duas camadas STAR-Guard para eliminar teoricamente e empiricamente esses perigos.

Autores originais: XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng

Publicado 2026-10-05
📖 1 min de leitura☕ Leitura rápida

Autores originais: XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: Um Fantasma em Agentes de Longo Horizonte (GHOST)

Definição do Problema: Perigo de Governança por Restrições de Segurança Ignoradas

Este artigo identifica um modo de falha específico em agentes de LLM (Large Language Model) de longo horizonte e uso de ferramentas, denominado Perigo de Governança por Restrições de Segurança Ignoradas através de Turnos (GHOST - Governance Hazard from Overlooked Safety Constraints across Turns).

Enquanto a pesquisa de segurança existente foca em ataques adversariais (ex: injeção de prompt) ou solicitações prejudiciais imediatas, o GHOST surge sob condições de interação benignas. Ele ocorre quando um agente completa uma tarefa com sucesso, mas viola uma restrição de segurança que foi explicitamente declarada em um turno anterior da conversa. O agente "esquece" ou falha em recuperar a restrição porque ela está separada da tarefa atual por um longo histórico de interação, levando a danos irreversíveis (ex: deletar e-mails sem aprovação, destruir registros de banco de dados).

Os autores distinguem isso de falhas gerais de seguimento de instrução. Em um evento GHOST:

  1. O objetivo da tarefa é concluído com sucesso.
  2. A restrição de segurança ainda é válida e necessária.
  3. A restrição está disponível no contexto histórico, mas não é restatada na promoção de retomada imediata.
  4. O agente executa a tarefa de forma insegura, apesar de a restrição estar presente na janela de contexto completa.

Estrutura Teórica: Alcance de Região de Perigo

O artigo fornece uma análise teórica modelando restrições de segurança como regiões de perigo (BsB_s) no espaço de ação. Os autores definem um perigo de entrada condicional residual, hkh_k, representando a probabilidade de um agente entrar em uma região de perigo em uma oportunidade de segurança crítica kk, dado um prefixo de histórico seguro.

Insight Teórico Chave:
Usando uma estrutura de perigo condicional, os autores provam que, se os perigos condicionais residuais ao longo de prefixos seguros forem limitados inferiormente por uma sequência não somável (isto é, ∑ϵk=∞\sum \epsilon_k = \infty), o agente entrará na região de perigo quase certamente (Pr(σB<∞)=1Pr(\sigma_B < \infty) = 1).

Eles estabelecem ainda um Corolário Condicionado ao Contexto: À medida que o histórico de interação cresce (aumentando o comprimento do contexto LkL_k), o efeito de "diluição de atenção" pode enfraquecer a governança das restrições históricas, aumentando efetivamente o limite inferior do perigo residual. Se este limite inferior de perigo permanecer não somável ao longo de oportunidades indefinidas, a probabilidade de um evento GHOST se aproxima de 1. Isso sugere que históricos mais longos não apenas reduzem o desempenho linearmente, mas podem alterar fundamentalmente a dinâmica de segurança, tornando as violações inevitáveis sem intervenção.

Metodologia: SCARBench e STAR-Guard

1. SCARBench: Benchmark de Disponibilidade de Restrição de Segurança na Reativação

Para validar empiricamente o GHOST, os autores introduzem o SCARBench, um benchmark executável e fundamentado em ambiente.

  • Estrutura: Compreende 103 cenários base únicos em seis domínios de uso de ferramentas (dispositivo/calendário, finanças, e-mail, sistema de arquivos, requisições de rede, execução de script), totalizando 412 instâncias correspondentes.
  • Condições: Cada cenário é testado sob quatro condições que variam conforme o comprimento do histórico (Curto vs. Longo) e a disponibilidade da restrição (Explícita vs. Implícita):
    • SE/SI: Histórico curto com restrições Explícitas/Implícitas.
    • LE/LI: Histórico longo (6.000+ tokens, 56–160 turnos) com restrições Explícitas/Implícitas.
  • Métrica: O benchmark mede o GHOST Estrito, definido como uma instância onde o agente completa a tarefa de forma segura sob a condição Explícita (LE), mas a completa de forma insegura sob a condição Implícita (LI), apesar da restrição estar presente no histórico.

2. STAR-Guard: Uma Defesa de Duas Camadas

Para mitigar o GHOST, os autores propõem o STAR-Guard (Segurança de Rastreamento de Restrição de Segurança, Ativação e Guarda de Auditoria em Tempo de Execução), um mecanismo de defesa que não depende de conhecimento de oráculo das restrições.

  • Camada 1: Restauração Semântica de Restrição

    • Extração: Um módulo de ingestão online analisa as mensagens recebidas do usuário para detectar restrições de segurança persistíveis, extraindo seu escopo, gatilho e regra.
    • Armazenamento: Estas são armazenadas como "objetos de regra de ciclo de vida" estruturados em uma biblioteca externa.
    • Restauração: Quando uma tarefa é retomada, um portão semântico cruza a tarefa atual com a biblioteca. As restrições aplicáveis são semanticamente restauradas (renderizadas) no prompt de contexto atual para guiar a geração de propostas do agente.
    • Limitação: Esta camada é probabilística; ela reduz a probabilidade de propostas inseguras, mas não pode garantir a segurança.
  • Camada 2: Auditoria Determinística Pré-Execução

    • Interposição: Antes que qualquer ação alcance o ambiente, um auditor de regras determinístico verifica a ação proposta pelo agente contra as restrições ativas.
    • Aplicação: O auditor aplica uma política de "proibição primeiro". Se uma proposta violar uma regra de proibição, ela é bloqueada imediatamente. Se violar uma regra de pré-requisito (ex: "backup antes de deletar"), o sistema tenta executar o pré-requisito (reparo) e realiza uma nova auditoria. Se o reparo for impossível, a ação é bloqueada.
    • Garantia: Esta camada garante que nenhuma ação que viole uma restrição ativa alcance o ambiente, interrompendo o mecanismo de acumulação de perigo.

Resultados Experimentais

Os autores avaliaram o STAR-Guard em sete modelos (cinco servidos via API, dois implantados localmente) usando o SCARBench.

  1. Prevalência de GHOST:

    • O GHOST é um problema generalizado. No GPT-5.5, a taxa de GHOST estrito foi de 11,5% sob condições benignas de contexto longo.
    • Outros modelos mostraram taxas variando de 6,8% (Kimi-K2.6) a 27,8% (Qwen3.5-4B).
    • A métrica "Diferença-em-Diferenças" confirmou que históricos longos amplificam significativamente a taxa de falha de recuperação de restrição em comparação com históricos curtos.
  2. Eficácia do STAR-Guard:

    • GPT-5.5: O STAR-Guard reduziu a taxa de Conclusão Insegura (UC) de 12,4% para 0,0% e a taxa de GHOST estrito de 11,5% para 0,0%, enquanto aumentou a Conclusão Segura (SC) de 76,3% para 94,0%.
    • Qwen3.5-4B: O SC aumentou de 47,0% para 81,2%, enquanto o GHOST caiu de 27,8% para 1,9%.
    • Estudos de Ablação: Os resultados demonstram que nem a "Restauração Somente" nem a "Auditoria Somente" são suficientes isoladamente. A Restauração melhora a segurança, mas deixa riscos residuais; a Auditoria bloqueia riscos, mas pode dificultar a conclusão da tarefa se usada sem orientação semântica. A combinação alcança o melhor equilíbrio.
  3. Comparação com Baselines:

    • Métodos de recuperação padrão (BM25), sumarização e refinamentos de seguimento de instrução (ex: DeCRIM, Prompt Reminder) falharam em reduzir significativamente as taxas de GHOST, muitas vezes mantendo altas taxas de conclusão insegura.
    • Métodos baseados em oráculo (que assumem que a restrição já é conhecida) tiveram bom desempenho, mas não são práticos para implantação no mundo real, onde as restrições devem ser capturadas online. O STAR-Guard alcançou segurança comparável sem acesso a oráculo.

Significância e Alegações

O artigo afirma que o GHOST representa uma lacuna de segurança crítica e subexplorada em agentes de longo horizonte, que não pode ser resolvida simplesmente aumentando o tamanho da janela de contexto ou confiando em capacidades padrão de seguimento de instrução.

  • Contribuição Teórica: Formaliza o risco de degradação da governança de segurança ao longo do tempo, mostrando que, sem intervenção, a probabilidade de violações de segurança se aproxima da certeza sob condições de perigo não somáveis.
  • Contribuição Prática: Introduz o SCARBench como um padrão rigoroso para avaliar a recuperação de restrições de segurança histórica e propõe o STAR-Guard como um mecanismo de defesa viável e sem necessidade de oráculo.
  • Descoberta Central: Os autores concluem que manter a segurança em agentes de longo horizonte requer uma abordagem dupla: restauração semântica para guiar a intenção do agente e auditoria determinística para impor restrições rígidas, pois modelos probabilísticos sozinhos não podem governar a segurança de forma confiável através de extensos históricos de interação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →