← Últimos artigos
🤖 AI

SecureClaw: Clawing Back Control of LLM Agents

O SecureClaw é uma arquitetura de segurança de fronteira dupla para agentes de LLM que utilizam ferramentas, que previne ações externas não autorizadas e a exposição de dados sensíveis ao impor um gateway confiável para operações de leitura e um protocolo PREVIEW-to-COMMIT para operações de escrita, alcançando taxas de sucesso de ataque próximas de zero em múltiplos benchmarks enquanto mantém a utilidade das tarefas.

Autores originais: Yuhan Ma, Stefan Schmid

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yuhan Ma, Stefan Schmid

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contrata um assistente pessoal muito inteligente, mas pouco confiável (o Agente LLM) para lidar com suas tarefas sensíveis, como pagar contas, ler e-mails privados ou gerenciar sua agenda.

O problema é que esse assistente é um pouco imprevisível. Se você der a ele um documento com o número da sua conta bancária, ele pode acidentalmente (ou maliciosamente) ler os números em voz alta para um estranho, ou pode ser enganado por uma nota oculta dentro de um e-mail para enviar seu dinheiro para um golpista.

Os guardas de segurança atuais geralmente tentam impedir que o assistente faça a coisa errada (como enviar o dinheiro), mas muitas vezes falham em impedir que o assistente veja o segredo em primeiro lugar. Uma vez que o assistente vê o segredo, ele pode sussurrá-lo para outros programas ou anotá-lo em suas notas antes mesmo que o guarda tenha a chance de impedi-lo.

SecureClaw é um novo sistema de segurança projetado para resolver ambos os problemas de uma só vez. Ele trata o "ver" e o "fazer" como dois trabalhos distintos que precisam de duas fechaduras diferentes.

Aqui está como funciona, usando uma analogia simples:

As Duas Fechaduras do SecureClaw

1. A "Venda" para Ler (O Gateway)

Imagine que seu assistente precise olhar para uma fatura secreta para saber quanto pagar.

  • Modo Antigo: Você entrega ao assistente a fatura de papel real. Eles podem ler os números, copiá-los ou até lê-los em voz alta para um hacker que esteja ouvindo.
  • Modo SecureClaw: Você não entrega o papel a eles. Em vez disso, você entrega uma caixa misteriosa (um "handle opaco") e uma nota pequena e sanitizada (um "resumo delimitado").
    • A nota diz: "Fatura do Fornecedor A, $4.200, vencimento sexta-feira."
    • A caixa misteriosa é um código que apenas o cofre seguro sabe como abrir.
    • O assistente pode planejar seu trabalho usando a nota e o código, mas ele não pode abrir a caixa para ver os detalhes reais da fatura. Ele não pode copiar os números reais porque nunca os viu.

2. A "Dupla Verificação" para Fazer (O Executor)

Agora, imagine que o assistente queira enviar um e-mail para pagar essa fatura.

  • Modo Antigo: O assistente escreve o e-mail e clica em "Enviar". Se um hacker enganou o assistente para mudar o endereço de e-mail para um golpista, o dinheiro vai para o golpista.
  • Modo SecureClaw: O assistente só pode propor o e-mail. Eles escrevem um rascunho e dizem: "Eu quero enviar isto."
    • Um Guarda Confiável (o Executor) pega o rascunho.
    • O Guarda verifica: "Você pediu para enviar isso? O destinatário está correto? O valor está certo?"
    • Crucialmente, o Guarda verifica os detalhes exatos contra um recibo selado e imutável do que foi originalmente aprovado.
    • Se o assistente tentou mudar secretamente o endereço de e-mail para um golpista depois de obter a aprovação, o Guarda detecta a discrepância e bloqueia o e-mail. Somente o Guarda tem o poder de realmente clicar em "Enviar".

Por Que Isso é um Grande Avanço

O artigo testou este sistema contra três diferentes "parquinhos de hackers" (AgentDojo, AgentLeak e ASB), onde atacantes tentaram enganar os agentes para roubar dados ou enviar dinheiro para as pessoas erradas.

  • O Resultado: O SecureClaw foi o único sistema que conseguiu deter 100% das transferências de dinheiro não autorizadas (0% de sucesso do ataque) e reduziu os vazamentos de dados secretos para quase zero.
  • O Segredo do Sucesso: O artigo prova que você não pode usar apenas uma fechadura.
    • Se você tiver apenas a "Dupla Verificação" (impedir o envio), o assistente ainda pode ler o segredo e vazá-lo através de suas notas internas.
    • Se você tiver apenas a "Venda" (esconder o segredo), o assistente ainda pode ser enganado para enviar uma mensagem para a pessoa errada se não tiver o segredo em mãos.
    • O SecureClaw usa ambos. Ele mantém os segredos escondidos do assistente e garante que o assistente não possa forçar uma ação sem uma verificação final e confiável.

O Que Acontece Quando Ele Diz "Não"?

Às vezes, o sistema bloqueia uma solicitação porque ela parece suspeita. No passado, isso poderia simplesmente interromper todo o fluxo de trabalho, frustrando o usuário. O SecureClaw possui um recurso de "Recuperação Segura".

Se o Guarda bloquear uma solicitação, em vez de apenas dizer "Erro", ele oferece ao assistente um caminho seguro e pré-aprovado para tentar novamente.

  • Exemplo: "Não posso enviar este e-mail para o estranho. Mas eu posso redigir uma mensagem para você revisar primeiro."
  • Isso mantém o trabalho fluindo sem baixar os padrões de segurança.

O Resumo da Ópera

O SecureClaw é como contratar um guarda-costas que usa uma venda ao ler seu diário (para que não memorize seus segredos) e que segura as chaves do seu carro (para que não possa te levar a um lugar perigoso sem antes conferir o mapa). Ele separa a capacidade de planejar da capacidade de agir, garantindo que, mesmo que o assistente seja enganado, o dano seja contido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →