← Últimos artigos
🤖 AI

Distributing Security Controls Through Harness Engineering

Este artigo apresenta o SHarD, um harness de segurança distribuível que incorpora e escala com sucesso controles de sandboxing de SO, varredura de habilidades e restrição de ferramentas em agentes de codificação de IA comerciais, alcançando 100% de eficácia na mitigação dos riscos do OWASP Top 10 sem comprometer o desempenho do agente.

Autores originais: William Robert Gore

Publicado 2026-07-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: William Robert Gore

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde o seu computador tem um assistente superinteligente que não apenas responde perguntas, mas que realmente escreve código, corrige erros e constrói software para você. Eles são chamados de "agentes de codificação de IA" e estão se tornando incrivelmente populares, com milhões de pessoas usando-os para realizar o trabalho mais rápido. Mas aqui está o detalhe: assim como um estagiário da vida real que pode acidentalmente deletar todo o seu disco rígido se você fizer a pergunta errada, esses ajudantes digitais podem ser perigosos se forem enganados. Se um hacker infiltrar uma instrução maliciosa em um documento que o agente lê, o agente pode pensar que é um comando normal e começar a destruir arquivos ou roubar segredos. Este é o grande problema: como podemos deixar esses agentes poderosos trabalharem sem que eles saiam do controle?

Para resolver isso, pesquisadores estão estudando algo chamado "harness" (arnês ou estrutura de segurança). Pense no modelo de IA (o cérebro) como o motor de um carro de corrida, e o harness como o chassi, os freios e a gaiola de segurança do carro. O motor é poderoso, mas sem a gaiola, é apenas uma explosão perigosa à espera de acontecer. O harness é a camada de código que envolve a IA, controlando o que ela pode tocar, o que pode dizer e o que pode fazer. A grande questão que os cientistas estão fazendo é: Podemos construir uma gaiola de segurança universal que funcione para qualquer agente de IA, não importa quem o tenha feito, e entregá-la a todos como uma simples atualização de software?

Este artigo, escrito por William R. Gore, da Georgia Tech, mergulha justamente nessa questão. O autor queria ver se poderíamos pegar ferramentas de segurança padrão — como sandboxes digitais que prendem a IA em uma sala segura, ou scanners que verificam códigos maliciosos antes que a IA os toque — e agrupar tudo isso em um único "harness" que qualquer pessoa pudesse instalar com um único comando. O objetivo era provar que você não precisa esperar que uma empresa específica (como a Microsoft ou o Google) construa a segurança em seu produto; em vez disso, você poderia construir sua própria gaiola de segurança e colocá-la sobre qualquer agente de IA comercial.

A equipe de pesquisa montou um laboratório para testar isso. Eles usaram dois agentes de codificação de IA comerciais populares e tentaram enganá-los com uma série de 23 ataques diferentes, baseados em uma lista famosa das dez principais formas pelas quais sistemas de IA são hackeados. Primeiro, eles testaram os agentes sem nenhuma proteção para ver o quão ruim as coisas poderiam ficar. Depois, adicionaram as ferramentas de segurança diretamente aos agentes para ver se funcionavam. Por fim, construíram seu próprio harness personalizado, chamado SHarD (Secure Harness Distribution), que envolvia um outro agente de código aberto e incluía as mesmas ferramentas de segurança.

Os resultados foram bastante empolgantes. O estudo descobriu que, sim, você pode absolutamente envolver essas ferramentas de segurança ao redor de um agente de IA e distribuí-las facilmente. Quando testaram o harness personalizado, ele teve um desempenho tão bom quanto os melhores agentes comerciais protegidos nos casos em que possuíam controles ativos. Especificamente, o harness alcançou uma pontuação perfeita em uma métrica "ajustada" que focava nas três ferramentas funcionais (Skill Scanning, OS Sandboxing e Tool Restriction), igualando os resultados de alto nível comercial. No entanto, os pesquisadores tiveram que excluir os testes de "Content Protection" (Proteção de Conteúdo) dessa pontuação perfeita porque essa ferramenta específica era muito pesada e conflitava com as outras, por isso não foi incluída no harness final. As três principais ferramentas que funcionaram melhor foram:

  1. OS Sandboxing: Isso é como colocar a IA em uma caixa de vidro. Mesmo que a IA seja enganada para tentar deletar arquivos, a caixa impede que ela toque em qualquer coisa fora de sua área designada.
  2. Skill Scanning: Antes que a IA possa usar uma nova "habilidade" (uma ferramenta ou plugin), um scanner verifica se há vírus ou instruções maliciosas.
  3. Tool Restriction: Este é um livro de regras simples que diz: "Você pode usar a calculadora, mas não tem permissão para usar o botão 'deletar tudo'".

No entanto, o artigo também apontou limites importantes. Um tipo de ferramenta de segurança, chamada "Content Protection" (que tenta ler os pensamentos da IA e impedir ideias ruins antes que elas aconteçam), não funcionou bem nesta configuração. Era muito pesada e na verdade atrapalhava as outras ferramentas, por isso os pesquisadores tiveram que deixá-la de fora. Eles também notaram algo assustador: às vezes, a IA agia de forma segura apenas por acidente, não por causa das regras, mas porque estava tendo um "bom dia". Mas, na próxima vez que você fizesse a mesma pergunta, ela poderia agir de forma perigosa novamente. Isso prova que você não pode confiar no cérebro da IA para ser seguro; você precisa do harness para forçar a segurança.

No fim, o artigo sugere que o futuro da segurança da IA não é apenas criar cérebros de IA mais inteligentes, mas sim construir melhores gaiolas de segurança (harnesses) que os engenheiros possam instalar e compartilhar facilmente. Ele mostra que a segurança pode ser escalada assim como o software, dando às equipes uma maneira de proteger seus agentes de IA sem ter que esperar que um fornecedor as conserte. Embora este tenha sido um experimento bem-sucedido com um conjunto específico de ferramentas, os autores admitem que precisam testar mais controles para construir um livro de regras perfeito sobre o que torna uma ferramenta de segurança "pronta para o harness". Mas a principal conclusão é clara: com o harness certo, podemos deixar nossos agentes de IA correrem livres sem que eles nos passem por cima.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →