← Últimos artigos
🤖 AI

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

Este artigo propõe a "Engenharia de Adaptação de IA", um framework de substrato de tempo de execução que desloca o foco da engenharia de software autônomo da capacidade do modelo isoladamente para o sistema integrado modelo-adaptação-ambiente, definindo onze responsabilidades de componentes e uma escada de quatro níveis para produzir alterações de software verificáveis, auditáveis e mantíveis.

Autores originais: Hailin Zhong, Shengxin Zhu

Publicado 2026-05-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hailin Zhong, Shengxin Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um aprendiz programador brilhante e super-rápido. Esse aprendiz (o "Modelo de Fundação") pode escrever código, corrigir bugs e explicar como o software funciona melhor do que quase qualquer pessoa. Mas, se você deixar esse aprendiz solto em um projeto de software real sem nenhum suporte, ele frequentemente falha. Ele pode corrigir o arquivo errado, quebrar algo mais, esquecer o que estava fazendo ou declarar vitória quando o trabalho ainda não foi realmente concluído.

Por muito tempo, as pessoas pensaram que o problema era que o aprendiz não era inteligente o suficiente. Achavam que precisávamos apenas treinar o aprendiz para ser mais inteligente.

Este artigo argumenta que essa é a maneira errada de encarar o problema. O problema não está no cérebro do aprendiz; está na oficina onde ele está trabalhando.

A Ideia Central: O "Cinto de Segurança" (Harness)

Os autores propõem que precisamos construir um substrato de runtime especial, que eles chamam de AI Harness (Cinto de Segurança de IA).

Pense no AI Harness como um cinto de segurança de alta tecnologia ou um equipamento de segurança para um alpinista.

  • O Aprendiz (Modelo): Tem a força e a habilidade para escalar.
  • A Montanha (Ambiente de Software): É complexa, cheia de pedras soltas e possui fendas ocultas.
  • O Cinto de Segurança (O Novo Sistema): É o equipamento que conecta o alpinista à montanha. Ele segura as ferramentas, aponta qual ponto de apoio agarrar, verifica se a corda está segura e registra exatamente o que foi feito.

Sem o cinto de segurança, o alpinista pode ter músculos ótimos, mas ainda assim cair porque não sabia onde pisar ou não tinha como verificar sua segurança. O artigo afirma que a capacidade de engenharia de software não se trata apenas da inteligência do modelo; trata-se do sistema (Modelo + Cinto de Segurança + Ambiente) trabalhando em conjunto.

As 11 Funções do Cinto de Segurança

O artigo divide esse "Cinto de Segurança" em 11 funções específicas que ele deve realizar, semelhantes a um gerente de projeto combinado com um inspetor de segurança:

  1. Especificação da Tarefa: Dizer claramente ao aprendiz o que construir.
  2. Seleção de Contexto: Entregar a ele os projetos certos (arquivos) para que ele não olhe os errados.
  3. Acesso a Ferramentas: Dar a ele as chaves de boca e chaves de fenda adequadas.
  4. Memória do Projeto: Lembrá-lo da história do edifício e de onde as coisas estão.
  5. Estado da Tarefa: Manter uma lista de verificação do que foi feito e do que vem a seguir.
  6. Observabilidade: Permitir que ele veja os logs e mensagens de erro claramente.
  7. Atribuição de Falhas: Se algo quebrar, ajudá-lo a descobrir por que antes que ele tente corrigir.
  8. Verificação: Fazer com que ele prove que a correção realmente funciona.
  9. Permissões: Impedi-lo de fazer coisas perigosas (como derrubar todo o edifício).
  10. Auditoria de Entropia: Verificar se ele deixou uma bagunça para trás (como código antigo ou documentação desorganizada).
  11. Registro de Intervenções: Anotar se um humano precisou intervir para ajudar e por quê.

O Experimento da "Escada" (H0 a H3)

Para provar seu ponto, os autores construíram uma "escada" de quatro níveis para testar o quanto de ajuda o aprendiz precisa. Eles mantiveram a tarefa e o modelo os mesmos, mas alteraram o nível do Cinto de Segurança:

  • Nível 0 (O Aprendiz Nu): O aprendiz recebe a tarefa e os arquivos. Sem ferramentas, sem memória, sem verificações de segurança. Ele tem que adivinhar tudo.
  • Nível 1 (O Cinto de Ferramentas): O aprendiz recebe uma lista de ferramentas que pode usar e um protocolo para usá-las. Ele ainda pode se perder, mas tem o equipamento certo.
  • Nível 2 (O Mapa e o Caderno): O aprendiz recebe as ferramentas mais um mapa do edifício (arquitetura), um caderno de erros passados e uma lista de verificação para acompanhar seu progresso.
  • Nível 3 (O Equipamento Completo de Segurança): O aprendiz recebe tudo acima, mais um protocolo rigoroso para reproduzir o bug, diagnosticá-lo, corrigi-lo e escrever um relatório formal provando que a correção funciona antes de ser autorizado a finalizar.

O Que Eles Encontraram

Quando executaram a mesma tarefa (corrigir um bug de login) em cada nível, os resultados foram claros:

  • No Nível 0, o aprendiz pode eventualmente corrigir o bug, mas não deixou nenhuma prova de como fez isso, e pode ter quebrado outras coisas.
  • No Nível 3, o aprendiz não produziu apenas uma correção; produziu um pacote completo de evidências. Ele mostrou o bug, explicou por que aconteceu, mostrou a correção e executou testes para provar que funcionou.

O artigo conclui que a pergunta não deve ser "A IA é inteligente o suficiente para escrever código?", mas sim "O sistema Modelo-Cinto de Segurança-Ambiente produz uma mudança que é verificável, atribuída e mantível?"

A Conclusão

O artigo sugere que, para tornar a IA verdadeiramente útil para a engenharia de software, não devemos focar apenas em tornar a IA mais inteligente. Precisamos construir melhores oficinas (o Cinto de Segurança) que gerenciem o contexto, as ferramentas, a memória e as verificações de segurança.

Assim como um desenvolvedor humano depende de sua IDE, sua documentação e sua suíte de testes para fazer um bom trabalho, um agente de IA precisa de um Cinto de Segurança estruturado para transformar sua capacidade bruta de codificação em engenharia de software confiável. O artigo fornece um projeto para construir esse "Cinto de Segurança" e uma maneira de medir o quão bem ele funciona.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →