← Últimos artigos
🤖 AI

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

Este artigo apresenta o BUILD-AND-FIND, um protocolo de avaliação consciente do esforço que avalia a qualidade de bases de código geradas por agentes, medindo não apenas a correção comportamental, mas também a precisão e o esforço de inspeção necessários para que agentes subsequentes recuperem a intenção de projeto e as especificações originais.

Autores originais: Jhen-Ke Lin

Publicado 2026-05-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jhen-Ke Lin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Não Se Trata Apenas da Resposta, Trata-se da Nota

Imagine que você contrata um chef (um agente de IA) para cozinhar uma refeição complexa com base em uma receita secreta que você forneceu.

  • Antigo Jeito: Você prova a comida. Se tiver bom gosto, o chef passa.
  • Novo Problema: E se o chef cozinhar uma refeição deliciosa, mas esconder os ingredientes secretos em uma caixa trancada, escrever a receita com tinta invisível ou deixar a cozinha bagunçada? Mais tarde, outro chef (uma IA diferente) precisará entrar, provar a comida e descobrir como ela foi feita para que possa corrigir uma borda queimada ou adicionar mais sal. Se o primeiro chef não deixou pistas claras, o segundo chef pode falhar, mesmo que a comida tenha tido ótimo gosto.

Este artigo apresenta uma nova maneira de testar programadores de IA chamada BUILD-AND-FIND. Em vez de apenas verificar se o código "funciona" (tem bom gosto), ele verifica se o código é fácil de ler e entender para a próxima pessoa (ou IA) que tiver que trabalhar com ele.


Os Dois Papéis: O Construtor e o Descobridor

Os pesquisadores montaram um jogo com dois papéis distintos:

  1. O Construtor (O Chef):

    • Recebe uma "especificação" oculta (a receita secreta).
    • Sua função é construir um projeto de software completo (a cozinha e a refeição) com base nessas instruções.
    • Ele não sabe que ninguém mais olhará para o seu trabalho imediatamente; ele apenas precisa fazer funcionar.
  2. O Descobridor (O Inspetor):

    • Recebe apenas o código finalizado (a cozinha e a refeição). Ele não tem permissão para ver a receita secreta original.
    • Recebe uma lista de perguntas de múltipla escolha sobre as escolhas de design (por exemplo: "Por que o chef escolheu este tipo específico de forno?" ou "Onde o sal está armazenado?").
    • Sua função é examinar o código, encontrar as evidências e responder às perguntas corretamente.

O Quadro de Pontuação: Precisão vs. Esforço

O artigo mede duas coisas principais:

  1. Eles acertaram? (Precisão)

    • O Descobridor consegue descobrir a resposta correta apenas olhando para o código?
    • Analogia: O Inspetor conseguiu encontrar o pote de especiarias escondido com sucesso?
  2. Quão difícil foi procurar? (Esforço de Inspeção)

    • Esta é a grande inovação do artigo. Se dois Construtores fizerem códigos que permitam ao Descobridor obter a resposta correta, qual deles foi mais fácil de entender?
    • Os pesquisadores medem o "esforço" contando quantos bytes de código o Descobridor teve que ler ou pesquisar.
    • Analogia: Se o Chef A deixou o pote de sal no balcão, e o Chef B o escondeu dentro de um cofre trancado que exigia um código complexo para abrir, ambos os chefs fizeram comida comestível. Mas o Chef A tornou mais fácil para a próxima pessoa trabalhar. O artigo recompensa o chef que deixa o "sal" no balcão.

Por Que Isso Importa

O artigo argumenta que, no futuro, agentes de IA trabalharão em equipes. Uma IA escreve um programa, e outra IA precisa corrigi-lo ou atualizá-lo mais tarde.

  • Se a primeira IA escrever um código que está "correto", mas bagunçado ou confuso, a segunda IA terá dificuldades.
  • BUILD-AND-FIND prova que podemos medir o quão "legível" ou "comunicativo" é o código de uma IA, separadamente de o código realmente funcionar.

Os Resultados (O Que Eles Encontraram)

Os pesquisadores testaram isso com vários modelos de IA poderosos (como GPT-5, Claude Opus e outros) em dois tipos de tarefas: construir um mini-banco de dados e construir um pequeno servidor web.

  • O Problema do "Alto Priori": As perguntas que fizeram eram coisas que engenheiros experientes geralmente sabem de cor (como "bancos de dados geralmente salvam logs antes de escrever"). Como as IAs são inteligentes, elas podiam adivinhar as respostas corretamente apenas usando seu conhecimento geral, mesmo sem ler o código.
  • A Solução: Como todos acertaram as respostas, os pesquisadores não podiam apenas contar "respostas corretas". Em vez disso, eles olharam para quanto leitura as IAs tiveram que fazer.
    • Alguns modelos de IA escreveram códigos onde as respostas eram óbvias e fáceis de encontrar (baixo esforço).
    • Outros escreveram códigos onde as respostas estavam enterradas profundamente nos arquivos, exigindo que o Descobridor lesse muito mais para encontrá-las (alto esforço).
  • O Vencedor: Os modelos que produziram códigos que exigiam a menor quantidade de leitura para encontrar as respostas foram considerados os melhores em "comunicar" suas escolhas de design.

A Rede de Segurança (Controles)

Para garantir que as IAs não estavam apenas trapaceando ou adivinhando, os pesquisadores adicionaram verificações de segurança:

  • Teste Apenas de Perguntas: Eles fizeram as perguntas ao Descobridor sem mostrar nenhum código. Se a IA acertasse aqui, era apenas um palpite baseado em conhecimento geral.
  • Teste Apenas de Especificação: Eles mostraram ao Descobridor a receita secreta, mas nenhum código. Isso provou que a receita estava clara.
  • O "Portão": Os pesquisadores só contaram a pontuação de "esforço" se o Descobridor realmente acertasse a resposta. Se o Descobridor não conseguisse encontrar a resposta de forma alguma, o código era considerado um fracasso, independentemente de quão pouco ele tivesse que ler.

Resumo

BUILD-AND-FIND é um novo teste para programadores de IA. Ele pergunta: "Se você escrever este código, outra IA será capaz de entender facilmente por que você fez as escolhas que fez?"

Ele vai além de perguntar "O código funciona?" para perguntar "O código é uma boa ferramenta de comunicação para o futuro?". A melhor IA não é apenas aquela que constrói a coisa certa; é aquela que constrói a coisa de uma maneira que torna fácil para a próxima pessoa pegar e continuar trabalhando.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →