← Últimos artigos
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

Este estudo controlado pré-registrado demonstra que a escolha do scaffold impacta significativamente o desempenho de agentes em benchmarks GAIA, revelando que as pontuações de capacidade medidas são altamente condicionais ao scaffold e que a redução antecipada da sensibilidade ao scaffold conforme os modelos melhoram não se sustenta, com designs multi-agentes estruturados frequentemente gerando ganhos substanciais de acurácia sobre abordagens ReAct padrão.

Autores originais: Jason Starace

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jason Starace

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando julgar o quão bom um chef é ao cozinhar uma refeição complexa. Você tem três cozinhas diferentes (andaimes/scaffolds) para testá-lo:

  1. O Chef Solo (ReAct): O chef pensa, pega um ingrediente, cozinha, pensa novamente e pega o próximo ingrediente, tudo em um fluxo contínuo.
  2. A Equipe de Cozinha (Planner-Actor-Rater): Um gerente escreve uma receita, um cozinheiro executa os passos e um crítico prova o prato após cada etapa para garantir que esteja correto antes de prosseguir.
  3. O Projeto e o Construtor (Planner-then-Executor): Primeiro, um planejador escreve um projeto detalhado, passo a passo, sem ferramentas. Então, um construtor pega esse projeto e constrói o prato.

Este estudo fez uma pergunta simples: O fato de você colocar o chef em uma determinada cozinha muda o quão bom ele parece ser?

A resposta é um retumbante sim. Na verdade, a "cozinha" importa tanto quanto o talento real do chef.

A Grande Descoberta: A "Cozinha" Importa Mais do que Você Pensa

Os pesquisadores testaram cinco "chefs" diferentes (modelos de IA da Anthropic, Google e OpenAI) em um conjunto de quebra-cabeças difíceis (chamados GAIA). Eles descobriram que simplesmente trocar a configuração da cozinha poderia mudar a pontuação de um modelo em 28 pontos percentuais.

Para colocar em perspectiva: Se você testasse um modelo em uma cozinha "Chef Solo" e ele obtivesse uma pontuação de 56%, mas depois colocasse o exato mesmo modelo em uma configuração de "Equipe de Cozinha", ele poderia subitamente obter uma pontuação de 84%. O chef não mudou; a maneira como ele foi permitido trabalhar é que mudou.

Isso significa que, quando vemos manchetes como "O Modelo X é 80% inteligente", esse número não é apenas sobre o modelo. É uma mistura do cérebro do modelo mais as instruções e ferramentas específicas que lhe foram dadas. Se você comparar dois modelos testados em cozinhas diferentes, você não está comparando seus cérebros; você está comparando suas cozinhas.

Desmistificando Mitos: Modelos "Mais Inteligentes" Não Precisam de Menos Ajuda

Os pesquisadores tinham um palpite (hipótese) de que os modelos mais poderosos, de "fronteira", seriam tão inteligentes que não se importariam muito com a configuração da cozinha. Eles pensavam que um supercérebro conseguiria lidar com uma cozinha bagunçada tão bem quanto uma limpa.

Eles estavam errados.

Na verdade, o modelo mais poderoso que testaram (Opus, da Anthropic) foi o que mais ganhou ao ter uma cozinha estruturada e organizada (a configuração da "Equipe de Cozinha") quando as tarefas eram difíceis. O modelo "mais inteligente" não foi o mais independente; foi o que mais se beneficiou de ter um gerente e um crítico. A lacuna entre o melhor e o pior desempenho não diminuiu para os modelos inteligentes; ela permaneceu ampla ou até aumentou.

A Surpresa da "Família" vs. "Ranking"

Outra surpresa foi que o benefício de uma cozinha sofisticada dependia de qual família o modelo pertencia, não apenas de como ele era "classificado".

  • A família Anthropic (Haiku, Sonnet, Opus) todos tiveram um grande impulso com a configuração da "Equipe de Cozinha".
  • Os modelos do Google e da OpenAI não tiveram esse mesmo impulso.

É como dizer que um tipo específico de motor de carro funciona muito melhor com uma marca específica de combustível, mas uma marca diferente de motor não se importa. Você não pode simplesmente assumir que um modelo de "nível superior" sempre se beneficiará mais de ferramentas melhores; depende de quem fez o motor.

Custo e Eficiência

O estudo também analisou o "recibo" (custo).

  • O "Chef Solo" (ReAct) foi o mais caro e lento. Ele cometia muitos erros e precisava tentar novamente com frequência.
  • As configurações "Equipe de Cozinha" e "Projeto" foram mais rápidas, cometeram menos erros e se recuperaram melhor quando algo dava errado no meio da tarefa.
  • O Vencedor: Uma combinação específica do modelo Gemini, do Google, com a configuração de "Projeto" foi a opção mais barata e precisa para as tarefas mais difíceis.

A Conclusão Final

Este artigo nos diz que os números de capacidade são condicionais. Você não pode dizer que um modelo é "X% capaz" no vácuo. Você tem que dizer: "X% capaz ao usar este conjunto específico de instruções e ferramentas".

Se você quiser saber o quão bom um IA realmente é, não pode olhar apenas para uma pontuação. Você tem que perceber que a pontuação é um instantâneo do modelo mais o andaime que o sustenta. Se você mudar o andaime, a pontuação muda, às vezes drasticamente. A "lacuna" entre o que um modelo pode fazer e o que ele realmente faz em um teste é enorme, e não diminui necessariamente só porque o modelo fica mais inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →