: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
O artigo apresenta o , um benchmark de código aberto que avalia a capacidade de agentes de IA de manter planejamento estratégico e execução consistente ao gerenciar uma startup simulada por um ano, revelando que o uso de "scratchpads" é crucial para o sucesso e que modelos de ponta ainda falham devido a modos específicos como a detecção inadequada de clientes adversários.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem uma fábrica de sonhos (uma startup) e um novo funcionário muito especial: um gerente feito de inteligência artificial. O seu objetivo é simples: fazer essa fábrica dar lucro por um ano inteiro.
Mas aqui está o problema: o mercado é cheio de armadilhas, os funcionários têm habilidades diferentes e o tempo passa rápido. A maioria dos gerentes de IA tenta fazer tudo de uma vez, se distrai e, no final do ano, a empresa faliu.
É exatamente isso que o YC-Bench (o "Banco de Testes YC") quer descobrir. Os autores criaram um jogo de simulação para ver quais IAs conseguem realmente planejar o futuro e não esquecer o que aprenderam ao longo de um ano inteiro.
Aqui está a explicação do papel, traduzida para uma linguagem simples e com algumas analogias divertidas:
1. O Jogo: "Gerente de Startup por um Ano"
Pense no YC-Bench como um jogo de tabuleiro complexo, mas em vez de um tabuleiro, é um mundo digital onde a IA é o CEO.
- O Cenário: Você começa com $200.000. Tem 12 meses para ganhar o máximo de dinheiro possível.
- Os Desafios:
- Clientes Trapaceiros: Cerca de 1 em cada 3 clientes são "vilões". Eles prometem pagar muito, mas na verdade entregam um trabalho impossível de terminar. Se você aceitar, perde tempo e dinheiro.
- Funcionários com Talentos Específicos: Você tem 8 funcionários. Um é ótimo em "pesquisa", mas péssimo em "dados". Se você mandar o especialista em dados fazer pesquisa, o trabalho atrasa e você perde.
- O Salário Cresce: Quanto mais sucesso você tem, mais os funcionários ganham. Se você não tiver lucro, o salário deles vai te deixar no vermelho.
2. A Grande Dificuldade: A Memória de Peixe Dourado
O maior problema dos gerentes de IA é que eles têm uma memória curta.
- O Problema: A IA só consegue "lembrar" das últimas 20 conversas. Se o jogo durar 1000 turnos, ela esquece quem foi o cliente trapaceiro que a enganou no mês 1.
- A Solução (O "Bloco de Notas"): Para vencer, a IA precisa usar um rascunho (scratchpad). É como um caderno onde ela escreve: "Não confie na empresa X, eles são trapaceiros!" ou "O funcionário Y é o melhor para pesquisa".
- A Descoberta: O estudo mostrou que quem usa o caderno de anotações ganha. As IAs que não escrevem no caderno esquecem as lições e repetem os mesmos erros até falir.
3. Quem Ganhou? (Os Resultados)
Os autores testaram 12 "cérebros" de IA diferentes (os modelos mais famosos do mundo, como GPT-5, Claude, Gemini, etc.).
- A Realidade Dura: De 12 modelos, apenas 3 conseguiram ficar ricos (terminaram com mais de $1 milhão). Os outros 9 faliram ou terminaram com menos dinheiro do que começaram.
- O Campeão: O Claude Opus 4.6 foi o melhor, terminando com cerca de $1,27 milhão.
- O Herói Econômico: O GLM-5 ficou em segundo lugar ($1,21 milhão), mas gastou 11 vezes menos dinheiro para rodar o teste. É como se ele fosse um Ferrari que roda com gasolina de carro popular: muito eficiente!
- Os Perdedores: Muitos modelos (como o Grok e o Gemini Flash) caíram nas armadilhas dos clientes trapaceiros ou não souberam organizar a equipe, gastando todo o dinheiro em salários sem ter lucro.
4. Por que eles falharam? (As Armadilhas)
O estudo descobriu três motivos principais para a falência:
- Cegueira para Vilões: A IA aceita trabalhos de clientes que ela já deveria saber que são perigosos. É como entrar em uma loja onde você já foi roubado antes e achar que dessa vez será diferente.
- Má Gestão de Equipe: Mandar o cozinheiro dirigir o caminhão. A IA coloca o funcionário errado na tarefa errada, o trabalho atrasa e o cliente não paga.
- Falta de Ação: Algumas IAs escrevem no caderno: "Preciso parar de aceitar trabalhos da empresa X". Mas, no turno seguinte, elas ignoram a própria regra e aceitam o trabalho. É como um dieter que escreve "não coma chocolate" e logo depois come a barra inteira.
5. A Lição Final
O YC-Bench nos ensina que, embora as IAs sejam incríveis em responder perguntas rápidas, elas ainda têm dificuldade em pensar a longo prazo.
- Planejamento vs. Reação: Elas são ótimas em reagir ao que está acontecendo agora, mas péssimas em planejar o que vai acontecer daqui a 6 meses.
- A Memória é Tudo: Para uma IA ser um bom gerente de negócios, ela precisa ter um "caderno de anotações" e ser disciplinada em usá-lo. Sem isso, ela é apenas um funcionário distraído que comete os mesmos erros repetidamente.
Em resumo: O YC-Bench é como um teste de direção para IAs em uma estrada cheia de buracos. A maioria bateu o carro porque esqueceu de olhar o mapa (o caderno de anotações) ou não percebeu que o motorista do carro ao lado (o cliente trapaceiro) era perigoso. Apenas os mais espertos e organizados chegaram ao destino com o carro intacto e o bolso cheio.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.