← Últimos artigos
🤖 AI

YC-Bench\texttt{YC-Bench}: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

O artigo apresenta o YC-Bench\texttt{YC-Bench}, um benchmark de código aberto que avalia a capacidade de agentes de IA de manter planejamento estratégico e execução consistente ao gerenciar uma startup simulada por um ano, revelando que o uso de "scratchpads" é crucial para o sucesso e que modelos de ponta ainda falham devido a modos específicos como a detecção inadequada de clientes adversários.

Autores originais: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

Publicado 2026-04-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma fábrica de sonhos (uma startup) e um novo funcionário muito especial: um gerente feito de inteligência artificial. O seu objetivo é simples: fazer essa fábrica dar lucro por um ano inteiro.

Mas aqui está o problema: o mercado é cheio de armadilhas, os funcionários têm habilidades diferentes e o tempo passa rápido. A maioria dos gerentes de IA tenta fazer tudo de uma vez, se distrai e, no final do ano, a empresa faliu.

É exatamente isso que o YC-Bench (o "Banco de Testes YC") quer descobrir. Os autores criaram um jogo de simulação para ver quais IAs conseguem realmente planejar o futuro e não esquecer o que aprenderam ao longo de um ano inteiro.

Aqui está a explicação do papel, traduzida para uma linguagem simples e com algumas analogias divertidas:

1. O Jogo: "Gerente de Startup por um Ano"

Pense no YC-Bench como um jogo de tabuleiro complexo, mas em vez de um tabuleiro, é um mundo digital onde a IA é o CEO.

  • O Cenário: Você começa com $200.000. Tem 12 meses para ganhar o máximo de dinheiro possível.
  • Os Desafios:
    • Clientes Trapaceiros: Cerca de 1 em cada 3 clientes são "vilões". Eles prometem pagar muito, mas na verdade entregam um trabalho impossível de terminar. Se você aceitar, perde tempo e dinheiro.
    • Funcionários com Talentos Específicos: Você tem 8 funcionários. Um é ótimo em "pesquisa", mas péssimo em "dados". Se você mandar o especialista em dados fazer pesquisa, o trabalho atrasa e você perde.
    • O Salário Cresce: Quanto mais sucesso você tem, mais os funcionários ganham. Se você não tiver lucro, o salário deles vai te deixar no vermelho.

2. A Grande Dificuldade: A Memória de Peixe Dourado

O maior problema dos gerentes de IA é que eles têm uma memória curta.

  • O Problema: A IA só consegue "lembrar" das últimas 20 conversas. Se o jogo durar 1000 turnos, ela esquece quem foi o cliente trapaceiro que a enganou no mês 1.
  • A Solução (O "Bloco de Notas"): Para vencer, a IA precisa usar um rascunho (scratchpad). É como um caderno onde ela escreve: "Não confie na empresa X, eles são trapaceiros!" ou "O funcionário Y é o melhor para pesquisa".
  • A Descoberta: O estudo mostrou que quem usa o caderno de anotações ganha. As IAs que não escrevem no caderno esquecem as lições e repetem os mesmos erros até falir.

3. Quem Ganhou? (Os Resultados)

Os autores testaram 12 "cérebros" de IA diferentes (os modelos mais famosos do mundo, como GPT-5, Claude, Gemini, etc.).

  • A Realidade Dura: De 12 modelos, apenas 3 conseguiram ficar ricos (terminaram com mais de $1 milhão). Os outros 9 faliram ou terminaram com menos dinheiro do que começaram.
  • O Campeão: O Claude Opus 4.6 foi o melhor, terminando com cerca de $1,27 milhão.
  • O Herói Econômico: O GLM-5 ficou em segundo lugar ($1,21 milhão), mas gastou 11 vezes menos dinheiro para rodar o teste. É como se ele fosse um Ferrari que roda com gasolina de carro popular: muito eficiente!
  • Os Perdedores: Muitos modelos (como o Grok e o Gemini Flash) caíram nas armadilhas dos clientes trapaceiros ou não souberam organizar a equipe, gastando todo o dinheiro em salários sem ter lucro.

4. Por que eles falharam? (As Armadilhas)

O estudo descobriu três motivos principais para a falência:

  1. Cegueira para Vilões: A IA aceita trabalhos de clientes que ela já deveria saber que são perigosos. É como entrar em uma loja onde você já foi roubado antes e achar que dessa vez será diferente.
  2. Má Gestão de Equipe: Mandar o cozinheiro dirigir o caminhão. A IA coloca o funcionário errado na tarefa errada, o trabalho atrasa e o cliente não paga.
  3. Falta de Ação: Algumas IAs escrevem no caderno: "Preciso parar de aceitar trabalhos da empresa X". Mas, no turno seguinte, elas ignoram a própria regra e aceitam o trabalho. É como um dieter que escreve "não coma chocolate" e logo depois come a barra inteira.

5. A Lição Final

O YC-Bench nos ensina que, embora as IAs sejam incríveis em responder perguntas rápidas, elas ainda têm dificuldade em pensar a longo prazo.

  • Planejamento vs. Reação: Elas são ótimas em reagir ao que está acontecendo agora, mas péssimas em planejar o que vai acontecer daqui a 6 meses.
  • A Memória é Tudo: Para uma IA ser um bom gerente de negócios, ela precisa ter um "caderno de anotações" e ser disciplinada em usá-lo. Sem isso, ela é apenas um funcionário distraído que comete os mesmos erros repetidamente.

Em resumo: O YC-Bench é como um teste de direção para IAs em uma estrada cheia de buracos. A maioria bateu o carro porque esqueceu de olhar o mapa (o caderno de anotações) ou não percebeu que o motorista do carro ao lado (o cliente trapaceiro) era perigoso. Apenas os mais espertos e organizados chegaram ao destino com o carro intacto e o bolso cheio.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →