← Últimos artigos
💬 NLP

Towards Execution-Grounded Automated AI Research

Este artigo apresenta um framework de execução automatizada que verifica e refina ideias de pesquisa geradas por LLMs por meio de experimentos em GPU paralelos em larga escala, demonstrando que a busca evolutiva guiada por execução descobre efetivamente métodos superiores de pré-treinamento e pós-treinamento, ao mesmo tempo em que revela as limitações do aprendizado por reforço e a saturação precoce dos LLMs de fronteira neste contexto.

Autores originais: Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

Publicado 2026-01-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma equipe de cientistas brilhantes, mas inexperientes, que conseguem conceber milhares de ideias selvagens e criativas sobre como construir um robô melhor. O problema é que a maioria dessas ideias é como desenhos de projetos feitos em guardanapos: parecem convincentes, mas se você tentar construí-las, elas desmoronam ou não servem para nada útil.

Este artigo é sobre a construção de uma fábrica robótica que pode testar instantaneamente esses esboços em guardanapos para ver quais realmente funcionam e, em seguida, ensinar os cientistas a desenhar melhores projetos com base nesses resultados de teste.

Aqui está como eles fizeram isso, dividido em etapas simples:

1. A Configuração: A "Fábrica de Ideias"

Os pesquisadores construíram um sistema automatizado massivo com três partes principais:

  • O Sonhador (Ideador): Uma IA que gera ideias de pesquisa em inglês comum (ex: "Mudar a forma como o robô aprende matemática").
  • O Construtor (Implementador): Um sistema inteligente que lê a ideia em inglês do Sonhador e escreve instantaneamente o código de computador real para construí-la.
  • O Testador (Executor): Um enorme armazém de supercomputadores (GPUs) que executa o código. Se o código funcionar, ele dá uma pontuação (como uma nota de prova). Se o código falhar, ele dá zero.

Eles testaram esta fábrica em dois "campos de treinamento" específicos:

  1. Ensinar um robô a aprender mais rápido (Pré-treinamento).
  2. Ensinar um robô a ficar melhor em problemas de matemática (Pós-treinamento).

2. O Primeiro Teste: A IA consegue construir suas próprias ideias?

Antes de ensinar a IA a aprender, eles tiveram que verificar se a IA conseguia sequer construir o que imaginava.

  • O Resultado: Surpreendentemente, sim! Quando pediram a modelos de IA de alto nível para gerar ideias, a fábrica conseguiu construir e testar cerca de 90% delas.
  • A Surpresa: Mesmo sem nenhum treinamento especial, as ideias de "melhor palpite" da IA já eram melhores do que os pontos de partida padrão. É como um aluno que, no seu primeiro dia de aula, desenha o projeto de um carro que dirige mais rápido que o ônibus escolar.

3. Método Um: A "Busca Evolutiva" (Seleção Natural)

Os pesquisadores tentaram ensinar a IA a melhorar usando um método semelhante à evolução na natureza.

  • Como funciona: A IA gera 50 ideias. A fábrica testa as ideias. Os "vencedores" (as ideias que obtiveram pontuações altas) são mantidos. A IA é então solicitada a criar 50 novas ideias misturando e combinando as melhores partes dos vencedores, enquanto também tenta algumas ideias completamente novas e selvagens, só por precaução.
  • A Analogia: Imagine um chef provando 50 sopas. Ele mantém as 5 melhores, então pede à cozinha para fazer 50 novas sopas que são pequenas melhorias sobre essas 5, além de algumas novas combinações de sabores malucos.
  • O Resultado: Isso funcionou incrivelmente bem. Em apenas 10 rodadas deste processo, a IA encontrou uma maneira de ensinar o robô de matemática que era significativamente melhor do que a linha de base dos especialistas humanos. Ela também encontrou uma maneira de treinar o robô de aprendizado que era quase duas vezes mais rápida que o método padrão.
  • A Ressalva: A IA ficou muito boa nisso, mas pareceu atingir um "teto" rapidamente. Ela parou de melhorar muito depois de um tempo, e apenas um modelo de IA específico continuou melhorando constantemente.

4. Método Dois: Aprendizado por Reforço (O Estudante "Movido por Notas")

Em seguida, eles tentaram uma abordagem diferente: Aprendizado por Reforço (RL). Isso é como treinar um cachorro com petiscos.

  • Como funciona: A IA gera ideias, recebe uma pontuação (recompensa) e o sistema usa matemática para ajustar o cére-IA para que ela tenha mais probabilidade de gerar ideias com pontuações altas na próxima vez.
  • O Resultado: A pontuação média da IA subiu. Ela começou a escrever ideias mais "seguras" que geralmente obtêm uma nota de aprovação.
  • O Problema (O "Loop Tedioso"): A melhor pontuação da IA não subiu. Na verdade, a IA começou a ficar preguiçosa. Ela percebeu que duas ideias muito simples e chatas (como "trocar um tipo de regra matemática por outra") sempre obtinham uma nota decente. Então, ela parou de tentar algo novo e apenas repetiu essas duas ideias repetidamente.
  • A Analogia: Imagine um estudante que percebe que escrever três frases sobre "O céu é azul" sempre lhe garante um C+. Em vez de tentar escrever uma obra-prima para tirar um A+, ele apenas escreve "O céu é azul" 50 vezes. Ele consegue uma nota média mais alta, mas nunca produz nada brilhante. Os pesquisadores chamam isso de "Colapso de Modo" (Mode Collapse).

5. O Que Eles Aprenderam?

  • A evolução funciona melhor para a descoberta: Se você quer encontrar um avanço (a melhor ideia possível), deixar a IA evoluir ideias misturando e combinando as vencedoras é muito melhor do que apenas recompensar a IA por ser "boa na média".
  • A IA fica preguiçosa com recompensas: Se você apenas recompensar a IA por obter uma nota de aprovação, ela parará de assumir riscos e se prenderá a ideias simples e seguras. Ela para de "pensar" profundamente (o "rastro de pensamento" encurtou) e apenas repete o que funciona.
  • O Futuro: O sistema provou que podemos automatizar o teste de ideias de pesquisa de IA. No entanto, para obter descobertas verdadeiramente revolucionárias, precisamos ensinar a IA não apenas a tirar boas notas, mas a continuar explorando ideias novas, arriscadas e complexas sem ficar presa em um loop de respostas seguras e entediantes.

Em resumo: Eles construíram uma fábrica que pode testar instantaneamente ideias de IA. Eles descobriram que deixar as ideias "evoluírem" cria avanços, mas simplesmente recompensar a IA pelo bom desempenho a torna preguiçosa e repetitiva.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →