← Últimos artigos
🤖 AI

Can Generalist Agents Automate Data Curation?

Este artigo apresenta o Curation-Bench para demonstrar que, embora agentes de codificação generalistas possam automatizar o ciclo de curadoria de dados e igualar os modelos de referência existentes, alcançar políticas de dados de nível de pesquisa e superiores requer um suporte que force os agentes a citar e adaptar métodos anteriores em vez de depender de prompts abertos.

Autores originais: Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

Publicado 2026-06-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um estudante brilhante, mas inexperiente (um modelo de IA), a resolver quebra-cabeças complexos. Você tem uma biblioteca enorme de 665.000 problemas de prática, mas só tem tempo para dar 10.000 a ele. A questão é: Como você escolhe os melhores 10.000?

No passado, os humanos tinham que fazer isso manualmente. Eles adivinhavam quais problemas eram bons, testavam o estudante, viam onde ele falhava e depois ajustavam sua lista. Era lento, caro e exaustivo.

Este artigo pergunta: Um agente de computador inteligente (um "Agente Generalista") pode fazer esse trabalho por nós? Ele pode agir como um assistente de pesquisa que seleciona os dados, treina o modelo, verifica os resultados e tenta novamente de forma automática?

Aqui está a história do que eles descobriram, usando algumas analogias simples.

1. A Configuração: O "Concurso de Culinária"

Os pesquisadores construíram uma cozinha especial chamada CURATION-BENCH.

  • O Chef (O Agente): Um IA inteligente que consegue ler arquivos, escrever código e executar comandos.
  • Os Ingredientes (Os Dados): Uma pilha enorme de receitas misturadas (imagens e texto).
  • As Regras: O agente não pode mudar a temperatura do forno (o código de treinamento) ou o painel de juízes (os testes). A única coisa que o agente pode mudar é quais ingredientes ele coloca na panela.
  • O Objetivo: Criar um pequeno lote de 10.000 ingredientes que faça o prato ter um sabor tão bom quanto um prato feito com os 665.000 originais.

2. A Primeira Tentativa: "O Cozinheiro Intuitivo"

Os pesquisadores deixaram os agentes cozinharem com prompts abertos. Eles basicamente disseram: "Vá em frente, escolha as melhores 10.000 receitas que conseguir encontrar".

O Resultado: Os agentes foram surpreendentemente bons no básico.

  • Eles rapidamente perceberam que apenas pegar receitas aleatórias era ruim.
  • Eles começaram a ajustar a mistura: "Vamos adicionar mais receitas de culinária e menos problemas de matemática", ou "Vamos garantir que tenhamos instruções longas e detalhadas o suficiente".
  • A Analogia: Pense nisso como um cozinheiro caseiro que conhece o básico. Ele não precisa de um livro didático para saber que, se a sopa estiver muito salgada, deve adicionar mais água. Os agentes conseguiram "ajustar" a receita ajustando botões simples (como a proporção de diferentes fontes de dados).
  • O Limite: Eles ficaram presos em uma rotina. Eles continuavam ajustando a mesma receita repetidamente (ex: "Talvez 60% culinária, 40% matemática? Não, talvez 55/45?"). Eles raramente pensavam em tentar um estilo de cozinha completamente diferente, como "E se reescrevermos as receitas em vez de apenas escolhê-las?".

3. O Problema: "A Lacuna de Execução"

Os agentes eram excelentes executores (podiam rodar o ciclo e seguir instruções), mas péssimos pesquisadores (não sabiam como explorar novas ideias).

Mesmo quando os pesquisadores lhes deram uma lista de "técnicas de culinária legais" ou uma pilha de "livros de receitas famosos" (artigos científicos), os agentes os ignoraram na maior parte do tempo. Eles diziam: "Vou tentar amostragem de diversidade!" em suas notas, mas na prática apenas mudavam a proporção dos ingredientes novamente. Eles estavam presos na "otimização local" — ajustando a mesma área pequena em vez de explorar toda a cozinha.

4. A Solução: "O Subchef Estrito" (Scaffolding/Andaime)

Para corrigir isso, os pesquisadores introduziram Scaffolds (Andaimes). Pense neles como regras estritas ou rodinhas de treinamento que forçam o agente a pensar como um verdadeiro cientista.

Eles tentaram dois tipos:

  • Scaffolds Leves: "Ei, aqui estão algumas técnicas legais que você poderia tentar." (Isso fez os agentes falarem sobre mais ideias, mas eles continuaram cozinhando da mesma forma).
  • Scaffolds Pesados: "Antes de mudar a receita, você deve citar um livro de receitas específico, explicar exatamente por que está usando essa técnica e mostrar como a adaptou aos seus ingredientes."

A Grande Descoberta:
Os Scaffolds Pesados funcionaram como mágica.

  • Os agentes pararam de apenas ajustar proporções. Eles começaram a ler os "livros de receitas" (artigos científicos) e a implementar de fato estratégias complexas e novas.
  • Um agente descobriu um método chamado EL2N (que é como escolher as receitas com as quais o aluno mais teve dificuldade, mas depois filtrar aquelas que estavam apenas quebradas ou confusas).
  • O Resultado: Este agente "com scaffold" criou um conjunto de dados de 10.000 exemplos que teve um desempenho melhor do que os modelos base criados por humanos que usaram 100.000 exemplos. Eles alcançaram o mesmo (ou melhor) resultado com um décimo dos dados.

5. A Grande Conclusão

O artigo conclui que:

  1. Agentes podem rodar o ciclo: Eles são ótimos em realizar o trabalho repetitivo de testar e ajustar.
  2. Mas eles precisam de um guia: Sem regras estritas que os forcem a citar evidências e adaptar métodos específicos, eles ficam presos em um modo de "verificação de vibração" (vibe check), fazendo mudanças pequenas e seguras em vez de grandes descobertas.
  3. Computação é o novo dado: Se você não consegue obter mais dados, pode gastar mais "tempo de computador" (iterações) procurando a maneira perfeita de usar os dados que você já possui.

Em resumo: Você pode dar a uma IA inteligente o trabalho de curadoria de dados, mas se quiser que ela seja uma verdadeira pesquisadora e não apenas alguém que faz ajustes, você deve fornecer um checklist rigoroso que a force a aprender com descobertas passadas em vez de apenas adivinhar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →