← Últimos artigos
🤖 AI

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

Este artigo argumenta que as atuais estruturas de avaliação de LLMs baseadas em prompts estáticos são enganosas porque a otimização de prompts altera significativamente os rankings dos modelos, tornando necessária a otimização de prompts por modelo para identificar com precisão o melhor modelo para uma tarefa específica.

Autores originais: Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

Publicado 2026-05-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: A Armadilha do "Tamanho Único"

Imagine que você é um gerente de contratação tentando encontrar o melhor chef para seu restaurante. Você tem cinco chefs diferentes (vamos chamá-los de Modelo A, B, C, D e E). Para testá-los, você dá a todos o mesmo cartão de receita exato: "Faça um ensopado. Use sal, pimenta e cebola."

Você os observa cozinhando, prova o ensopado e os classifica. O Chef B vence. Você contrata o Chef B.

O problema: O Chef B é ótimo em seguir aquela receita específica, mas talvez o Chef D seja, na verdade, um gênio que só precisa que a receita seja escrita de forma ligeiramente diferente para brilhar. Talvez o Chef D precise que a instrução diga: "Refogue as cebolas primeiro, depois adicione o sal," para fazer seu melhor trabalho.

Este artigo argumenta que as formas atuais de testar modelos de IA (Modelos de Linguagem de Grande Escala) são como aquele gerente de contratação. Eles dão a cada IA exatamente o mesmo prompt estático (o cartão de receita) e as classificam com base em quem se sai melhor com aquele cartão específico.

Os autores afirmam que isso é enganoso. No mundo real, se você contratasse uma IA, não lhe daria apenas um prompt genérico; você ajustaria as instruções para obter o melhor desempenho daquela IA específica. Este artigo chama esse processo de Otimização de Prompt (OP).

O Experimento: Ajuste a Receita, Mude o Vencedor

Os pesquisadores pegaram cinco modelos de IA populares e os testaram em várias tarefas (como resolver problemas de matemática, responder perguntas de negócios ou extrair dados).

  1. Rodada 1 (O Jeito Antigo): Eles deram a cada modelo o mesmo prompt "base". Eles os classificaram.
  2. Rodada 2 (O Novo Jeito): Eles usaram uma ferramenta automatizada para "ajustar" o prompt para cada modelo individualmente. Eles perguntaram à IA: "Como podemos reescrever as instruções para que você as entenda melhor?" e depois reexecutaram os testes.

O Resultado: As classificações mudaram completamente.

  • Em alguns casos, o modelo que ficou em último lugar na Rodada 1 saltou para o primeiro lugar na Rodada 2.
  • O modelo que era o "melhor" no teste antigo não era necessariamente o melhor quando recebia instruções adaptadas ao seu cérebro específico.

A Analogia: É como testar corredores em uma pista.

  • Método Antigo: Você faz todos correrem com botas pesadas. O Corredor A vence porque está acostumado a botas pesadas.
  • Método Novo: Você dá ao Corredor A tênis leves e ao Corredor B órteses personalizadas. De repente, o Corredor B vence.
  • Conclusão: Se você os testasse apenas com botas pesadas, teria contratado o corredor errado para uma maratona.

Principais Conclusões do Estudo

1. O "Melhor" Modelo Depende do Prompt
O artigo descobriu que o "vencedor" de uma competição muda dependendo de como as instruções são escritas. Se você quiser escolher a melhor IA para um trabalho específico, deve primeiro otimizar as instruções para aquela IA específica. Se não o fizer, pode escolher um modelo que na verdade é medíocre para suas necessidades.

2. Modelos Diferentes Reagem Diferentemente
Assim como as pessoas, diferentes IAs têm "personalidades" ou sensibilidades diferentes.

  • Alguns modelos (como o Modelo B no estudo) eram muito sensíveis a mudanças no prompt. Um pequeno ajuste fazia com que eles se saíssem muito melhor.
  • Outros modelos já eram tão bons em uma tarefa específica (como roteamento simples) que ajustar o prompt não ajudava muito, ou às vezes até os confundia.

3. O "Crítico" Pode Ficar Confuso
Os pesquisadores usaram uma IA "crítica" (GPT-4o) para ajudar a reescrever os prompts para os outros modelos. Geralmente, isso funcionava muito bem. No entanto, às vezes o crítico ficava muito esperto ou as instruções se tornavam complexas demais, fazendo com que o modelo falhasse.

  • Exemplo: Em um caso, o prompt otimizado dizia à IA para "pensar passo a passo" tantas vezes que ela começou a responder às perguntas de exemplo no prompt em vez da pergunta real do teste. Era como um aluno lendo as respostas do teste de prática em voz alta em vez de fazer a prova.

O Que Isso Significa para Você (O Profissional)

Se você é uma empresa tentando escolher uma IA para fazer um trabalho (como responder e-mails de clientes ou analisar documentos), não execute apenas um benchmark padrão.

O artigo conclui que, para encontrar o modelo verdadeiramente melhor para sua tarefa específica, você deve:

  1. Pegue sua tarefa.
  2. Experimente diferentes modelos.
  3. Otimize o prompt para cada modelo individualmente para ver do que eles são verdadeiramente capazes.
  4. Depois, escolha o vencedor.

Se você pular a etapa 3 e usar apenas um prompt genérico, provavelmente estará tomando uma decisão de contratação ruim com base em um teste enganoso.

Resumo

O artigo é um aviso: Não julgue um peixe pela sua habilidade de subir em uma árvore, e não julgue uma IA pela sua habilidade de seguir um prompt genérico. Para saber quem é verdadeiramente o melhor, você precisa falar a língua deles. Se você não otimizar o prompt para cada modelo, seus resultados de avaliação provavelmente estarão errados, e você pode acabar com a ferramenta errada para o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →