← Últimos artigos
🤖 AI

PromptPex: Automatic Test Generation for Language Model Prompts

Este artigo apresenta o PromptPex, uma ferramenta baseada em LLM que extrai automaticamente especificações de prompts para gerar e avaliar testes unitários diversos, identificando regressões e vulnerabilidades específicas de modelos de forma mais eficaz e precisa do que os métodos de linha de base existentes.

Autores originais: Reshabh K Sharma, Jonathan De Halleux, Shraddha Barke, Dan Grossman, Benjamin Zorn

Publicado 2026-02-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Reshabh K Sharma, Jonathan De Halleux, Shraddha Barke, Dan Grossman, Benjamin Zorn

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você escreveu um conjunto de instruções muito específico para um robô chef. Você diz ao robô: "Pegue esta frase, encontre a palavra 'maçã' e diga-me se é um substantivo ou um verbo. Mas aqui está o detalhe: apenas me dê a palavra 'substantivo' ou 'verbo'. Não adicione conversa fiada, nada de 'Aqui está a resposta', e nem explicações."

No mundo do software, essa instrução é chamada de prompt. Assim como o código, os prompts são usados para construir aplicações. Mas, ao contrário do código tradicional, que roda da mesma maneira todas as vezes em um computador específico, os prompts são executados por "Grandes Modelos de Linguagem" (LLMs) — pense neles como diferentes chefs com personalidades diferentes. Um chef (Modelo A) pode seguir suas instruções perfeitamente. Outro chef (Modelo B) pode se confundir e dizer: "A resposta é: Substantivo, porque maçãs são frutas."

Essa diferença cria uma dor de cabeça para os desenvolvedores. Se eles mudarem o chef (trocarem de modelo) ou ajustarem levemente as instruções, o robô pode começar a cuspir o formato errado, quebrando toda a aplicação.

Apresentando o PromptPex: O "Inspetor de Prompts"

O artigo apresenta uma ferramenta chamada PromptPex. Pense no PromptPex como um inspetor de controle de qualidade super inteligente e automatizado que ajuda você a testar suas instruções antes de contratar um novo chef.

Veja como ele funciona, usando uma analogia simples:

1. A Extração do "Livro de Regras"

Primeiro, o PromptPex lê suas instruções desordenadas em linguagem natural e as traduz em um Livro de Regras rigoroso, em tópicos.

  • Seu Prompt: "Retorne apenas a etiqueta. Se não conseguir fazer isso, diga 'Desconhecido'."
  • O Livro de Regras do PromptPex:
    1. A saída deve ser apenas a etiqueta (sem palavras extras).
    2. Se a palavra não puder ser etiquetada, a saída deve ser a palavra "Desconhecido".

Ele faz isso pedindo a uma IA muito avançada que analise seu prompt e diga: "Ok, quais são as regras rígidas aqui?" Isso ajuda o desenvolvedor a ver se suas instruções são realmente claras ou se são ambíguas (como a confusão "substantivo vs. explicação" mencionada anteriormente).

2. O Gerador de "Teste de Estresse"

Uma vez que possui o Livro de Regras, o PromptPex torna-se um engenheiro de testes malicioso. Ele não pede apenas ao robô chef para cozinhar uma refeição normal; ele tenta enganar o chef para que ele quebre as regras.

  • O Teste "Normal": Ele pede uma frase padrão.
  • O Teste "Inverso": Esta é a parte inteligente. O PromptPex cria uma "regra inversa" em sua mente. Se a regra é "Dê-me apenas a etiqueta", a regra inversa é "Dê-me a etiqueta mais uma longa explicação". Ele então gera um caso de teste projetado para ver se o chef acidentalmente segue a regra errada.

Ele cria centenas desses cenários complicados, garantindo que as entradas de teste ainda sejam válidas (como uma frase real), mas projetadas para expor fraquezas.

3. O "Juiz"

Finalmente, o PromptPex executa esses testes em diferentes modelos de IA (os diferentes chefs). Ele então usa outra IA como um "Juiz" para analisar os resultados.

  • O chef seguiu o Livro de Regras?
  • Ele adicionou conversa fiada extra?
  • Ele falhou em dizer "Desconhecido" quando deveria ter dito?

O objetivo não é ver se o chef é "inteligente"; o objetivo é ver se o chef obedeceu às regras. Se o chef falhar no teste, o PromptPex o sinaliza.

Por que isso é importante?

O artigo testou esta ferramenta em 22 prompts diferentes usando quatro modelos de IA diferentes. Eles compararam o PromptPex contra uma IA padrão que apenas tenta adivinhar bons testes sem um Livro de Regras estrito.

Os Resultados:

  • O PromptPex foi melhor em encontrar erros. Ele gerou testes que fizeram os modelos de IA quebrarem suas regras com muito mais frequência do que a ferramenta padrão fez.
  • Ele revela as diferenças entre os modelos. Mostrou claramente que alguns modelos são melhores em seguir instruções estritas do que outros. Por exemplo, um modelo pode ser ótimo em uma tarefa de "Classe Gramatical", enquanto outro pode falhar constantemente nela.
  • Ajuda os desenvolvedores a corrigirem seus prompts. Ao mostrar exatamente onde as instruções eram ambíguas (por exemplo, "O modelo achou que era permitido adicionar uma explicação porque você não proibiu explicitamente"), ajuda os desenvolvedores a reescreverem seus prompts para serem mais claros.

A Conclusão

O PromptPex é como um corretor ortográfico para lógica. Ele não verifica apenas erros de digitação; ele verifica se suas instruções são claras o suficiente para serem seguidas por diferentes cérebros de IA imprevisíveis. Ele ajuda os desenvolvedores a garantir que, ao mudar de um modelo de IA para outro, sua aplicação não comece de repente a cuspir lixo porque o novo modelo interpretou uma instrução vaga de forma diferente.

Os autores descobriram que, ao transformar instruções vagas em um "Livro de Regras" estrito e, em seguida, testar o estresse dessas regras, eles conseguiram capturar mais bugs e entender suas ferramentas de IA muito melhor do que apenas tentando adivinhar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →