Predicting Performance of Symbolic and Prompt Programs with Examples
Este artigo propõe o RAP, um framework de previsão de desempenho que aproveita tarefas semelhantes recuperadas e programas de prompt para construir um prior aproximado, abordando efetivamente a não confiabilidade da programação de LLMs ao distinguir sua distribuição de desempenho difusa da natureza "tudo ou nada" dos programas simbólicos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um gestor de contratação tentando decidir se um novo funcionário está pronto para um grande trabalho. Você tem dois tipos de candidatos: O Robô (um programa simbólico, como código Python) e O Freelancer Criativo (um programa de prompt, que é uma instrução dada a uma IA para realizar uma tarefa).
O artigo faz uma pergunta simples: Se ambos os candidatos passarem em alguns pequenos testes práticos, podemos confiar neles para fazer o trabalho real?
Os autores dizem: Sim para o Robô, mas talvez não para o Freelancer. Eis o porquê, usando a própria lógica e analogias do artigo.
1. Os Dois Tipos de "Programas"
- O Robô (Programa Simbólico): É como uma calculadora rigorosa. Se você disser "2 + 2", ele deve dizer "4". Ele segue regras rígidas. Se ele passar em um teste, é porque seguiu as regras perfeitamente.
- O Freelancer (Programa de Prompt): É como pedir a um artista inteligente, mas ligeiramente imprevisível, para "desenhar um gato". Você dá ao artista um prompt (instruções). O artista pode desenhar um gato ótimo, um gato estranho ou um cachorro. Mesmo que ele passe em alguns testes práticos, pode ser apenas sorte, ou as instruções podem estar ligeiramente inadequadas para o mundo real.
2. O Modelo de "Lançamento de Moeda"
Os autores imaginam que, toda vez que o programa executa um teste, é como lançar uma moeda.
- Cara: O programa acerta.
- Coroa: O programa erra.
O objetivo é adivinhar o "peso" da moeda. É uma moeda justa (50/50)? Ou é uma moeda viciada que sempre cai em Cara (100% de sucesso)?
3. A Grande Descoberta: A "Forma" do Passado
Antes mesmo de olharmos para os resultados dos testes, os autores analisaram a história de milhares desses programas para ver como seus "pesos de moeda" geralmente se parecem. Eles encontraram duas formas muito diferentes:
A História do Robô (Tudo ou Nada):
Imagine um histograma de todos os programas Robô. Ele parece com dois picos altos nas extremidades.- Pico 1: A maioria dos Robôs é perfeita (100% de sucesso).
- Pico 2: A maioria dos Robôs está quebrada (0% de sucesso).
- O Meio: Quase nada. Os Robôs raramente ficam "ok". Eles são ou perfeitos ou falham completamente.
- Analogia: É como um interruptor de luz. Está ou LIGADO ou DESLIGADO.
A História do Freelancer (A Nuvem Difusa):
Imagine um histograma de todos os programas Freelancer. Ele parece uma nuvem larga e plana no meio.- Há muitos programas que estão "quase certos" (70%, 80%, 90%).
- Há muito poucos que são perfeitos, e muito poucos que são falhas totais.
- Analogia: É como um dimmer de luz. A maioria dos freelancers está em algum lugar no meio, variando em brilho.
4. Por Que Alguns Testes Enganam Você
Essa diferença explica por que alguns testes aprovados são enganosos para o Freelancer, mas tranquilizadores para o Robô.
- Para o Robô: Se você vê ele passar em 3 testes, você sabe que ele provavelmente é um desses picos "perfeitos". Como o "meio-termo" (onde ele poderia ser apenas ok) não existe, passar em alguns testes é uma garantia forte de que ele continuará funcionando.
- Para o Freelancer: Se você vê ele passar em 3 testes, pode ser apenas um desses programas "quase certos" que teve sorte. Como há uma enorme nuvem de programas "quase certos", passar em alguns testes não prova que ele será perfeito depois. Ele pode facilmente falhar no próximo.
5. A Solução: RAP (A Ferramenta de "Busca por Similaridade")
Como não podemos confiar em alguns testes para o Freelancer, os autores criaram uma ferramenta chamada RAP (Retrieved Approximate Prior).
Pense no RAP como um bibliotecário inteligente.
- O Problema: Você tem um novo prompt de Freelancer e alguns resultados de testes. Você não sabe se é bom.
- A Biblioteca: O RAP tem uma biblioteca massiva de outros prompts e tarefas que foram tentados antes.
- A Busca: O RAP olha para seu novo prompt e pergunta: "Quem na biblioteca é mais parecido com você?" Ele encontra outros prompts que resolveram problemas semelhantes.
- A Previsão: Em vez de chutar com base em uma regra genérica, o RAP olha para como esses prompts semelhantes se saíram no passado. Ele constrói um "mapa de chutes" personalizado (um prior) especificamente para seu prompt.
- A Atualização: À medida que você executa mais testes, o RAP atualiza sua previsão.
O Resultado: O RAP é muito melhor em prever se um Freelancer terá sucesso do que apenas chutar ou olhar para a biblioteca inteira de uma vez. Ele se adapta ao tipo específico de tarefa que você está fazendo.
Resumo
- Robôs (Código) são binários: eles são ou perfeitos ou quebrados. Alguns testes provam que eles são perfeitos.
- Freelancers (Prompts) são variáveis: eles são frequentemente "quase bons". Alguns testes não provam que eles são confiáveis.
- RAP corrige isso olhando para exemplos passados semelhantes para fazer um chute mais inteligente sobre o quão bem um novo prompt funcionará, em vez de depender apenas de algumas execuções de teste sortudas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.