Instruction fragility under hidden operational requirements
Este artigo demonstra que as instruções em linguagem natural são frágeis sob requisitos operacionais ocultos, revelando que, embora o prompting genérico falhe em satisfazer restrições omitidas, o desempenho melhora significativamente quando essas restrições são explicitamente elicitadas e executadas.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
O Problema Central: O "Gênio" que Entende Tudo Errado
Imagine que você tem um Gênio mágico (a IA) que realiza seus desejos. Você diz: "Torne-me rico".
O Gênio poderia interpretar isso de mil maneiras:
- Ele poderia te dar um emprego legítimo.
- Ele poderia imprimir dinheiro falso.
- Ele poderia hackear um banco.
- Ele poderia mudar a definição de "riqueza" para que você seja rico em "felicidade", mas pobre em dinheiro vivo.
O artigo argumenta que, quando você dá uma instrução curta para uma IA, você está essencialmente dando uma lista de desejos com itens faltando. Você pode pensar que quer "riqueza legítima", mas não disse "nada de atividades ilegais" ou "nada de erros bancários". Como você não disse, a IA é livre para escolher qualquer versão de "riqueza" que se encaixe nas palavras que você usou.
Os autores chamam isso de "Fragilidade de Instrução". A instrução é frágil porque quebra facilmente quando a IA adivinha a versão errada das suas regras ocultas.
O Experimento: O Jogo da "Regra Secreta"
Para testar isso, os pesquisadores criaram um jogo com 100 tarefas diferentes (como escrever um e-mail, resumir um relatório ou planejar uma viagem).
- O Prompt Visível: É o que o usuário vê e digita (ex: "Escreva um resumo deste artigo").
- Os Requisitos Ocultos: São regras secretas conhecidas apenas pelos pesquisadores (os "avaliadores"), não pela IA. Exemplos incluem: "Deve ter menos de 50 palavras", "Deve incluir um aviso de risco", "Deve estar no formato JSON" ou "Não deve usar a palavra 'certamente'".
A IA tinha que seguir o prompt visível e adivinhar as regras ocultas perfeitamente. Se ela falhasse em sequer uma regra oculta, a tarefa era considerada um fracasso total.
Os Resultados: Adivinhar vs. Perguntar
Os pesquisadores testaram a IA sob diferentes condições para ver quão bem ela conseguia lidar com essas regras ausentes.
1. O Palpite de "Tentativa Única" (2,7% de Sucesso)
- Analogia: Você diz a um chef: "Faça-me um sanduíche" e vai embora. Você não diz "sem cebola", "use pão de fermentação natural" ou "corte ao meio".
- Resultado: A IA acertou apenas 2,7% das vezes. Ela quase sempre errou as regras ocultas.
2. O "Template Genérico" (7,3% de Sucesso)
- Analogia: Você entrega ao chef um "Formulário de Pedido de Sanduíche" padrão que tem campos para "Pão" e "Carne", mas você ainda não preencheu o campo específico "Sem Cebola".
- Resultado: Um pouco melhor, mas ainda majoritariamente errado. Formulários genéricos não resolvem a falta de detalhes específicos.
3. A "Conversa Falsa" (1,7% de Sucesso)
- Analogia: Você pergunta ao chef: "Você tem alguma regra especial?" e o chef responde: "Não, apenas faça um sanduíche".
- Resultado: Isso não ajudou em nada. Apenas conversar sem obter a informação correta é inútil.
4. O "Esclarecimento Verdadeiro" (8,0% de Sucesso)
- Analogia: Você força o chef a fazer perguntas específicas de um menu (ex: "Você quer formato JSON?"). O chef pergunta, e você diz "Sim".
- Resultado: Ainda muito baixo. A IA foi ruim em descobrir quais perguntas deveria fazer. Ela fez as perguntas erradas ou esqueceu as críticas.
5. O "Oráculo" (A Folha de Cola) (64,7% de Sucesso)
- Analogia: Você entrega ao chef uma folha de cola que lista todas as regras ocultas antes de ele começar a cozinhar.
- Resultado: O sucesso saltou para 64,7%. Isso prova que, se a IA conhece as regras, ela consegue segui-las muito melhor.
A Grande Lição:
O problema não é que a IA é burra; o problema é que ela não consegue ler sua mente. Quando você esconde as regras, a IA falha. Quando você diz explicitamente as regras para a IA, ela tem sucesso. No entanto, mesmo com a folha de cola, ela ainda falhou cerca de 35% das vezes, o que significa que, mesmo quando a IA sabe as regras, ela às vezes esquece de segui-las perfeitamente.
Por Que Isso Importa (A Teoria dos "Conjuntos")
O artigo usa um conceito matemático sofisticado para explicar isso de forma simples:
- Pense na sua instrução como uma rede.
- A rede captura muitos resultados possíveis (execuções).
- Você quer que a IA capture apenas os resultados "bons" (aqueles que você realmente deseja).
- Se sua rede for muito larga (porque você não especificou as regras), ela captura resultados "ruins" também (como transferências ilegais ou formatos errados).
- Segurança significa encolher a rede até que ela capture apenas as coisas boas. Você não consegue fazer isso a menos que diga explicitamente à IA o que excluir.
Resumo dos "Modos de Falha"
O artigo detalha por que a IA falhou:
- Informação Ausente: A IA não conhecia as regras (O maior problema).
- Más Perguntas: A IA fez as perguntas erradas para encontrar as regras.
- Erros de Execução: Mesmo quando a IA conhecia as regras, ela às vezes esquecia de escrevê-las corretamente.
Conclusão
Se você quer que uma IA realize um trabalho de forma segura e correta, você não pode apenas dar um comando vago e esperar que ela "entenda". Você deve declarar explicitamente as restrições ocultas (como contagem de palavras, formatos e limites de segurança). Prompts genéricos e conversas genéricas não são suficientes; você precisa elicitar e confirmar especificamente as regras ausentes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.