← Últimos artigos
🤖 AI

Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking

Este artigo introduz o Índice de Sensibilidade de Formato (FSI) e o Índice de Sensibilidade de Analisabilidade (PSI) para demonstrar que pequenas diferenças de formatação em wrappers de prompts causam variações significativas de pontuação dependentes do modelo e falhas de conformidade, argumentando que a precisão do benchmarking sem considerar essa variância é estatisticamente frágil.

Autores originais: Deep Pankajbhai Mehta

Publicado 2026-07-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Deep Pankajbhai Mehta

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um juiz em um show de talentos, mas, em vez de ouvir os cantores, você só tem permissão para ler as letras deles. Agora, imagine que alguns cantores são instruídos a escrever suas letras em uma folha de papel comum, enquanto outros são forçados a escrevê-las dentro de uma caixa JSON chique e rígida, e outros ainda devem envolver suas palavras em um sanduíche de "BEGIN/END".

Você esperaria que o talento do cantor permanecesse o mesmo, certo? A música não deveria mudar só porque o papel mudou. Mas, de acordo com este estudo de Deep Pankajbhai Mehta, da Adobe, é exatamente isso que acontece com os modelos de IA. O "papel" (o wrapper do prompt) importa tanto que pode inverter todo o ranking, fazendo um gênio parecer um novato e um novato parecer um gênio.

A Grande Mudança de Formato
Os pesquisadores realizaram um experimento massivo, gerando 140.000 respostas de quatro modelos diferentes de IA (variando de 7 bilhões a 72 bilhões de "células cerebrais") em sete tarefas de perguntas e respostas. Eles testaram cinco estilos diferentes de "wrapper":

  1. Plain (Simples): Apenas a resposta.
  2. JSON: Formato de código de computador estrito.
  3. Structured (Estruturado): Pares de chave-valor.
  4. Structured with Delimiters (Estruturado com Delimitadores): Pares de chave-valor com tags especiais como <BEGIN ANSWER>.
  5. Deliberate (Deliberado): Um rascunho para pensar, seguido pela resposta.

O resultado? Os modelos foram incrivelmente sensíveis a essas regras de formatação. Para alguns modelos, mudar o wrapper fez com que sua precisão oscilasse drasticamente. Um modelo, o Phi-4, foi uma total diva dramática: sua precisão saltou absurdamente 0,763 (uma variação enorme) apenas ao mudar o wrapper. Em contraste, o gigante Qwen-2.5-72B foi um astro relaxado, quase não se movendo, com uma oscilação de apenas 0,024.

O Problema do "Você Consegue Ler Isso?"
Por que as pontuações mudaram tanto? O artigo sugere que não foi porque a IA ficou subitamente mais inteligente ou mais burra em relação às perguntas reais. Foi, na maior parte, um problema de conformidade.

Pense nisso como uma máquina de vendas que só aceita moedas. Se você tentar inserir uma nota de um dólar (mesmo sendo um dólar válido), a máquina a rejeita. No estudo, quando a IA tentava seguir uma regra JSON estrita, mas acidentalmente adicionava um delimitador de código markdown (como o símbolo ```), a máquina (o extrator de respostas) não conseguia ler. A resposta era marcada como "não analisável" (unparseable), o que contava como uma resposta errada.

Os dados mostram uma forte ligação: quando a IA falhava em ser "analisável" (legível por máquina), sua precisão frequentemente desabava para perto de zero. O modelo Phi-4, usando o wrapper JSON estrito, produziu saídas começando com um delimitador de código markdown em 85,3% das gerações, resultando em uma analisabilidade de apenas 2,8% e uma precisão de 0,7%. Os pesquisadores descobriram que a "analisabilidade" era um grande preditor de sucesso, explicando cerca de 82% das diferenças restantes nas pontuações após considerar o modelo e a tarefa.

O Que Isso Significa para o Futuro
O artigo argumenta que reportar um único número de precisão para uma IA é como reportar uma única temperatura sem dizer se é em Fahrenheit ou Celsius — é enganoso. Se a escolha do wrapper pode mudar uma pontuação em 0,76, esse número único é "estatisticamente frágil".

Os autores sugerem que, ao testar IAs, não devemos apenas escolher um wrapper e torcer pelo melhor. Em vez disso, devemos:

  • Reportar a faixa de pontuações entre diferentes wrappers (como um "índice de sensibilidade").
  • Verificar se as respostas são realmente analisáveis.
  • Ter cuidado ao usar formatações estritas em aplicativos do mundo real, a menos que a IA seja forçada a seguir as regras pelo seu decodificador (a parte que gera o texto), e não apenas pelo prompt.

A Conclusão
Este estudo não diz que a IA está quebrada; diz que nossa fita métrica está bamba. O "Índice de Sensibilidade de Formato" (FSI) e o "Índice de Sensibilidade de Analisabilidade" (PSI) são novas ferramentas para medir o quanto a pontuação de um modelo depende do wrapper. As descobertas sugerem que, para alguns modelos, a escolha do wrapper é mais importante do que a própria inteligência do modelo. Até que resolvamos isso, a "melhor" IA em um ranking pode ser apenas aquela que teve a sorte de gostar do estilo de formatação específico da pessoa que construiu o teste.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →