← Últimos artigos
💬 NLP

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

Este artigo revela uma "ilusão de benchmark" onde modelos de linguagem de grande escala podados parecem competentes em avaliações de múltipla escolha, mas falham na geração de texto aberto porque a poda rebaixa as respostas corretas em vez de apagá-las, sugerindo que modelos comprimidos devem ser testados em suas capacidades generativas em vez de apenas em suas habilidades de reconhecimento.

Autores originais: Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

Publicado 2026-06-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um bibliotecário brilhante e culto (um Modelo de Linguagem de Grande Escala) que sabe a resposta para quase qualquer pergunta. Para economizar dinheiro e espaço, você decide "podar" a biblioteca. Você remove uma enorme parte dos livros e prateleiras, mantendo apenas os mais essenciais.

O artigo sobre o qual você está perguntando investiga o que acontece quando você testa essa biblioteca encolhida.

A "Ilusão do Múltipla Escolha"

Aqui está o truque: quando você faz uma pergunta ao bibliotecário, você pode testá-lo de duas maneiras:

  1. A Pergunta Aberta: Você pergunta: "Quem descobriu os Açores?" e espera que ele diga a resposta de memória.
  2. O Teste de Múltipla Escolha: Você pergunta: "Quem descobriu os Açores? A) 1427, B) 1500, C) 1600, D) 1700."

O artigo encontrou uma "ilusão" surpreendente. Após a poda, o bibliotecário frequentemente falha na Pergunta Aberta. Ele pode dizer: "Eu acho que foi no século XV", o que é vago ou incorreto. Mas, se você der a ele o teste de Múltipla Escolha, ele gabarita. Ele imediatamente aponta para "1427" e acerta.

Os benchmarks padrão (os testes usados para avaliar IA) geralmente dependem do formato de Múltipla Escolha. Isso cria uma falsa sensação de segurança. O teste diz: "Sua biblioteca ainda está perfeita!", mas, na realidade, o bibliotecário perdeu a capacidade de recordar a resposta sem ajuda. Ele ainda consegue reconhecer a resposta se você a mostrar a ele, mas não consegue produzi-la por conta própria.

A Teoria da "Rebaixamento" vs. "Apagamento"

Os autores fizeram uma pergunta crítica: a poda apagou o conhecimento (o bibliotecário esqueceu o fato inteiramente) ou apenas rebaixou o conhecimento (o bibliotecário ainda sabe o fato, mas ele não é mais sua primeira opção)?

Eles descobriram que é majoritariamente rebaixamento.

Pense na mente do bibliotecário como uma sala cheia de ideias. Antes da poda, a resposta correta estava bem na porta da frente, acenando para você. Após a poda, a resposta correta ainda está na sala, mas foi empurrada para a terceira ou quarta fileira.

  • Decodificação Gananciosa (O ajuste padrão): O bibliotecário olha apenas para a pessoa que está na porta da frente. Como a resposta correta agora está na fileira 3, o bibliotecário escolhe a pessoa errada que está na frente.
  • Múltipla Escolha: Você entrega ao bibliotecário uma lista de pessoas na sala. Mesmo que a pessoa certa esteja na fileira 3, o bibliotecário ainda consegue vê-la na lista e escolhê-la.

Como Corrigir o "Rebaixamento"

Como o conhecimento não foi apagado, apenas empurrado para trás, o artigo mostra que você pode frequentemente recuperar a resposta com um pouco de ajuda:

  • Busca Mais Ampla: Em vez de olhar apenas para a porta da frente (decodificação gananciosa), se você disser ao bibliotecário para olhar para as 5 melhores pessoas na sala (Beam Search) ou fazer alguns palpites (Sampling), eles encontrarão a resposta correta novamente.
  • Uma Pequena Dica: Se você der ao bibliotecário um exemplo de como responder a uma pergunta semelhante (um exemplo "in-context"), isso o ajuda a empurrar a resposta correta de volta para a frente da fila.

A Ressalva

Este efeito de "rebaixamento" acontece muito, especialmente com modelos maiores e idiomas nos quais o modelo é bom. No entanto, o artigo observa que, para modelos menores ou idiomas muito difíceis, a poda às vezes realmente apaga o conhecimento completamente. Nesses casos, mesmo que você mostre a lista ao bibliotecário, ele não consegue encontrar a resposta porque ela se foi.

A Conclusão

O artigo nos alerta a não confiar demais nos escores de "Múltipla Escolha" ao julgar modelos de IA comprimidos. Um modelo pode parecer perfeito em um teste onde você fornece as respostas, mas falhar miseravelmente quando um usuário real faz uma pergunta direta. Para saber se um modelo comprimido é realmente útil, precisamos testar o que ele consegue produzir por conta própria, não apenas o que ele consegue reconhecer quando seguramos o gabarito diante dele.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →