← Últimos artigos
💬 NLP

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

Este artigo apresenta o ArxivRoll, um quadro de avaliação dinâmico inspirado na criptografia de bloco de uso único que utiliza um benchmark semestral automatizado gerado a partir de artigos recentes do ArXiv para quantificar e mitigar a superestimação por modelos de linguagem de grande escala causada por contaminação de dados e viés de treinamento.

Autores originais: Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

Publicado 2026-05-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Teste "Com Livro Aberto"

Imagine que você é um professor tentando testar o quanto seus alunos são inteligentes. Você lhes dá uma prova de matemática padrão. Mas os alunos secretamente memorizaram as respostas daquela prova específica a partir de um guia de estudos que encontraram online.

Quando fazem a prova, eles tiram 100% nas questões que memorizaram. Mas, se você fizer uma nova questão de matemática que eles nunca viram antes, eles podem falhar.

Isso é exatamente o que está acontecendo com os Grandes Modelos de Linguagem (LLMs) (como a IA com a qual você conversa).

  • A Trapaça: Muitos modelos de IA estão sendo treinados com dados que incluem as respostas de testes populares (benchmarks) usados para medir sua inteligência.
  • O Resultado: Eles não estão realmente "aprendendo" ou "raciocinando"; estão apenas recitando respostas que já viram antes. Isso faz com que pareçam mais inteligentes do que realmente são, levando a comparações injustas entre diferentes empresas de IA.

A Solução: ArxivRoll (O Teste "One-Time Pad")

Os pesquisadores da Universidade Politécnica de Hong Kong criaram um novo sistema chamado ArxivRoll para pegar esses trapaceiros. Eles se inspiraram em um conceito da criptografia chamado "One-Time Pad".

A Analogia: A Chave Secreta Descartável
Na criptografia, um "One-Time Pad" é uma chave secreta usada para criptografar uma mensagem. A regra é: Use a chave uma vez e depois jogue-a fora. Se você usar a mesma chave duas vezes, o segredo é comprometido.

O ArxivRoll aplica essa regra aos testes:

  1. Ingredientes Frescos: Em vez de usar questões de teste antigas e estáticas, eles geram novos testes a cada seis meses usando artigos de pesquisa totalmente novos do ArXiv (um site onde cientistas postam seus trabalhos mais recentes e não publicados).
  2. O Teste "Não Visto": Como esses artigos são tão novos, nenhuma IA já os viu durante seu treinamento. É como dar a um aluno uma prova baseada em um livro que foi impresso ontem.
  3. Usar e Descartar: Uma vez que o teste termina, as respostas são tornadas públicas para que todos possam verificar o trabalho, mas as questões específicas do teste são marcadas como "expiradas" e nunca mais usadas. Isso garante que nenhuma IA futura possa memorizá-las.

Como o Teste Funciona: O Jogo "Preencha as Lacunas"

Para criar esses testes automaticamente (sem precisar que humanos escrevam milhares de questões), eles usam um método chamado SCP (Sequenciamento, Cloze e Previsão). Pense nisso como uma versão de alto nível de um "Mad Libs" ou de um quebra-cabeça:

  • Sequenciamento: A IA recebe um parágrafo onde as frases estão embaralhadas como um baralho de cartas. Ela tem que colocá-las na ordem correta.
  • Cloze: A IA recebe um parágrafo com algumas frases faltando (mascaradas). Ela tem que escolher a frase certa para preencher a lacuna a partir de uma lista de opções.
  • Previsão: A IA lê uma história e tem que adivinhar qual será a próxima frase, escolhendo entre quatro opções diferentes.

Como essas questões são geradas aleatoriamente a partir de texto fresco, a IA não pode apenas "memorizar" o padrão; ela realmente precisa entender a lógica.

O Placar: "Pontuações Rugged"

O artigo introduz uma nova maneira de pontuar esses modelos chamada Pontuações Rugged (RS). Imagine que você está julgando um corredor:

  • Pontuação Pública: Quão rápido ele corre na pista onde treinou (os testes antigos e contaminados).
  • Pontuação Privada: Quão rápido ele corre em uma trilha totalmente nova e desconhecida (o teste ArxivRoll).

A Pontuação Rugged mede a lacuna entre essas duas.

  • Baixa Pontuação Rugged: O corredor teve desempenho similar em ambas as pistas. Ele está genuinamente em forma.
  • Alta Pontuação Rugged: O corredor foi super rápido na pista de treino, mas lento na nova trilha. Isso significa que ele estava "trapaceando" memorizando a pista de treino.

O Que Eles Encontraram

Os pesquisadores testaram muitos modelos de IA populares (como Llama, Qwen, GPT e Claude) usando esse novo sistema.

  1. A "Superestimação" é Real: Muitos modelos que pareciam gênios nos rankings públicos caíram significativamente no ranking quando testados nos novos testes privados e frescos do ArxivRoll.
  2. Alguns Modelos Estão "Super-treinados": Eles descobriram que alguns modelos foram especificamente ajustados para esmagar tipos específicos de questões (como matemática ou finanças), mas falharam miseravelmente em outras. É como um aluno que só estudou para a prova final de história, mas foi reprovado no teste de ciências.
  3. A Lacuna é Enorme: Para alguns modelos, a diferença entre sua "Pontuação Pública" e "Pontuação Privada" foi massiva, provando que uma grande parte de sua inteligência relatada era, na verdade, apenas memorização.

Resumo

O artigo argumenta que fomos enganados pelos benchmarks de IA. Ao usar um sistema que atualiza constantemente suas questões com pesquisas novas e não vistas (ArxivRoll) e mede a lacuna entre testes antigos e novos (Pontuações Rugged), eles podem ver quanto da "inteligência" de uma IA é real e quanto é apenas trapaça. É uma maneira de garantir que, quando dizemos que uma IA é inteligente, ela realmente é inteligente, e não apenas boa em memorizar o teste.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →