← Últimos artigos
🤖 AI

When Mean CE Fails: Median CE Can Better Track Language Model Quality

Este artigo demonstra que a entropia cruzada mediana frequentemente supera a entropia cruzada média padrão no acompanhamento da qualidade de modelos de linguagem em cenários como aprendizado de fatos sintéticos e destilação top-K, pois ela se correlaciona melhor com o desempenho da tarefa ao focar no volume da distribuição em vez de ser distorcida por valores atípicos na cauda.

Autores originais: Hao Guo, Simon Dennis, Rivaan Patil, Kevin Shabahang

Publicado 2026-05-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hao Guo, Simon Dennis, Rivaan Patil, Kevin Shabahang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um professor corrigindo uma redação de um aluno. Normalmente, você calcula a nota "média" para decidir o desempenho do aluno. Se a nota média sobe, você assume que o aluno está melhorando.

Este artigo argumenta que, para modelos de linguagem de IA, a nota "média" (chamada de Entropia Cruzada Média) pode ser uma terrível mentirosa. Às vezes, a média sobe (sugerindo que a IA está piorando), mesmo que a IA esteja, na verdade, escrevendo histórias melhores ou respondendo perguntas com mais precisão.

Abaixo está uma explicação simples do porquê isso acontece e do que os autores sugerem em vez disso, usando algumas analogias criativas.

1. O Problema: A "Média" é Facilmente Enganada

No mundo da IA, medimos o quão bom é um modelo observando sua "perda" (uma pontuação onde valores menores são melhores). A maneira padrão de fazer isso é calcular a Média de todos os erros que o modelo comete.

A Analogia: O Efeito da "Uma Maçã Podre"
Imagine uma cesta com 100 maçãs.

  • 99 maçãs estão perfeitas.
  • 1 maçã está podre e cheira terrivelmente mal.

Se você calcular a "frescura média" da cesta, essa única maçã podre puxa toda a pontuação para baixo. A cesta parece ruim, mesmo que 99% dela esteja perfeita.

O artigo descobre que os modelos de IA frequentemente agem como essa cesta. Durante o treinamento, o modelo fica muito bom em prever as palavras "normais" (as 99 maçãs perfeitas). Mas ele começa a cometer erros estranhos e de alta taxa de erro em algumas palavras raras e difíceis (a 1 maçã podre).

  • A Média vê a maçã podre e diz: "O modelo está piorando!"
  • A Realidade é que o modelo está, na verdade, ficando melhor no trabalho que deveria fazer.

2. A Solução: A "Mediana" é a Contadora da Verdade

Em vez da média, os autores sugerem usar a Mediana.

A Analogia: O "Filho do Meio"
Se você alinhar todas as maçãs da melhor para a pior, a Mediana é a que fica exatamente no meio.

  • Em nossa cesta de 100 maçãs, a 50ª maçã está perfeita.
  • A maçã podre está no final da fila.
  • A Mediana não se importa com aquela única maçã podre. Ela diz que a maçã "típica" na cesta está fresca.

O artigo mostra que, quando observam a pontuação da Mediana em vez da Média, ela corresponde perfeitamente ao desempenho real da IA em tarefas (como contar uma história ou recordar fatos).

3. Dois Exemplos do Mundo Real do Artigo

Os autores testaram isso em dois cenários diferentes:

Cenário A: O Aluno "Super-Treinado" (Modelo Qwen)

  • O que aconteceu: Eles ensinaram a IA uma lista de fatos inventados.
  • A Armadilha: À medida que continuavam o treinamento, a IA melhorava nos fatos, mas começava a ficar confusa em algumas estruturas de frase muito específicas e estranhas.
  • O Resultado: A pontuação da Média subiu (parecendo ruim), mas a Mediana permaneceu baixa (parecendo boa). As pontuações reais dos testes (o quão bem ela memorizou os fatos) seguiram a Mediana, não a Média. A Média estava apenas reagindo a aquelas poucas frases confusas.

Cenário B: A Destilação "Top-K" (TinyStories)

  • O que aconteceu: Eles tentaram ensinar uma IA pequena a copiar uma IA grande, mas disseram à IA pequena para prestar atenção apenas nas top 5 palavras mais prováveis que a IA grande escolheria (ignorando o resto).
  • A Armadilha: Isso fez a IA pequena ficar muito confiante em palavras comuns (ótima Mediana), mas péssima em palavras raras (ruim Média).
  • O Resultado: Quando humanos (ou outras IAs atuando como juízes) liam as histórias, eles adoraram as histórias da aluna "Top-5". Ela era a melhor contadora de histórias. Mas, se você olhasse a pontuação da Média, parecia a pior aluna. A pontuação da Mediana identificou corretamente que ela era a melhor.

4. A Verificação de "Concordância": Quando Confiar na Média

Os autores introduzem um conceito chamado Concordância. Pense nisso como uma verificação de "acordo da equipe".

  • Alta Concordância: A Média, a Mediana e o "percentil 95" (o pior cenário) concordam sobre qual é o melhor modelo. Neste caso, a Média é adequada para uso.
  • Baixa Concordância: A Média diz "O Modelo A é o melhor", mas a Mediana diz "O Modelo B é o melhor". Isso é um sinal de alerta! Significa que a distribuição de erros mudou de forma (como a cesta de maçãs).

O Conselho do Artigo:
Não reporte apenas a pontuação média. Reporte um pequeno conjunto de pontuações:

  1. A Média (a média).
  2. A Mediana (o caso típico).
  3. O Percentil 95 (a cauda do pior cenário).

Se esses três números contarem histórias diferentes, você sabe que a "média" está mentindo para você. Você deve confiar na Mediana para escolher o modelo que realmente terá melhor desempenho em tarefas do mundo real.

Resumo

  • Entropia Cruzada Média (Média): Pode ser enganada por alguns erros ruins. É como julgar toda uma classe com base em um único aluno que reprovou em um teste difícil.
  • Entropia Cruzada Mediana (Meio): Ignora os valores extremos e diz como o "token" típico está se saindo. Acompanha o desempenho do mundo real muito melhor.
  • A Correção: Sempre verifique a pontuação do "Meio" junto com a pontuação da "Média". Se elas discordarem, a pontuação do "Meio" é geralmente aquela em que você deve confiar para escolher o melhor modelo de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →